尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

LLM智能体在复杂规则环境中的决策挑战:以PTCG-Bench基准为例

LLM智能体在复杂规则环境中的决策挑战:以PTCG-Bench基准为例 1. 项目概述当LLM智能体遇上宝可梦卡牌最近在AI智能体研究圈里一个叫“PTCG-Bench”的项目引起了我的注意。它的标题很有意思“LLM智能体能否精通宝可梦集换式卡牌游戏” 这听起来像是一个极客的奇思妙想但背后其实指向了一个非常严肃且前沿的研究方向如何为大型语言模型智能体构建一个复杂、多模态、且具备严格规则约束的决策环境来真正考验它们的推理、规划和长期策略能力。简单来说PTCG-Bench是一个基准测试。它把风靡全球的宝可梦集换式卡牌游戏Pokémon Trading Card Game简称PTCG的完整规则和游戏状态封装成了一个可供LLM智能体进行对战的模拟环境。研究者们不再只是让AI回答选择题或写代码而是让它们像真正的训练师一样组建卡组、在回合制对战中出牌、计算伤害、管理能量、运用宝可梦的特性与训练家卡目标是击败对手。这比下围棋或打星际争霸更“刁钻”因为PTCG的规则文本极其复杂卡牌效果千变万化且信息是不完全公开的对手的手牌和牌库是未知的这要求智能体必须具备强大的规则理解、状态跟踪、概率计算和欺骗/反欺骗策略。为什么是宝可梦卡牌首先它拥有一个庞大而忠实的玩家社群规则经过多年迭代已非常严谨这为构建高质量的模拟器提供了基础。其次它的状态空间巨大但离散非常适合用符号化的方式表示便于LLM处理。最重要的是它完美融合了多种挑战长程规划如何为几个回合后的强力招式储备能量、资源管理手牌、奖赏卡、弃牌区、不完全信息博弈以及对复杂规则文本的即时解析每张新抽到的卡牌效果都需要快速理解。对于想要突破当前LLM智能体在规划、工具使用和世界模型构建方面瓶颈的研究者来说PTCG-Bench提供了一个绝佳的沙盒。这个基准的目标用户很明确AI智能体领域的研究人员和开发者。它可以帮助他们评估不同LLM如GPT-4、Claude、Gemini在智能体架构下的能力差异测试新的提示工程、思维链、反思或工具调用策略甚至推动能理解游戏规则并自主决策的“通用游戏AI”的发展。对于我这个喜欢折腾AI和卡牌游戏的老玩家来说这无疑是一个令人兴奋的交叉点值得深入拆解一番。2. 基准核心设计从卡牌规则到AI可玩的环境构建PTCG-Bench远不止是把规则书丢给LLM那么简单。它涉及将人类自然语言描述的、充满例外和特殊情况的游戏规则转化为一个精确、稳定、可编程的模拟环境。这个过程本身就是一项复杂的系统工程。2.1 游戏状态的形式化与表示要让AI理解游戏第一步是将游戏状态“翻译”成它能处理的结构化数据。PTCG的状态非常丰富场地每位玩家场上的宝可梦活跃宝可梦与后备席、已附着的能量卡、特殊状态中毒、灼伤等、场地卡。手牌玩家当前持有的卡牌集合。牌库剩余可抽取的卡牌序列。弃牌区已使用或被打倒的宝可梦所在的区域。奖赏卡尚未获取的胜利目标。回合阶段抽卡、行动、攻击、结束等。在PTCG-Bench中这些状态很可能被编码为JSON或类似的嵌套数据结构。例如一只场上的“喷火龙”可能被表示为{ name: Charizard, hp: 180, remaining_hp: 180, attached_energy: [{type: Fire, count: 3}], attacks: [ {name: Fire Spin, damage: 180, energy_cost: [{type: Fire, count: 3}]} ], status: null, is_active: true }关键在于这个表示必须包含所有影响游戏逻辑的信息。LLM智能体接收到的“观察”就是当前回合、从自身视角看到的这个结构化状态对手的手牌和牌库会被隐藏或模糊化。2.2 规则引擎与裁判系统这是基准的核心组件一个无情的“裁判”。它需要做几件事验证动作合法性当智能体提出“让皮卡丘使用‘电击’攻击”时引擎会检查皮卡丘是否是活跃宝可梦是否附着了足够的电能量是否处于特殊状态而不能攻击本回合是否已经攻击过解析卡牌效果每张卡牌的文字描述如“从牌库搜索最多2张基本宝可梦卡加入手牌”需要被转换成可执行的逻辑。这里有两种思路一是为每张卡预编写代码逻辑这在基准构建初期对于固定卡池是可行的二是尝试让LLM自己解析描述但这就需要引擎能“理解”自然语言难度极大且容易出错破坏游戏公平性。PTCG-Bench很可能采用第一种方式确保规则的绝对精确。推进游戏状态执行合法动作计算伤害应用特殊状态如“中毒”在每个回合结束时扣血处理宝可梦被击倒后奖赏卡的获取检查胜利条件先取6张奖赏卡或使对手无可用宝可梦。处理随机性投硬币判定某些卡牌效果、抽卡的随机性都需要由引擎模拟。这个规则引擎的稳定性和准确性至关重要任何漏洞都会导致基准测试结果毫无意义。它必须像官方比赛裁判一样严格。2.3 智能体接口与动作空间LLM智能体如何与环境交互通常通过一个标准化的API。智能体接收当前游戏状态的观察可能是文本描述也可能是结构化数据然后输出一个“动作”。动作空间需要精心设计既要覆盖所有合法操作又不能过于庞大让LLM难以选择。一个合理的动作空间可能包括结束回合打出一张手牌指定手牌索引以及目标位置如放到后备席附着能量指定能量卡和目标的宝可梦使用宝可梦特性如果可用撤退活跃宝可梦指定支付能量的宝可梦和后备宝可梦交换使用训练家卡指定卡牌并可能提供目标选择发动攻击指定宝可梦和攻击招式智能体输出的可能是一个简单的动作代码如play_card, index2也可能是一段自然语言指令如 “Attach the Fire Energy from my hand to my active Charmander”后者需要环境具备更强的自然语言理解能力。PTCG-Bench需要在这两者之间做出权衡前者更稳定后者更能测试LLM的原始指令遵循能力。注意在构建这类基准时一个常见的陷阱是“动作空间泄露”。即智能体可能输出一个模糊或超纲的动作如果环境处理不当可能会意外允许一个非法操作或者崩溃。因此环境的鲁棒性对非法输入有明确的错误反馈和动作的明确边界必须严格定义。3. LLM智能体的挑战与策略设计将LLM接入PTCG-Bench环境后真正的挑战才刚刚开始。一个原始的、仅通过提示词驱动的LLM在面对如此复杂的游戏时表现往往会非常糟糕。它可能会忘记规则做出明显不合法的提议或者缺乏长线策略只顾眼前。因此我们需要为LLM设计一套“智能体架构”来增强它的游戏能力。3.1 核心挑战拆解信息过载与状态跟踪游戏状态信息量大且不断变化。LLM的上下文窗口有限如何让它记住关键信息如对手弃牌区有哪些宝可梦、自己牌库还剩多少张牌、对手可能的手牌组合是一大难题。它需要一种“工作记忆”机制。规则理解与合规性虽然规则引擎会驳回非法操作但如果智能体持续提出非法动作会浪费交互次数并暴露其理解缺陷。理想情况是智能体能在内部进行“预判”只生成合法或高概率合法的动作。不完全信息下的推理对手的手牌和牌库是未知的。智能体需要根据对手的行动例如他迟迟不攻击可能是在积攒能量他频繁使用搜索卡可能在找关键组件来推测其策略和手牌构成即构建一个“对手模型”。长程规划与资源管理PTCG的胜利往往依赖于多个回合的铺垫。例如先让一只宝可梦在后台积累能量同时用另一只宝可梦在前场拖延时间。LLM需要评估不同行动路径的长期价值而不是追求单回合的最大伤害。卡牌文本的即时解析即使卡池固定智能体在抽到一张新卡时也需要快速理解其效果并评估其在本回合局势下的价值。这要求LLM具备强大的指令理解和情境分析能力。3.2 智能体架构设计思路为了应对上述挑战一个典型的LLM智能体架构可能包含以下模块1. 状态处理器这个模块负责接收原始的游戏状态结构化数据并将其转化为对LLM更友好的格式。它可能做以下几件事摘要与聚焦不是把所有状态细节都塞给LLM。例如将后备宝可梦的完整信息简化为“后备席一只满血妙蛙种子草能量x1一只残血杰尼龟无水能量”。只突出关键变化和威胁。历史记录维护一个精简的行动历史最近3-5个回合双方的主要动作帮助LLM理解游戏进程。概率提示计算并提示一些关键概率如“牌库中还剩20张牌其中可能有2张你急需的‘高级球’搜索卡”辅助LLM决策。2. 规划与反思模块这是智能体的“大脑”。它可能采用分层或循环的思考过程回合目标设定LLM首先分析局势设定本回合的宏观目标。例如“对手的活跃宝可梦血量很低我本回合的首要目标是击倒它获取奖赏卡。次要目标是给我的主力喷火龙贴上能量。”动作序列生成基于目标LLM规划一个粗略的动作序列。例如“1. 使用‘博士的研究’丢弃手牌抽7张新牌以寻找更多能量。2. 如果抽到火能量则附着给喷火龙。3. 让活跃的喷火龙使用‘火焰旋涡’攻击。”合规性自检在输出最终动作前LLM可以对自己规划的动作进行“沙盘推演”用自然语言描述执行步骤并检查是否有违反规则之处例如“我需要确认喷火龙是否有3个火能量才能攻击”。这可以通过让LLM扮演规则裁判来实现。事后反思在每个回合结束后让LLM简要分析上回合行动的得失以及对手行动可能透露的信息并更新其策略。这有助于从错误中学习。3. 工具调用集成为了让LLM的计算更精确可以为其集成外部工具。例如伤害计算器一个简单的函数输入攻击力、对手宝可梦的抵抗力/弱点、特殊状态等输出最终伤害值。LLM只需调用calculate_damage(attacker, attack, defender)而不用自己进行容易出错的算术。概率计算器计算抽到关键卡的概率。规则查询一个封装好的规则问答工具当LLM对某个交互有疑问时如“中毒状态在回合间如何结算”可以主动查询。4. 策略模板与提示工程对于PTCG这样的游戏人类玩家的经验可以转化为高效的提示词。开局模板提示LLM在游戏初期优先执行一些标准操作如“前两回合优先铺场放置基础宝可梦到后备席并利用搜索卡寻找进化链或能量。”威胁评估指南教LLM如何评估威胁“优先攻击能对你主力宝可梦造成弱点加成的对手宝可梦优先击倒已经积累了大量能量的宝可梦。”资源管理原则“手牌数量是重要资源谨慎使用需要丢弃手牌的支援者卡能量是稀缺资源优先附着给有终结比赛能力的宝可梦。”通过这样的架构我们将一个原始的LLM武装成了一个具备记忆、规划、工具使用和领域知识辅助的“半专业”PTCG玩家智能体。4. 评估体系如何衡量LLM智能体的“精通”程度构建基准的最终目的是评估。PTCG-Bench需要一套科学、全面、可量化的评估体系来回答“哪个智能体更强”以及“强在哪里”。4.1 核心评估指标评估不能只看胜率。一个靠运气赢了几局的笨智能体和一个策略精妙但运气稍差的智能体我们需要能区分开来。胜率最直观的指标。让智能体在大量对局例如1000局中相互对战或与固定水平的基准智能体如规则随机智能体、基于简单规则的智能体对战计算其获胜百分比。这是衡量综合实力的黄金标准。Elo评分借鉴国际象棋的评级系统。通过智能体之间的对战胜负动态调整其Elo分数可以更精细地排名多个智能体的相对实力。一个稳定击败中级对手的智能体其Elo分会高于一个偶尔爆冷击败高手但经常输给新手的智能体。决策质量指标平均回合时长思考时间过长可能意味着决策效率低下或推理过程复杂。非法动作率智能体提出被规则引擎驳回的动作的比例。这个比率越低说明其对规则的理解和合规性控制越好。动作序列最优性这需要定义一个“最优”或“专家”模型作为参考。通过对比智能体的实际操作序列与专家模型在相同局面下推荐的操作序列的相似度如编辑距离、关键动作匹配度来评估其战术水平。例如在可以一击制胜的情况下智能体是否选择了正确的攻击目标。策略多样性识别通过分析智能体的大量对局记录可以聚类其常用的策略如快攻、控制、组合技。一个强大的智能体应该能根据对手和牌组灵活采用不同策略而不是死板地执行一套固定流程。泛化能力测试新卡牌/新牌组在训练或调试阶段使用的卡池之外引入全新的卡牌或预组牌组测试智能体能否快速适应并理解新卡的效果。对抗性测试设计一些特殊的、反直觉的牌组或局面测试智能体的鲁棒性和应对非常规情况的能力。4.2 基准测试的典型设置为了公平比较不同的LLM或智能体架构PTCG-Bench需要标准化的测试场景测试场景描述评估重点自我对弈同一智能体的两个副本相互对战。策略的稳定性和自我一致性。如果总是一方赢可能说明策略存在可被利用的固定模式。对阵固定基准所有待测智能体与同一个简单的规则基准智能体如“随机合法动作”智能体对战。衡量智能体超越随机行为的“基础智能”水平。循环锦标赛多个不同智能体进行循环赛。综合排名产生Elo评分最能体现相对强弱。人类对局复盘将真实人类高手的对局记录作为输入在关键决策点暂停让智能体做出选择然后对比其选择与人类的选择。评估智能体决策与人类专家思维的接近程度。消融实验关闭智能体的某个模块如反思模块、工具调用观察性能下降程度。评估各个模块如规划、工具使用对整体性能的贡献度。4.3 结果分析与洞察评估结果不能只停留在数字上。我们需要深入分析典型错误分析智能体最常犯的错误是什么是规则误解如忘记特殊状态效果是短视行为如为了小利浪费关键资源还是策略单一总是采用同一套开局能力边界地图智能体在哪些类型的对局中表现出色例如快攻对局在哪些类型中表现挣扎例如需要长线运营的组合技对局这有助于定位其能力短板。与模型规模/能力的关系比较不同参数量或不同家族的LLM如GPT-4 vs Claude vs 开源模型在相同智能体架构下的表现。这能揭示底层LLM的推理、规划和指令遵循能力如何影响上层智能体的性能。通过这样多维度的评估PTCG-Bench不仅能给出一个排名更能为我们提供一份关于“当前LLM智能体在复杂决策任务中究竟处于什么水平”的详细诊断报告。5. 实操构建一个简易的PTCG智能体原型理论说了这么多我们来点实际的。虽然完整的PTCG-Bench环境构建非常复杂但我们可以尝试设计一个极度简化的原型来体验一下核心流程。假设我们有一个已经构建好的、规则完备的PTCG模拟器API。5.1 环境准备与智能体框架我们使用Python并假设有一个ptcg_simulator的Python库它提供了以下关键接口env PTCGEnv(deck_list_a, deck_list_b)初始化一个环境传入两个玩家的卡组列表。observation, legal_actions env.get_state(player_id)获取指定玩家的观察结构化状态和当前所有合法动作列表。next_observation, reward, done, info env.step(player_id, action)执行一个动作返回新的状态、奖励如1表示获胜、是否结束、以及其他信息。我们的LLM智能体将基于OpenAI的API或其他兼容接口。智能体的核心循环如下import openai from ptcg_simulator import PTCGEnv class SimplePTCGAgent: def __init__(self, modelgpt-4, system_promptNone): self.client openai.OpenAI(api_keyyour_key) self.model model self.system_prompt system_prompt or self._default_system_prompt() self.conversation_history [{role: system, content: self.system_prompt}] def _default_system_prompt(self): # 这是一个简化的系统提示定义了智能体的角色和基本规则 return 你是一个宝可梦卡牌游戏PTCG的AI玩家。你将收到当前游戏状态的描述以及你可以执行的合法动作列表。你需要分析局势选择最优的一个动作并只输出该动作的编号或准确描述。游戏目标是击败对手获取6张奖赏卡。记住基本规则每回合只能附着一次能量活跃宝可梦才能攻击攻击后回合结束。 def get_action(self, observation_text, legal_actions_list): # 1. 构建用户消息将游戏状态和合法动作格式化后发给LLM user_message f当前游戏状态 {observation_text} 你可以执行的合法动作如下编号从0开始 {self._format_actions(legal_actions_list)} 请仔细分析局势选择你认为当前最优的一个动作。只输出你选择的动作编号不要有任何其他解释。 # 2. 将本轮消息加入历史可只保留最近几轮以节省token self.conversation_history.append({role: user, content: user_message}) # 3. 调用LLM response self.client.chat.completions.create( modelself.model, messagesself.conversation_history, temperature0.1, # 低温度保证决策稳定 max_tokens50 ) # 4. 解析响应提取动作 llm_output response.choices[0].message.content.strip() chosen_action self._parse_action(llm_output, legal_actions_list) # 5. 将LLM的响应也加入历史供其后续参考可选 self.conversation_history.append({role: assistant, content: llm_output}) return chosen_action def _format_actions(self, actions): formatted [] for i, action in enumerate(actions): formatted.append(f{i}: {action[description]}) # 假设动作有描述字段 return \n.join(formatted) def _parse_action(self, output, legal_actions): # 尝试从输出中提取数字 try: action_index int(output) if 0 action_index len(legal_actions): return legal_actions[action_index] # 返回动作对象 except ValueError: pass # 如果解析数字失败尝试匹配动作描述更鲁棒 for i, action in enumerate(legal_actions): if action[description] in output: return action # 如果都失败默认返回第一个合法动作或抛出错误 print(f警告无法解析LLM输出 {output}返回默认动作。) return legal_actions[0]5.2 核心循环与对局模拟有了智能体和环境我们就可以运行一个对局def run_match(agent_a, agent_b, deck_a, deck_b, max_turns50): env PTCGEnv(deck_a, deck_b) current_player 0 # 假设0是玩家A agents [agent_a, agent_b] for turn in range(max_turns): if env.is_done(): break # 获取当前玩家观察和合法动作 obs, legal_acts env.get_state(current_player) # 将结构化obs转换为文本描述这里需要一个转换函数 obs_text state_to_text(obs) # 智能体决策 agent agents[current_player] action agent.get_action(obs_text, legal_acts) # 环境执行动作 next_obs, reward, done, info env.step(current_player, action) # 检查游戏是否结束 if done: winner 0 if reward 0 else 1 # 简化处理 print(f游戏结束胜利者玩家{winner}) break # 切换到对手回合 current_player 1 - current_player if turn max_turns - 1: print(游戏达到最大回合数平局。)这个原型极度简化省略了state_to_text函数它需要将复杂的JSON状态转化为连贯的自然语言描述也假设了环境接口的存在。但它清晰地展示了LLM智能体与游戏环境交互的核心循环观察 - 思考LLM推理- 行动 - 反馈。5.3 性能优化与调试技巧在实际操作中你会立刻遇到几个问题Token消耗与成本每回合都调用LLM一场对局可能持续20-30回合成本很高。解决方案包括a) 使用更便宜的模型处理简单回合b) 精心设计提示词减少不必要的上下文c) 对状态描述进行极致压缩。响应稳定性LLM可能偶尔输出无法解析的格式。除了代码中的解析逻辑要鲁棒还可以在提示词中严格要求输出格式例如“必须只输出一个数字且该数字必须在0到N之间”。状态描述的挑战state_to_text函数是关键。好的描述应该突出重点、忽略无关细节、保持一致性。例如始终按照“活跃宝可梦 - 后备席 - 手牌数量 - 奖赏卡剩余 - 特殊状态”的顺序描述。可以尝试让LLM自己来总结状态但这样又会增加一次API调用。引入短期记忆上述简单智能体没有记忆每回合只看当前状态。你需要在SimplePTCGAgent类中维护一个精简的历史记录并在构建用户消息时将最近几回合的关键动作如“上回合对手使用‘宝贝龙’进化成了‘暴飞龙’”也包含进去。实操心得在原型阶段不要追求完美。先用一个极小的卡池比如只有10张不同的卡牌和简化规则比如去掉特殊状态、宝可梦特性来跑通整个流程。确保智能体能完成“抽卡-放置宝可梦-附着能量-攻击”的基本循环。然后再逐步增加复杂度。这能帮你快速定位问题是出在环境接口、状态表示、提示词还是LLM本身。6. 常见问题、局限性与未来展望在尝试复现或基于PTCG-Bench进行研究时你肯定会遇到一系列典型问题。这里我结合自己的理解和社区常见的讨论整理一份“避坑指南”。6.1 典型问题与排查思路问题现象可能原因排查与解决思路智能体持续输出非法动作1. 提示词未强调规则。2. 状态描述不清晰导致LLM误解。3. 合法动作列表格式混乱LLM难以匹配。1. 在系统提示中明确列出核心规则禁忌。2. 优化state_to_text增加规则提醒如“【提醒本回合你尚未附着能量可以附着一次】”。3. 简化动作列表使用唯一、清晰的ID或简短描述。智能体策略单一、重复1. LLM温度参数过低如0导致确定性过强。2. 提示词或状态描述无意中引导了固定模式。3. 智能体缺乏对历史决策的反思和多样化探索。1. 适当提高温度如0.3-0.7引入随机性。2. 在提示词中鼓励多样化策略如“尝试不同的战术”。3. 引入“探索-利用”机制偶尔随机选择合法动作以探索新策略。对局时间过长Token消耗巨大1. 每回合状态描述过于冗长。2. LLM思考过程如Chain-of-Thought太长。3. 网络或API延迟。1. 实现状态摘要功能只传递变化部分和关键信息。2. 限制LLM的回复长度或只在复杂决策时启用详细推理。3. 考虑使用本地化的小模型处理简单决策。智能体表现不稳定时好时坏1. LLM API本身存在响应波动。2. 游戏中的随机性抽卡影响过大。3. 智能体架构对某些罕见局面处理不佳。1. 增加对局次数用统计结果如平均胜率、Elo而非单局胜负评价。2. 在评估时使用固定的随机种子确保不同智能体面对相同的随机序列保证公平对比。3. 分析智能体在特定局面下的失败日志针对性加强提示或规则。无法处理新卡牌效果1. 卡牌效果逻辑硬编码在引擎中新卡未集成。2. LLM未见过新卡描述无法理解。1. 设计一个可扩展的卡牌效果描述语言让引擎能动态解析新增卡牌。2. 将新卡牌的文本描述直接放入状态信息中考验LLM的零样本理解能力。这是评估泛化性的重要部分。6.2 当前方法的局限性尽管PTCG-Bench想法很棒但基于当前LLM的智能体方法存在一些固有局限计算成本高昂高质量的决策需要大量的LLM调用和上下文交互这使得大规模训练或测试成本极高。可解释性黑盒我们很难理解LLM为什么做出某个特定决策。它可能基于一个我们未曾想到的精妙推理也可能只是基于训练数据中的某个模糊类比。缺乏真正的“理解”LLM可能通过模式匹配来“模仿”好的策略但并不真正理解“能量”、“进化”、“奖赏卡”这些概念在游戏世界中的因果联系。它的决策可能很脆弱在面对训练数据中未出现过的极端组合时容易崩溃。模拟与现实的差距模拟环境是完美的、确定性的除了随机抽卡。而真人对手会有表情、语气、犹豫等“元信息”这些是当前纯文本交互的智能体无法感知的。6.3 未来可能的演进方向PTCG-Bench的价值不仅在于评估现状更在于指引未来。学习型智能体当前主要是提示工程和架构设计。未来可以让智能体通过与自己或固定对手的大量对局进行强化学习从胜负奖励中自我改进而不仅仅依赖人类编写的提示词。世界模型集成让智能体内部构建一个对游戏状态的预测模型。例如预测“如果我下回合使用这张卡对手可能有哪些应对方式概率各是多少”这需要更强的推理和模拟能力。多模态输入未来的基准可以引入卡牌图像作为输入要求智能体从卡图中识别关键信息如攻击力、效果文字这更贴近人类玩家的真实体验。人机协作与教学研究智能体如何与人类玩家沟通协作例如作为教练提供建议或者如何通过观察人类对局来学习策略。成为更通用AI的测试床PTCG中蕴含的规划、推理、不完全信息处理等能力是迈向更通用人工智能所需的核心能力。在这个相对封闭但复杂的世界里取得的进展其方法论可以迁移到机器人控制、商业谈判等更广阔的领域。从我个人的实践来看像PTCG-Bench这样的复杂游戏基准其构建过程本身就是一个巨大的学习项目。它迫使你深入思考如何将模糊的人类知识转化为精确的计算机逻辑如何设计评估体系来衡量“智能”以及如何让大语言模型这个“统计天才”学会遵守规则并进行战略思考。无论最终LLM智能体能否真正“精通”宝可梦卡牌这个过程所催生的工具、方法和洞察都将在AI智能体发展的道路上留下深刻的印记。
返回列表