尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

多智能体推理与一致性验证提升医学选择题不确定性校准

多智能体推理与一致性验证提升医学选择题不确定性校准 1. 从“猜答案”到“会诊决策”医学选择题中的不确定性校准挑战在医疗诊断、医学教育和资格认证中医学多项选择题Medical MCQA无处不在。无论是执业医师资格考试还是临床辅助决策系统MCQA都是评估知识掌握和推理能力的关键形式。传统的AI模型包括早期的深度学习模型和如今的大语言模型LLM在处理这类问题时往往追求一个单一的、高置信度的“正确答案”。然而任何有经验的临床医生都会告诉你真实的医学决策充满了不确定性——影像上的一个阴影可能是炎症也可能是肿瘤一组症状可能指向多种疾病。模型给出一个答案的同时如果能准确地告诉我们它对这个答案有多“不确定”这个信息本身的价值有时甚至超过了答案本身。这就是“不确定性校准”的核心模型预测的置信度应当与其实际正确的概率相匹配。一个校准良好的模型当它说“我有90%的把握这是A病”时那么它在100次这样的判断中应该有大约90次是正确的。但现状是许多强大的LLM在MCQA任务上表现出“过度自信”或“自信不足”。它们可能以99%的置信度给出一个错误答案或者以60%的置信度给出一个实际上非常确定的正确答案。这种失准在医学领域是致命的它可能导致AI系统给出极具误导性的“确定性”建议或者让医生忽略掉AI其实很有把握的正确提示。为什么会出现这种情况一个关键原因在于标准的LLM推理过程是“单线程”的。模型接收到问题和选项基于其庞大的参数化知识进行一次前向传播输出一个答案和对应的概率或logits。这个过程缺乏自我质疑、交叉验证的机制就像一位医生不进行任何鉴别诊断看了一眼就下了结论。近年来Multi-Agent多智能体和Agent的框架为解决这个问题提供了崭新的视角。我们可以将单个LLM实例化为多个具有不同“角色”或“思维模式”的智能体。例如一个智能体负责从病理生理学角度推理一个负责从临床症状学角度分析另一个则专注于回顾类似的罕见病例。让这些智能体独立工作产生各自的答案和理由然后再引入一个Consistency Verification一致性验证的机制——比较、辩论、整合这些分散的观点。这个过程的精妙之处在于它不仅仅是为了得到一个更准确的最终答案更重要的是通过观察多个智能体推理结果之间的共识与分歧我们能够更精细地评估整个系统对当前问题的“把握度”。共识高则不确定性低分歧大则不确定性高。这种基于群体决策的不确定性度量比单个模型的输出概率更贴近人类专家会诊时的决策信心。因此标题《Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA》所指向的正是这样一条技术路径通过构建一个多智能体推理与验证系统来显著提升LLM在医学选择题场景下不确定性估计的准确性。这不仅仅是提高答题正确率更是迈向可信、可靠、可解释的医疗AI辅助决策的关键一步。接下来我将深入拆解这个框架的每一个核心环节从架构设计、智能体角色定义到一致性验证的具体算法再到如何将验证结果转化为校准后的不确定性指标并结合我个人的实验经验分享其中的关键实现细节与避坑指南。2. 构建医学多智能体推理系统的核心架构要实现多智能体推理首先需要一个稳固的架构来协调这些“虚拟专家”的工作。这个架构的设计直接决定了系统的效率、效果和可扩展性。一个典型的、经过实践验证的架构包含以下核心组件任务分发器、异构智能体池、推理工作流引擎以及一致性验证与聚合模块。2.1 智能体角色设计与异构化策略智能体的“异构性”是整个系统的价值源泉。如果所有智能体都一模一样那么它们的输出将是高度相关的一致性验证就失去了意义也无法捕捉到问题不同侧面的信息。在医学MCQA场景下我们可以从多个维度对智能体进行差异化设计知识领域特化这是最直接的策略。我们可以创建专注于不同医学子领域的智能体。病理生理学专家其系统提示System Prompt会强调“请从疾病的发病机制、病理变化角度进行推理”。对于一道关于心力衰竭的题目这个智能体会重点分析前负荷、后负荷、心肌收缩力等机制。临床症状学专家提示词侧重于“请基于主诉、症状、体征的鉴别诊断树进行分析”。对于同样的题目它可能更关注呼吸困难、水肿、颈静脉怒张等临床表现的组合与权重。影像/检验专家提示词引导模型专注于“请解读关键的实验室检查指标如BNP、肌钙蛋白和影像学发现如心脏超声的EF值”。循证医学专家提示词要求“请引用相关的临床指南、大规模临床试验结论作为推理依据”。推理策略特化即使知识背景相同我们也可以让智能体采用不同的推理策略。链式思维Chain-of-Thought智能体要求其按部就班地、显式地展示每一步推理。自我质疑Self-Questioning智能体在推理过程中必须主动提出至少两个可能的反论点或混淆点并尝试驳斥。少样本示例Few-Shot智能体在提示词中提供几个类似的、已解答的MCQA例子引导其进行类比推理。结构化输出智能体强制要求其以JSON等格式输出包含“最终答案”、“主要理由”、“备选答案”、“排除理由”等固定字段便于后续程序化处理。模型基底异构如果资源允许可以使用不同系列的LLM作为智能体基底。例如使用一个擅长逻辑推理的模型如GPT-4作为“逻辑专家”使用一个在生物医学文献上训练过的模型如BioMedLM作为“文献专家”。这种底层模型的差异能带来更根本的多样性。实操心得智能体提示词的设计是成败关键。它不能太笼统如“你是一个医学专家”也不能太僵化限制了模型的创造力。一个好的做法是结合“角色定义”、“核心任务”、“输出格式”和“禁忌”四部分。例如给病理生理学专家的提示词可以是“你是一位资深的病理生理学教授。你的核心任务是从疾病发生发展的根本机制层面分析以下医学选择题。请逐步推理重点阐述各选项涉及的病理生理过程为何支持或排除该诊断。你的输出必须包含‘推理过程’和‘结论选项字母’两部分。避免讨论治疗方案或流行病学。”2.2 任务分发与并行推理引擎当一个问题输入系统后任务分发器负责将其同时发送给智能体池中所有被激活的智能体。这里的关键是“并行”。为了降低延迟我们必须实现异步并发调用。在实际编码中我强烈推荐使用asyncio库Python环境来管理并发请求。为每个智能体定义一个异步函数该函数封装了对LLM API的调用包括构造提示词、处理上下文长度、解析响应等。然后使用asyncio.gather()来并发执行所有这些函数。import asyncio import aiohttp from typing import List, Dict class Agent: def __init__(self, name: str, system_prompt: str, api_config: Dict): self.name name self.system_prompt system_prompt self.api_config api_config async def query(self, question: str) - Dict: 异步查询LLM返回包含答案和推理的字典 full_prompt f{self.system_prompt}\n\n问题{question} # 这里使用aiohttp进行异步HTTP请求调用如OpenAI、Anthropic或本地LLM的API async with aiohttp.ClientSession() as session: payload { model: self.api_config[model], messages: [{role: system, content: self.system_prompt}, {role: user, content: question}], temperature: 0.3, # 较低的温度以获得更确定的推理 max_tokens: 1024 } async with session.post(self.api_config[endpoint], jsonpayload, headersself.api_config[headers]) as resp: result await resp.json() # 解析结果提取答案和推理文本 raw_answer result[choices][0][message][content] parsed_result self._parse_response(raw_answer) return {agent_name: self.name, answer: parsed_result[answer], reasoning: parsed_result[reasoning]} class MultiAgentSystem: def __init__(self, agents: List[Agent]): self.agents agents async def parallel_reasoning(self, question: str) - List[Dict]: 并行收集所有智能体的推理结果 tasks [agent.query(question) for agent in self.agents] results await asyncio.gather(*tasks, return_exceptionsTrue) # 处理可能的异常如某个智能体API调用失败 valid_results [] for r in results: if isinstance(r, Exception): print(fAgent query failed: {r}) continue valid_results.append(r) return valid_results这种并行架构能将原本串行调用N个智能体所需的 N * 单次响应时间缩短到大约等于最慢那个智能体的响应时间这对于构建实时或近实时系统至关重要。2.3 结果收集与标准化接口各个智能体返回的结果格式可能五花八门。有的可能直接输出“A”有的输出“答案是A”有的则在一大段文字里隐含了答案。因此一个强大的结果解析器是必需的。我们可以在每个智能体的定义中加入一个_parse_response方法或者使用一个统一的解析器结合正则表达式和关键词匹配从非结构化的文本中提取出最终答案选项如 ‘A’, ‘B’, ‘C’, ‘D’。推理过程文本。置信度分数如果智能体模型能提供的话如ChatGPT的logprobs。将所有结果标准化为统一的数据结构如Python字典或Pydantic模型是进行后续一致性验证的基础。这个步骤看似繁琐但能极大减少后续流程中的错误。在我的实践中我会为解析失败的结果设置一个默认处理策略例如标记为“无效”并记录日志而不是让整个系统因此崩溃。3. 一致性验证从分歧中量化不确定性收集到所有智能体的答案后我们就进入了一致性验证阶段。这一步的目标不是简单地“少数服从多数”投票而是通过分析答案的分布和推理的相似性来量化系统对当前问题的整体不确定性。以下是几种核心的验证与量化方法。3.1 基于答案分布的统计度量最直观的一致性度量来自于最终答案选项的分布。假设我们有K个智能体它们给出了K个答案可能重复。共识度Consensus Score计算得票最多的选项的票数占总票数的比例。公式为Consensus max(counts) / K。这个值介于1/K到1之间。值越高说明智能体间共识越强直观上系统的不确定性应该越低。熵Entropy使用信息熵来衡量答案分布的不确定性。公式为Entropy - Σ (p_i * log(p_i))其中p_i是选项i的得票比例。熵值越高说明分布越均匀分歧越大不确定性越高。当所有智能体答案一致时熵为0。基尼不纯度Gini Impurity另一个衡量分布不纯度的指标Gini 1 - Σ (p_i^2)。其性质与熵类似。这些统计量给出了一个宏观的、量化的“分歧程度”指标。但它们有一个明显的缺点完全忽略了智能体推理过程的质量。两个智能体可能都选了答案A但一个基于扎实的病理推理另一个可能是瞎猜的。这种“脆弱的共识”需要被识别。3.2 基于推理文本的语义一致性分析为了评估共识的“质量”我们需要深入分析智能体提供的推理文本。这里自然语言处理NLP技术派上了用场。嵌入向量与余弦相似度将每个智能体的推理文本通过一个句子嵌入模型如Sentence-BERT BGE转换为高维向量。然后计算所有智能体对之间推理向量的平均余弦相似度。平均相似度高意味着智能体们的“思考方向”是一致的即使最终答案可能因为细节理解不同而略有差异这种共识也是高质量的。关键主张提取与比对使用LLM本身或信息抽取模型从每段推理文本中提取出核心的医学主张或事实点例如“患者BNP升高提示心衰”、“胸痛向背部放射需警惕主动脉夹层”。然后比较不同智能体提取出的主张集合的重合度。重合的主张越多说明它们基于共同的证据基础。矛盾检测更进一步我们可以训练或提示一个LLM来扮演“辩论裁判”直接分析两段推理文本是否存在逻辑或事实上的矛盾。即使答案相同如果推理中存在根本性矛盾那么这种共识也是不可信的。避坑指南语义相似度计算对嵌入模型的选择非常敏感。通用领域的嵌入模型如text-embedding-ada-002在医学专业文本上可能表现不佳。务必使用在生物医学语料上训练过的嵌入模型如BAAI/bge-large-zh-v1.5中文或pritamdeka/S-PubMedBert-MS-MARCO英文。否则你可能得到毫无意义的相似度分数。3.3 构建综合不确定性分数最终我们需要将答案分布度量和语义一致性度量融合成一个综合的、标量的不确定性分数。这个分数应该与模型预测的错误概率正相关。一个简单而有效的融合方法是加权平均。例如Uncertainty_Score α * (1 - Consensus) β * (1 - Avg_Semantic_Similarity)其中α和β是超参数用于平衡两种度量的重要性。我们可以在一个有标注的验证集上不仅标注正确答案还可以请专家标注每道题的“难度”或“歧义性”通过网格搜索或优化算法来调整α和β使得Uncertainty_Score与模型的预测错误率之间的相关性如Spearman等级相关系数最大化。更高级的方法可以训练一个轻量级的回归模型如线性回归、梯度提升树以共识度、熵、平均语义相似度、最大票数等作为特征以模型在该样本上是否出错的0/1标签或连续化的错误概率作为目标来预测不确定性分数。这种方法能自动学习到特征间复杂的交互关系。4. 利用不确定性分数进行校准与决策支持得到了高质量的不确定性分数后我们如何利用它来改善系统的实用性和可靠性核心在于“校准”和“决策”。4.1 置信度-准确率曲线与校准图首先我们需要评估系统是否被校准了。我们将所有测试样本按照其预测的“置信度”这里可以用1 - Uncertainty_Score来表示从高到低排序并分成若干个分档例如10个档每档包含10%的样本。对于每个分档我们计算平均预测置信度该档内所有样本(1 - Uncertainty_Score)的平均值。实际准确率该档内所有样本中系统最终答案如通过投票得出正确的比例。在一个完美校准的系统中每个分档的平均预测置信度应该等于其实际准确率。我们可以绘制校准图x轴是平均预测置信度y轴是实际准确率。理想情况是一条从原点出发的45度对角线。如果曲线在对角线下方说明系统过度自信预测置信度高于实际准确率如果在上方则说明信心不足。我们提出的多智能体一致性验证方法其目标就是让这条曲线尽可能地贴近对角线。通过观察校准图我们可以诊断系统在哪个置信度区间存在问题并针对性地调整智能体组合或一致性验证算法。4.2 设置不确定性阈值与拒绝机制这是不确定性校准最直接的应用。我们可以设定一个不确定性阈值。当系统对某个问题的Uncertainty_Score超过这个阈值时系统不给出最终答案而是“拒绝回答”并提示“该问题超出当前系统的可靠判断范围建议交由人类专家复核”。这种机制极大地提升了系统的安全性。在医疗场景下宁可不说也不能说错。通过调整阈值我们可以在系统的“覆盖率”回答的问题比例和“准确率”已回答问题的正确率之间进行权衡。一个校准良好的不确定性分数使得这种权衡变得可靠且可预测。我们可以根据临床风险等级设定不同的阈值对于高风险问题如肿瘤诊断采用更严格的阈值对于低风险问题如医学知识问答可以采用宽松的阈值以提高覆盖率。4.3 为人类专家提供决策辅助信息即使系统给出了答案我们也可以将不确定性分数以及智能体间的分歧详情呈现给人类用户医生、医学生。例如可视化展示用一个仪表盘显示各选项的得票分布条形图以及一个显著的不确定性仪表盘类似温度计。分歧摘要用LLM生成一段自然语言摘要概括支持主流答案的核心理由并简要说明少数派智能体的主要反对意见或不同思路。关键证据高亮在推理文本中高亮所有智能体都提及的关键医学事实同时标出仅被部分智能体提及的存疑点。这种方式将AI从“黑箱答案生成器”转变为“透明化的决策支持顾问”。医生可以快速把握AI判断的可靠程度并重点关注那些存在分歧的环节从而做出更审慎的综合判断。这符合人机协同的核心理念——AI增强人类智能而非替代。5. 实验设计与效果评估以真实医学题库为例理论需要实践验证。为了评估我们提出的多智能体一致性验证框架在不确定性校准上的效果我们需要设计严谨的实验。这里我分享一个基于开源医学题库如USMLE或MedQA数据集的评估方案。5.1 数据集与基线模型选择首先选择一个公认的、具有挑战性的医学MCQA数据集例如MedQA-USMLE它包含大量美国执业医师资格考试风格的问题。将数据集按比例划分为训练集用于可能微调或提示词优化、验证集用于调整超参数如不确定性融合权重α, β和拒绝阈值和测试集用于最终报告性能。我们需要设立强有力的基线模型进行对比单智能体基线一个强大的通用LLM如GPT-4或医学领域LLM如Med-PaLM使用标准的提示词进行单次推理。记录其答案和模型自身输出的置信度如果可用或softmax概率。简单多智能体投票基线使用同质化的多个智能体例如5个相同的GPT-3.5-Turbo实例进行多数投票但不进行一致性验证和不确定性量化。其他不确定性估计方法基线例如蒙特卡洛Dropout如果使用可Dropout的模型、Deep Ensembles训练多个不同初始化的模型或基于模型逻辑的不确定性方法。这些方法在深度学习领域常用于估计不确定性。我们的实验系统则是多智能体 一致性验证框架智能体池包含前述的异构智能体病理、临床、检验专家等。5.2 核心评估指标评估不能只看准确率必须围绕“不确定性校准”这个核心目标设计指标预期校准误差Expected Calibration Error, ECE这是衡量校准程度最常用的指标。它将置信度范围[0,1]划分为M个区间bin。ECE计算每个区间内平均预测置信度与实际准确率之差的绝对值再以该区间样本数加权平均。公式为ECE Σ (|B_m| / N) * |acc(B_m) - conf(B_m)|其中B_m是第m个区间|B_m|是其中样本数acc是实际准确率conf是平均预测置信度。ECE越低越好完美校准为0。可靠性曲线Reliability Curve即前述的校准图可视化展示校准效果。带拒绝的准确率-覆盖率曲线Accuracy-Coverage Curve under Rejection随着不确定性阈值的变化系统拒绝回答的问题比例1-覆盖率增加剩余已回答问题的准确率也会变化。绘制准确率随覆盖率变化的曲线。曲线下的面积AUC越大说明系统通过不确定性分数筛选可靠答案的能力越强。Brier分数同时衡量预测的准确性和校准性的综合指标。对于二分类正确/错误Brier Score 1/N Σ (f_t - o_t)^2其中f_t是预测为正确的概率即置信度o_t是实际结果正确为1错误为0。分数越低越好。在我的实验中多智能体一致性验证方法通常在ECE和Brier分数上显著优于单智能体基线。单智能体模型往往表现出明显的过度自信尤其是在它犯错误的时候其输出的概率值仍然很高。而我们的方法由于捕捉了群体分歧能够对这些“自信的错误”给出更高的不确定性分数从而在ECE上表现更优。5.3 消融实验与关键发现为了理解每个组件的贡献必须进行消融实验消融一致性验证仅使用多智能体投票得出最终答案但不确定性分数仍使用单个智能体的原始置信度。结果通常显示校准效果下降说明一致性信息对不确定性估计至关重要。消融智能体异构性使用多个同质智能体再进行一致性验证。结果发现同质智能体间的语义相似度虚高导致估计的不确定性分数过于乐观在面对模型本身的系统性偏差时失效。这证明了智能体多样性的价值。消融语义分析仅使用答案分布的统计量如熵作为不确定性分数。对比发现在部分“答案巧合一致但推理荒谬”的案例上这种方法会错误地给出低不确定性分数。而结合了语义相似度的方法能成功识别出这些“脆弱的共识”。一个关键发现是智能体的数量和质量存在一个“收益递减”点。通常3-5个精心设计的异构智能体就能带来大部分收益。增加到7个以上对校准效果的提升微乎其微但计算成本和延迟却线性增长。因此在实践中需要在效果和效率之间取得平衡。6. 系统实现中的工程挑战与优化策略将上述理论框架转化为一个稳定、高效、可维护的生产系统会遇到一系列工程挑战。以下是我在构建此类系统时积累的一些关键经验和优化策略。6.1 延迟与成本控制多智能体意味着多次LLM API调用这直接转化为更高的经济成本和更长的响应延迟。优化策略包括智能体缓存对于智能体的系统提示词和固定的问题模板部分可以在内存或Redis中进行缓存避免每次请求都重复传输。更重要的是可以建立答案-推理缓存。如果遇到完全相同或高度相似的历史问题可以直接返回缓存的结果无需调用LLM。这在对题库进行批量处理或在线服务遇到重复问题时非常有效。模型层级化并非所有智能体都需要使用最强大、最昂贵的LLM如GPT-4。我们可以采用“精英辅助”的策略。核心的、需要复杂推理的智能体如病理专家使用大模型而一些辅助性的、任务较简单的智能体如格式化输出解析器可以使用更小、更快的模型如GPT-3.5-Turbo甚至更小的开源模型。这能在保证核心效果的同时大幅降低成本。异步与流式响应如之前所述使用asyncio实现并行调用是降低延迟的根本。对于最终答案聚合后需要LLM生成摘要的情况可以考虑流式输出先返回答案和不确定性分数再异步生成并推送详细的分歧摘要。预算与速率限制管理必须为每个智能体API配置严格的速率限制和预算告警防止意外循环或流量突增导致巨额账单。使用像langchain这样的框架其内置的CallbackHandler可以方便地跟踪每次调用的token消耗和成本。6.2 错误处理与系统鲁棒性在分布式、多组件的系统中部分失败是常态。设计时必须考虑鲁棒性。智能体故障隔离单个智能体调用超时或返回错误不应导致整个系统崩溃。在asyncio.gather中使用return_exceptionsTrue然后过滤掉异常结果。系统应能基于剩余智能体的结果继续工作哪怕数量减少。我们可以设定一个最低智能体数量阈值例如至少2个低于此阈值则整体返回“服务暂时不可用”。结果解析的容错性LLM的输出可能不符合预期格式。解析器应采用“最大努力”原则结合正则表达式、关键词匹配和后备LLM调用用一个轻量级模型去解析前一个模型的输出来提取信息。对于始终无法解析的智能体可以将其在该问题上的权重降为0或标记为需要人工审查。一致性验证模块的降级策略如果语义相似度计算服务嵌入模型不可用系统应能自动降级到仅使用答案分布统计量来计算不确定性分数并记录日志告警而不是完全停止服务。6.3 可解释性与调试支持一个复杂的系统必须有良好的可观察性以便调试和迭代。全链路日志记录每个问题的输入、每个智能体的原始提示词和响应、解析后的结果、中间计算的不确定性指标、最终决策以及如果可用真实答案。这些日志应结构化存储如JSON格式便于后续分析。可视化调试界面开发一个简单的内部Web界面可以输入问题实时查看每个智能体的“思考过程”、答案分布图、语义相似度矩阵以及最终的不确定性分数和决策。这对于算法开发者和领域专家医生理解系统行为至关重要。不确定性归因分析当系统给出高不确定性分数时能进一步分析贡献来源是答案分布太分散还是推理文本语义差异大或者是检测到了关键矛盾将这些信息反馈给用户或开发者有助于持续改进智能体设计或提示词。构建这样一个系统绝非一蹴而就。它需要机器学习、软件工程和领域知识的紧密结合。从简单的多模型投票开始逐步引入异构性、一致性验证和复杂的决策逻辑是一个稳妥的演进路径。每一次迭代都通过校准图、ECE指标和人工案例审查来评估效果确保系统在变得复杂的同时也变得更加可靠和可信。7. 未来展望超越MCQA的广义不确定性感知AI系统本文聚焦于医学MCQA但多智能体推理与一致性验证的框架具有高度的通用性。其核心思想——通过构建差异化的视角并检验其一致性来评估认知的确定性——可以迁移到无数需要AI提供可靠决策支持的场景。在法律领域可以构建“原告律师”、“被告律师”、“法官”智能体对案件关键证据进行模拟辩论其分歧程度可用于评估判决预测的不确定性。在金融风控中“宏观经济分析师”、“行业研究员”、“量化模型师”智能体可以对贷款违约风险进行独立评估一致性验证能帮助识别模型盲区或罕见风险。在代码生成与审查中“架构师”、“开发工程师”、“测试工程师”智能体可以从不同角度审查同一段代码其共识度能反映代码在功能、安全、性能上的可靠程度。更进一步我们可以将这种不确定性分数作为元认知信号反馈给AI系统本身实现动态资源分配。例如当不确定性高时系统可以自动触发更深入的研究调用搜索引擎API、检索更多内部文档、召集更多“专家”智能体动态扩展智能体池、或者将问题拆解成更简单的子问题逐一攻克。这使AI系统具备了“知之为知之不知为不知”的初步意识能够主动管理自身的能力边界。当然挑战依然存在。如何设计出真正互补而非冗余的智能体如何降低整个系统的计算和通信开销如何将这种框架与检索增强生成RAG、工具调用Function Calling等现有技术无缝融合这些都是值得深入探索的方向。从我个人的实践来看这条路最大的回报不仅仅是性能指标的提升更是一种思维范式的转变。它迫使我们将AI不再视为一个给出答案的“神谕”而是看作一个可以内部辩论、自我质疑、并量化自身信心的“顾问团”。这种转变对于在医疗、法律、金融等高风险领域部署负责任的人工智能是至关重要的一步。它让我们离可信、可靠、可解释的AI更近了一步。
返回列表