尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

谷歌DeepMind双盲评估试点发布 密码学黑盒隔离模型与题库

谷歌DeepMind双盲评估试点发布 密码学黑盒隔离模型与题库 谷歌DeepMind于2026年8月27日发布了全球首个前沿AI模型双盲评估试点报告。报告显示外部机构提供私有题库Google提供Gemini Flash Lite模型权重二者均封入基于Google Cloud Confidential Space与NVIDIA H100的可信执行环境。事实还原此次试点由新加坡AI安全研究院、MLCommons、OpenMined和AVERI参与。评测方无法看到Gemini Flash Lite模型权重Google无法看到外部机构的测试题目。双方通过密码学“黑盒”实现隔离防止模型提前接触题目导致的基准污染。机制拆解传统高风险外部评估存在权衡评估方需提交测试提示存在模型提供方提前获知题目的风险或模型提供方提交权重存在知识产权泄露风险。双盲评估通过Confidential Space实现密码学验证使双方数据保持私有。评估过程在可信执行环境中运行输出结果不泄露原始输入。该方法将外部评估限制在密码学“黑盒”内避免模型后续利用测试问题优化性能。产业影响随着AI模型能力提升模型提前看到测试问题会人为抬高分数削弱基准可信度。双盲评估为政策制定者、研究者和企业提供更可靠的能力与安全评估尤其适用于网络安全或政府相关敏感测试。它减少了零日志协议和合同保障之外的技术漏洞。战略判断【分析】该试点若被行业采纳可能改变现有排行榜方法论促使更多机构转向密码学隔离方案以维护评估独立性。但其实际推广仍取决于其他模型提供方是否愿意开放类似环境以及执行环境对计算效率的影响。此次合作显示Google在外部评估中引入技术保障旨在平衡模型保护与评估透明度。未来类似框架或扩展至更多前沿模型评估场景。本文首发于赢政天下(https://www.winzheng.com/article/barret-zoph-joins-google)获取更多深度技术内容与资源欢迎访问官网。
返回列表