Anthropic CEO想给 AI 安“银行式监管”,专家泼冷水:你既当运动员又当裁判
据 CNBC 报道,Anthropic CEO Dario Amodei 提议将独立第三方安全评估员长期嵌入前沿 AI 公司,赋予其接近内部风险团队的访问权限,并在有限删减前提下自主发布调查结果的权力。他明确援引银行业嵌入式监管作为先例,并承诺 Anthropic 将向第三方评估员提供与内部风险团队相当的系统访问权。
阿莫代伊在上周末的长文中还警告,未来 6 到 12 个月内,一个错位的智能体群可能抢占互联网的大部分,并造成数千亿美元损失。此前,Anthropic 前研究员 Jacob Coxon 辞职并警告前沿实验室正竞相追逐可能失控的系统。
银行检查员能关银行,AI 评估员却没否决权
多位银行业监管专家和 AI 评估从业者指出,这一方案缺乏银行监管者拥有的强制执行权。怀俄明大学法学院院长 Julie Andersen Hill 表示,政府检查员常驻大型银行,可指令银行停止某项业务、限制增长、强制管理层变动,极端情况下可关闭银行;而阿莫代伊提议的评估员只能调查和报告,无权阻止模型训练或发布。“这是根本性的不同,因为银行监管者的权力要大得多。”
网络安全公司 XBOW 的 AI 负责人 Albert Ziegler 说,黑盒测试能揭示模型是否具备执行危险任务的能力,但重大风险可能只在评估者从未触发的条件组合下出现。“我们确实没有否决权。”评估者可以迫使公司在发布前做出知情决定,但最终决定权仍在公司手中。
“独立”存疑:METR 的角色与“审计洗白”批评
阿莫代伊点名非营利机构 METR 作为潜在嵌入评估方,而另一名前 Anthropic 研究员 Joe Benton 最近离职加入 METR。加州大学伯克利分校研究员 Deborah Raji 指出,这种安排存在财务、意识形态和个人利益冲突,且 METR 近年主要锚定 Anthropic 和 OpenAI,“允许各种奇怪的事情发生”。她认为仅获得访问权限不等于独立,应由独立于公司的机构决定谁有资格评估、能检查什么以及结果上报何处,否则“就相当于公司请一个普通朋友来检查作业”。
Raji 表示,最终的分辨标准是不利发现是否会产生后果——“如果你做了审计而什么都没发生,那就是审计洗白”。Hill 则说:“如果你真的相信 AI 有力量摧毁社会,那么你就必须有一个有能力拔掉电源的独立监督者。”
Anthropic 公共政策主管 Sarah Heck 周三回应称,AI 公司不能靠“荣誉守则”来管理监督和安全问题:“我们不能自己检查自己的作业,这一点非常明确。”
via AI新闻资讯 (author: AI Base)
据 CNBC 报道,Anthropic CEO Dario Amodei 提议将独立第三方安全评估员长期嵌入前沿 AI 公司,赋予其接近内部风险团队的访问权限,并在有限删减前提下自主发布调查结果的权力。他明确援引银行业嵌入式监管作为先例,并承诺 Anthropic 将向第三方评估员提供与内部风险团队相当的系统访问权。
阿莫代伊在上周末的长文中还警告,未来 6 到 12 个月内,一个错位的智能体群可能抢占互联网的大部分,并造成数千亿美元损失。此前,Anthropic 前研究员 Jacob Coxon 辞职并警告前沿实验室正竞相追逐可能失控的系统。
银行检查员能关银行,AI 评估员却没否决权
多位银行业监管专家和 AI 评估从业者指出,这一方案缺乏银行监管者拥有的强制执行权。怀俄明大学法学院院长 Julie Andersen Hill 表示,政府检查员常驻大型银行,可指令银行停止某项业务、限制增长、强制管理层变动,极端情况下可关闭银行;而阿莫代伊提议的评估员只能调查和报告,无权阻止模型训练或发布。“这是根本性的不同,因为银行监管者的权力要大得多。”
网络安全公司 XBOW 的 AI 负责人 Albert Ziegler 说,黑盒测试能揭示模型是否具备执行危险任务的能力,但重大风险可能只在评估者从未触发的条件组合下出现。“我们确实没有否决权。”评估者可以迫使公司在发布前做出知情决定,但最终决定权仍在公司手中。
“独立”存疑:METR 的角色与“审计洗白”批评
阿莫代伊点名非营利机构 METR 作为潜在嵌入评估方,而另一名前 Anthropic 研究员 Joe Benton 最近离职加入 METR。加州大学伯克利分校研究员 Deborah Raji 指出,这种安排存在财务、意识形态和个人利益冲突,且 METR 近年主要锚定 Anthropic 和 OpenAI,“允许各种奇怪的事情发生”。她认为仅获得访问权限不等于独立,应由独立于公司的机构决定谁有资格评估、能检查什么以及结果上报何处,否则“就相当于公司请一个普通朋友来检查作业”。
Raji 表示,最终的分辨标准是不利发现是否会产生后果——“如果你做了审计而什么都没发生,那就是审计洗白”。Hill 则说:“如果你真的相信 AI 有力量摧毁社会,那么你就必须有一个有能力拔掉电源的独立监督者。”
Anthropic 公共政策主管 Sarah Heck 周三回应称,AI 公司不能靠“荣誉守则”来管理监督和安全问题:“我们不能自己检查自己的作业,这一点非常明确。”
via AI新闻资讯 (author: AI Base)