Anthropic 澄清开放权重立场:不主张全面禁用,呼吁统一安全测试

Al快讯 2026-07-28 18:42:01 AI工具分享

Anthropic 首席执行官 Dario Amodei 在 7 月 27 日发布文章,系统说明公司对开放权重模型的立场。文章首先澄清,Anthropic 从未主张全面禁止开放权重模型,也不认为所有可下载模型都具有相同风险。相反,能力相对有限、危险性较低的开放模型可以成为公共产品,为研究、教育、创业和本地部署提供重要价值。争议的核心并非“开放还是封闭”二选一,而是当模型能力跨过某些风险门槛后,应该采用什么治理方式。

开放权重带来真实而具体的价值

开放权重允许开发者在自己的硬件上运行模型,检查模型行为,进行微调并构建专用应用。企业可以减少对单一接口供应商的依赖,把敏感数据保留在内部环境;研究人员能够复现实验、发现缺陷并提出改进方案;小团队也能以较低成本验证新产品。这些好处会促进竞争,并让更多国家、机构和个人参与 AI 创新。

但开放权重与传统开源软件并不完全相同。软件漏洞被发现后可以发布补丁,而高能力模型一旦权重广泛传播,就很难撤回所有副本。使用者可以删除安全限制、进行针对性微调,或在开发者无法控制的环境中运行。因此,模型开放带来的控制权既能支持合法创新,也可能被用于网络攻击、生物风险或大规模欺骗。治理需要同时承认收益与不可逆性。

不支持“一刀切”,提出三项定向措施

Amodei 提出的第一项措施,是继续对先进芯片实施出口管制并加强反走私执法。其逻辑是,训练最强模型需要集中且可观察的高端算力,限制潜在对手获得大规模计算资源,比禁止所有开放模型更有针对性。芯片管制并不能阻止每一种模型使用,但可以提高训练最前沿系统的门槛,为安全评估和政策响应争取时间。

第二项措施是打击工业规模的模型蒸馏。蒸馏可以让较小模型学习强大闭源模型的输出,在正常情况下是一种常见工程方法;但如果通过自动化方式进行海量抓取,绕过服务条款并复制受保护能力,就会演变为规模化窃取。Anthropic 主张针对这类行为加强技术防护与执法,而不是把普通研究者和合法开发者一并纳入限制。

第三项措施是对达到足够能力的模型实施强制安全测试,而且开放模型和闭源模型适用同一标准。重点应放在模型能做什么,而不是由谁发布、权重是否下载。统一测试可覆盖网络攻击、生物化学辅助、自主行动、欺骗倾向等高风险能力,并要求开发者在跨越门槛前采取缓解措施。能力导向的规则比按商业模式划分更容易解释,也能减少企业通过选择发布方式规避责任。

开放并不自动让防御方占优

开放模型支持者常认为,更多研究者能够检查模型,就能更快发现风险并建立防御。Anthropic 并不否认这种可能性,但反对把它视为必然结果。攻击者同样可以利用完整权重分析防护机制、优化有害能力并反复试验,而防御方往往需要保护大量目标。某些领域中,攻击只需成功一次,防守却要长期维持,因此开放带来的能力扩散可能更有利于攻击方。

类似地,模型内置的拒答策略、水印或监控机制在开放权重后可能被移除。即使社区开发出更好的安全微调,也无法强制所有副本采用。由此可见,“可以审计”与“始终安全”是两件不同的事。开放提高了透明度和可修改性,却也削弱了发布者对后续使用的控制。政策讨论需要区分这两种效果,避免把任何一方的口号当作完整证据。

统一测试面临实施难题

能力测试听起来中立,但落地仍有挑战。测试集可能被模型开发者提前针对,真实危险能力也可能在特定提示、工具或微调后才出现。不同机构对“足够危险”的判断标准不一致,测试结果还会随推理算力、上下文长度和外部工具变化。因此,监管体系需要动态更新基准,引入独立评估,并保留对部署环境进行审查的能力。

同时,安全要求必须与模型规模和实际风险相称。若所有小模型都承担与前沿系统相同的合规成本,开放生态和学术研究会受到不必要的抑制。更合理的方法是设置清晰的能力门槛、分级义务和申诉机制,让低风险模型保持开放空间,让真正具备重大危险能力的系统接受更严格评估。Anthropic 的表态实际上是在推动这种分层治理。

开放与安全需要共同的证据基础

这篇文章的重要意义,是把讨论从阵营标签转向具体政策工具。开放权重模型不是天然安全,也不是天然危险;闭源接口同样可能被滥用,也可能通过集中控制更快实施保护。判断一种发布方式是否合适,需要考虑模型能力、复制成本、潜在危害、可撤回性以及社会收益。只有公开评估方法和实际数据,行业才能比较不同方案,而不是反复争论抽象原则。

对开发者和企业而言,未来选用开放模型时需要同时评估许可证、数据治理、模型能力和安全控制。可以下载并不代表可以无条件使用,能够私有部署也不代表风险自动消失。访问权限、日志审计、工具授权、输出验证和事故响应仍是必要环节。对于政策制定者,关键则是让规则围绕可测量能力建立,并避免用模糊概念扩大到普通研究和低风险应用。

Anthropic 的最新表态并未结束开放权重争议,但给出了更清晰的边界:保留低风险开放模型的公共价值,对最前沿能力实施统一测试,并通过芯片控制和反蒸馏措施限制高风险能力的快速扩散。接下来真正值得观察的,是这些原则能否转化为透明、可执行且不偏袒特定公司的标准。

来源:Anthropic 官方文章

© 版权声明

相关文章