Anthropic力推行业透明化:自曝Claude已占据主导地位
财联社9月17日报道(记者 潇湘)自Anthropic掌门人Dario Amodei向全行业发出"应协调各方减缓AI推进节奏"的倡议、在科技圈掀起广泛讨论之后,该公司于本周四正式推出了一套包含三项核心指标的评估框架,声称能够为AI企业追踪技术演进提供参照。值得注意的是,其中一项数据显示,Anthropic自研的大语言模型Claude已经在公司内部承担了26%的人工智能研发任务,处于"主导地位"。

据Anthropic当日发布的技术博客介绍,团队围绕"AI深度参与的自主研发""AI智能体的监控与人工干预机制"以及"企业内部算力资源的配置结构"这三个层面进行了系统性度量,并将底层方法对外公开,期望推动更多同行采用类似做法。
"在全球范围内就前沿AI技术如何驾驭其发展节奏展开深入对话之际,我们有责任最大限度地缩小头部研究实验室与普通公众之间的认知落差,"Anthropic在文中明确指出,"这要求我们以更加精确的方式刻画AI能力的成长轨迹,以开放透明的姿态向外界呈现相关信息,并邀请社会公众参与到对这些信息的解读与应对决策之中。"
Amodei在上周末抛出的"减速"主张,迅速获得了OpenAI CEO Sam Altman、SpaceX创始人兼CEO Elon Musk以及Google DeepMind联合创始人Demis Hassabis等多位重量级人物的公开背书。此前,多位研究者已就AI潜在风险不断升级的问题发出了强烈警示。
Amodei进一步阐释道,他提出这一倡议的核心目标是在管控模型能力攀升速度的前提下,"既不削弱企业的市场竞争力,也不动摇美国在全球AI格局中的领先身位"。
**Claude已扛起近四分之一内部AI研发重任**
最新披露信息显示,在"AI辅助AI研发"这一维度上,Anthropic设计了一款名为"Anthropic研发自动化指数"的原型工具,用以量化Claude在公司AI研发流程中所扮演的角色权重。具体做法是:先对内部所有AI研发活动进行全面梳理和分类,再逐一评估各任务的现有自动化水平,最终将各项得分加权汇总形成综合指数。
为界定AI在Anthropic内部研发中的参与深度,该公司借用了Epoch AI团队开发的自动化分级标尺,即"自动化等级"(AL)。该标尺设五个层级:AL0代表完全没有AI介入,AL5则意味着AI可以全程独立运转、无需任何人类参与。中间档位中,AL3(人机协作)指AI能在人的紧密指引下完成较大规模的工作模块;AL4(AI主导)则表示AI仅需接收高层级指令即可端到端地完成绝大部分工作,人类退居幕后进行质量监督。
截至2026年8月的统计周期内,Claude尚未在所度量的任何AI研发场景中达到AL5级别的"完全自主运行"状态,但已达到AL4"主导"门槛的研发任务占比约为26%;若将AL3"人机协作"及以上层级的任务合并计算,则总占比已突破90%。
回溯至2026年2月,AL4层级的占比尚不足1%。Anthropic认为,跟踪这类指标的变化趋势,对于判断AI研发自动化是否在加速攀升、以及距离"递归自我改进"——也就是AI能够独立完成下一代AI的全套开发——究竟还有多远的差距,具有重要的参考价值。

**其余两项发展速度观测指标**
第二个维度"AI智能体的监控与干预"聚焦于搭建一套针对AI智能体行为的实时监督与纠偏体系。监测数据表明,在Anthropic最关键的内部工作平台上,任意时刻大约有3万个智能体正在并行处理研究与工程类任务。这些智能体的每一次行动均受到线上与线下两套监控系统的双重约束。
Anthropic进一步透露,每个智能体在执行任何一步操作之前都要通过一道前置审核关卡;仅在当月产生的超过10亿条决策指令中,平均每执行47000步操作就会触发一次线上监控系统的阻断拦截。
第三个维度"企业内部算力资源配置"方面,Anthropic选取了7月中某一采样周的数据进行披露:在整体投入AI研发的算力中,大约6%被专门划拨给安全方向的研究;而在AI独立开展的前沿探索课题中,安全相关的算力占比则上升至12%。
Anthropic特别强调,这一统计标准实际上偏于保守。举例来说,假如某段推理过程中消耗的算力同时推动了模型性能提升和安全能力增强,那么这部分算力就不会被归入安全统计范畴。
Anthropic总结称,传统的基准测试主要回答的是"模型具备怎样的能力"(即能力侧写),而此次推出的新指标组则着力揭示"模型是怎样被造出来的"(即过程透视),两者形成互补关系。借助这套完整的观测体系,外部独立机构将获得一个可靠的锚点,从而更准确地判断AI技术发展的实际快慢。
"我们期待通过公开这批量化数据,为整个行业的透明度实践立下一个可参照的标准,并且今后会沿着这个方向持续深化,"Anthropic在文末表示。