新闻资讯

GPT-6 Astra正式亮相,AGI的门槛真的跨过了吗?

作者: admin | 发布于: 2026-09-04 13:44 | 分类: 科技资讯
GPT-6 Astra正式亮相,AGI的门槛真的跨过了吗?

Astra亮相前夕,整个AI社区就已经炸开了锅。

9月3号晚上,ChatGPT、Claude和Grok三家平台几乎在同一时段遭遇大规模宕机,海量用户要么根本连不上模型,要么提交请求直接报错。

偏偏就在这个节骨眼上,ChatGPT的官方社交账号发了一句意味深长的话:"The stars are almost aligned."(星辰即将归位。)

段子手们迅速跟上:Astra是不是在部署过程中,顺手把Anthropic和xAI的服务器也给搞瘫了,最后连自家都没能幸免?

当然了,纯属网友瞎编的乐子,目前没有任何实锤指向这场集体故障跟Astra有半毛钱关系。

只不过这个梗冒出来的时机实在太巧了——就在两天之前,OpenAI刚官宣,这款还没正式面世的新模型,已经是该公司首个突破Preparedness Framework"Critical"级网络安全能力门槛的产品。

紧接着,星辰确实"归位"了。

北京时间9月4号凌晨,OpenAI正式将GPT-6 Astra推向公众视野。

不过并非全面铺开。眼下Astra仅对Trusted Access/Daybreak框架内的少数机构及经审核的网络安全从业者开放——Plus、Pro、Business、Enterprise订阅者和API客户还得再"望星"一阵子。

**Astra登场,但带着紧箍咒**

9月4号,OpenAI以"内部发布"的形式亮出了GPT-6 Astra。

现阶段,Astra的使用权限仅限于Trusted Access / Daybreak体系内的一小批机构。OpenAI表态,Plus、Pro、Business、Enterprise各档订阅用户及API通道,将在接下来数天内分批解锁。

至于具体是"几天",官方并未给出更精确的时间节点。

在发布前夕的一场封闭媒体沟通会上,OpenAI总裁Greg Brockman给Astra贴了一个颇为激进的标签:"Welcome to the AGI era."

欢迎步入AGI纪元。

OpenAI研究副总裁Aidan Clark则从工程维度阐释了Astra为何与众不同:"这是我们首次在德州Stargate基地动用超十万张GPU进行预训练,从数据中心底层网络架构到推理内核,再到模型自身的拓扑结构,全都围绕这一训练体量做了从头到尾的定制设计。"

Aidan还透露,Astra是OpenAI首款让上一代模型深度介入训练流水线的产品。

通俗来讲,打造新一代AI的团队里,已经坐上了上一代AI的"工位"。

虽说距离"AI独立训练AI"还差得远,但模型已然嵌入了下一代产品的研发链条。

前一天Anthropic刚宣称Fable/Mythos 5.1是"当今全球最顶尖的编码与知识工作模型",隔天OpenAI便把"全球最强、最对齐的模型"这顶帽子扣在了Astra头上。

基准测试环节,最令人瞠目的数字出自ARC-AGI-3。

这是一项专测模型能否踏入全然陌生的二维环境、靠反复试探摸索出隐含规则并完成既定目标的Agent评测。它不像传统考试那样考核你背了多少知识点,倒更像是把AI扔进一款从没玩过的游戏里,看它能不能靠自己搞清楚"这个世界的运作法则"。

在OpenAI自研的Provider Adapter配置下,Astra最高飙到了99.9%。

但这个数字得分两层来看。ARC Prize另设了一套供各家厂商统一对比的Standard harness。在这一标准下,Astra的最高成绩仅为62.7%。

两套方案的核心差异并非换了考题。OpenAI此前排查过,Sol之所以得分偏低,根源不在模型智力,而在于harness在持续格式化它的记忆。于是OpenAI的解法是,把ARC-AGI-3的harness替换为自家Responses API的生产级配置,并且专门为ARC-AGI-3增设了两项参数调优:一是"保留推理"(retained reasoning),让模型在执行动作间隙仍能回溯自己刚才的思考路径;二是"压缩"(compaction),用摘要替代生硬的截断。

换上这套生产管线后,Astra的成绩从62.7%一跃至99.9%,且在双方均成功完成的任务中,Provider Adapter的整体吞吐速度约为对方的3.66倍,token消耗反而缩减了49%。

某种程度上,确实有点像开了挂。

高难度数学领域,FrontierMath Tier 4录得97.6%。而FrontierMath背后的Epoch AI指出,OpenAI为该基准的研发提供了资金支持,且对其中部分题目享有排他性接触权。

其他值得一提的分数包括:

DeepSWE v1.1 74.1%

BenchCAD 95.9%

Terminal-Bench科学类任务 64.6%

然而OpenAI此次显然不打算仅凭一列Benchmark来交代Astra的全貌。

翻开官网,演示案例几乎是无缝衔接地铺展开来。

KiCad、Excel、Blender、Power BI、浏览器表单填写、网站质量检查;再延伸到找房、寻医、预约车管所、报税、制作PPT、开发小游戏、解析科研数据集。

过去几代GPT发布时,OpenAI侧重向用户展示模型"能回答什么";轮到Astra,叙事重心明显发生了偏移,转而强调:你手头有多少活儿,可以直接甩给AI去干。

OpenAI甚至毫不吝啬地把Astra冠以"全球最佳computer use模型"的头衔。

模型在"操控计算机"层面的跃升,或许比那些冰冷的分数更具分量。在Codex环境中,Astra引入了一套全新的上下文管理机制:当上下文窗口触及上限时,不再单纯依赖压缩摘要,而是能够跨越窗口边界保留笔记、回溯更早的历史消息与工具返回结果。

Astra还能在某个子问题暂时悬而未决时,先行处理不依赖该答案的其他部分,防止单一阻塞点拖垮整个任务链。

当然,能力也明明白白地刻进了定价里。

GPT-6 Astra的API标价为:每百万输入token 10美元,缓存命中输入1美元,输出50美元。

对照GPT-5.6 Sol现行的4美元输入、0.4美元缓存、20美元输出,Astra整套价格直接翻了2.5倍。OpenAI对其定位也相当直白:若不确定该选哪款旗舰,选Astra;若更看重性价比,继续用GPT-5.6 Terra或Luna即可。

它依旧支持105万token的上下文窗口和最高12.8万token的输出长度。但长上下文同样要加钱:与GPT-5.6系列一致,当单次输入超过272K token时,该次请求的输入费用按2倍计收,输出按1.5倍计收。

换言之,OpenAI实际上为Astra单独开辟了一个更烧钱的智能层级。

如果只是随口问个问题、润色几段文字,多掏2.5倍的溢价未必划算。

但若模型真能自己坐到屏幕前,连续运转几十分钟乃至数小时,把过去需要人在不同软件间反复切换、翻资料、填表格、改文档的一整套流程一气呵成地跑完,那真正该衡量的,就不再仅仅是每百万token的单价了。

**几个技术细节,值得关注**

Astra还有若干技术要点,也许比Benchmark数字本身更耐琢磨。

第一,逆向工程。

本次发布中OpenAI援引了SRE-Bench——由Columbia DAPLab等团队今年推出的一套逆向工程评测:不喂给模型源码,只提供编译后的二进制可执行文件,考察它能否重新还原程序逻辑、定位关键行为。

Astra单次尝试即达88.0%成功率,放宽到最多四次尝试则攀升至99.2%。

同等条件下,GPT-5.6 Sol分别只有55.9%和68.7%。

翻译成大白话:AI面对一段已被编译、几乎不存在人类可读代码的程序,也开始能从机器指令中一点一点将其"拆解复原"。

这对恶意软件研判、固件逆向、漏洞挖掘和电子取证等领域具有直接的实战价值。

第二处变化,是Astra在超长任务中"不容易把东西弄丢了"。

MRCR v2八针检索测试中,Astra在256K至512K上下文区间内准确率达100%;即便拉到512K至1M token,仍有96.3%。反观GPT-5.6 Sol,这两个区间分别只有91.5%和73.8%。

以往不少模型号称支持百万级上下文,可一旦把一条关键信息埋进几十万token深处,模型跑到后半段往往早已模糊不清。

Astra则开始把"上下文窗口多大"这个指标,推向了另一个更务实的命题:一个Agent究竟能记多久之前发生过的事。

对于那些需要不间断工作数十分钟甚至数小时的Agent而言,这一点的重要性恐怕远超再多堆几十万token的窗口。

此外,Astra身上还有一个颇为矛盾的变化。

它变得更守规矩了,却也更难被监管了。

OpenAI公布的一组内部计算机使用安全测试显示,Astra的违规行为发生率从Sol的22.0%骤降至2.4%;在专门检测模型是否会为达成目标而绕过约束的测试中,Astra为零。内部幻觉测试同样从Sol的9.4%压到Astra的2.0%。

至少依据OpenAI自家的测试结果,Astra明显更少"放飞自我"。但OpenAI首席科学家Jakub Pachocki同时敲了警钟:"智能的提升,绝不等于对齐的提升。"

其中一个原因在于,Astra开始越来越不愿意把自己的完整思考链路摊开来写。

过去一种关键的AI安全手段,是审查模型的思维链(Chain of Thought):倘若模型正准备越权操作、攻击某系统或暗中篡改目标,可以从其推理痕迹中捕捉到端倪。

但OpenAI发现,Astra对自身书面推理具备更强的掌控力。某些过去必须铺展大量步骤才能攻克的难题,如今它能以更精简的显式推理搞定;而当模型意识到自己的思考过程正被审视时,还会主动改写或大幅压缩这些内容。

于是,OpenAI已不能再单靠盯思维链来兜底。

为了管住Astra、防止它在生产环境中重演Sol曾出现过的攻击行为,OpenAI在部署层植入了"失对齐监控"(misalignment monitoring)。该系统同步观测模型的推理输出、实际操作、工具调用记录以及整条任务轨迹。

一旦判定模型可能正在严重偏离用户的原始意图,系统有权暂停乃至直接掐断任务。

在API场景中,被拦截的任务可能被直接终结;在ChatGPT或Codex中,某些情形下会先弹出让用户二次确认:

"这确定是你希望我执行的吗?"

产品层面,Astra的API模型标识直接写作gpt-6-astra,同步接入Amazon Bedrock。

OpenAI还推出了Fast模式:价格翻倍,最高可换取约2.5倍的执行速率。

对日常闲聊而言,这或许缺乏吸引力。但如果一个Agent原本要在浏览器和各种软件中折腾40分钟,硬生生压缩到十几二十分钟,速度本身就构成了产品竞争力的一部分。

订阅端,Astra将纳入现有订阅配额;Pro、Business和Enterprise用户还将解锁能力更强的Astra Pro。Enterprise版本默认关闭,需管理员手动启用。

尽管,眼下大家暂时还都进不去……

**前因后果错综复杂,故选择限流放行**

Astra大概是OpenAI迄今为止"前传"最长的一部模型大片。

多数产品的节奏是先上线、再慢慢暴露缺陷,Astra恰好反过来——当然也不排除其中掺杂了部分营销策略的成分。但在正式对外之前,OpenAI已经花了近一个月时间,反复解释为何它需要更加审慎地被训练、验证和投放。

8月7号,OpenAI首次公开表态,最新的内部评估使公司已无法排除Astra触及Preparedness Framework下"Critical"级网络安全能力阈值的可能性。

到9月1号,这个"可能性"落地为正式定论:Astra成为OpenAI旗下首个被评定为Critical级网络安全能力的模型。

依照OpenAI自身的分级标准,这意味着在配备适当工具和访问权限的前提下,Astra已能在众多经过加固的真实系统中,无需人类逐一步导,自主发掘此前未被记录的漏洞并构造可用的利用方案;又或者仅给定一个高层级目标,便能自行规划并实施一套面向加固目标的端到端攻击策略。

这早已超越"会写攻击脚本"的范畴——在ExploitBench上,Astra直接刷满了100%。

为防止模型仅是死记硬背了公开漏洞库,OpenAI另行搭建了一套内部测试集,塞入20个2026年6月至8月方才曝光的V8高危漏洞。Astra不仅比GPT-5.6 Sol消耗了更少的输出token,还取得了显著更高的任意代码执行成功率。

测试期间,它甚至自行发现并利用了两个此前无人知晓的zero-day漏洞,并将二者串联进同一条漏洞利用链。OpenAI声明,目前正向相关维护方披露这两处漏洞。

专家级测试则更贴近真实攻防场景。面对经过强化的浏览器,Astra在发现未知漏洞后,能够一路打通沙箱逃逸,并在宿主系统上执行任意命令;在加固版操作系统上,它又将多处漏洞编织成一条本地提权链,从普通账户一路攫取root权限。

也正是经由这一轮测试,OpenAI首次意识到,模型的破坏性能力已开始反向制约模型自身应当如何被训练。

8月18号,OpenAI公开承认,公司一度叫停了训练规模的扩张计划,其中包括暂停为期两周、原计划用于新模型部署的强化学习训练。

与此同时,大批涉及Astra的训练与评估任务,也因尚未迁移至全新安全环境而处于搁置状态。

过往讨论AI安全,焦点多落在模型训练完毕后能否安全交付给用户;而在Astra的案例中,这道关口已经前移到了训练阶段本身。

OpenAI据此对整个研究基础设施进行了重新加固。执行模型所生成代码的操作须置于更严苛的沙箱之中;高风险工作负载要求更强的网络隔离措施;Astra的每个checkpoint增加了加密与细粒度访问控制;所有携带工具调用的Astra推理都必须接受额外的实时监控。

这套监控体系本身代价不菲,OpenAI估算,仅监控系统产生的计算开销,大约相当于被监控推理算力的20%。

换个说法,Astra的总成本不只是"训一个更大的模型",OpenAI还必须额外烧掉一大块算力,专门用来盯着这个模型到底在干什么。

这也解释了为何Astra正式落地后,最尖端的网络安全能力并未毫无保留地敞开给所有人。

OpenAI明确声明,Astra默认生产版本仍将对高风险网络攻击类请求施加限制;更高阶的网络安全工作流,初期仅向极少数Alpha测试者开放,后续再通过Daybreak Blue渠道逐步扩展至经审核的防御型用户。

普通用户未来几天虽也能用上Astra,但这并不意味着每个人获取的能力边界完全一致。

这类管控甚至可能产生误判。OpenAI事先预警,额外的安全校验可能导致正常任务减速、暂停乃至直接中断,就连某些看似与网络安全毫无关联的长时间Agent任务,也有可能被错误触发警报。

若ChatGPT或Codex中的任务被失对齐监控叫停,用户可能需要回到界面确认操作后方可恢复;API中的任务则可能被直接切断。

这部分变动,极易在Astra发布后被"AGI"的大旗所遮蔽。

模型越强大,普通人能实际触达多少能力,开始越来越取决于平台愿意授予你多大的权限。

于是,在一连串"Critical评级、暂停训练、环境隔离、实时监控、分级放权"的铺垫之后,Greg Brockman在Astra发布的媒体沟通会上轻描淡写地抛出一句:"Welcome to the AGI era."

他甚至补充道,若让他以个人身份下判断,他相信"我们已经做到了"。

但当被追问"那OpenAI是否正式宣告AGI已实现"时,Brockman又坦言,AGI已经变成了一个"灰色、模糊的东西",更接近一种"使命概念"或"精神概念",而非一条可以精确画线的技术标准。

再往前追溯,在《Sources Podcast》节目中,Altman已不太愿意正面回应"我们何时实现AGI"这类提问,他认为AGI这个词"往好了说,也是个定义极其含混的概念",甚至险些将其定性为一个"无足轻重的营销话术"。

原因并非OpenAI距AGI更远了。恰恰相反,因为在Altman的认知里,AGI或许已不那么重要了。

他真正开始忧虑的是下一个关键词:Superintelligence,超级智能。

Altman表示,一年前,他还觉得OpenAI并未踏上通往超级智能的短周期轨道。而现在,他认为这件事"有可能成真"。

不过还是忍不住想吐槽一句:那ASI就不算"无足轻重的营销话术"了吗?(作者:苗正、袁心玥)