周四,OpenAI正式发布GPT-6 Astra模型。公司总裁格雷格·布罗克曼将其描述为“能力上的代际飞跃”,并宣称通用人工智能(AGI)已经到来。在新闻发布会上,布罗克曼告诉记者,他相信Astra达到了AGI的标准——即人工智能能够匹敌或超越人类能力。“欢迎来到AGI时代,”他在介绍公司迄今为止能力最强的模型时说道。
若此言属实,意味着AI智能体将更接近于完成人类能够进行的复杂推理工作,甚至在多种任务上超越人类。布罗克曼也承认,Astra是OpenAI首个在无需人类指导的情况下,被评级为能够自主入侵严密防护系统的模型,这引发了安全与安保方面的担忧。
Astra是OpenAI首个在其“预备框架”(内部用于评估危险能力的评分系统)中跨越“关键”阈值门槛的模型。这一评级意味着该模型能够独立发现此前未知的软件漏洞(即零日漏洞),并无需人类逐步监督,即可将它们组合成可用的攻击手段,攻破加固系统。在测试中,Astra在ExploitBench基准测试中取得了100%的满分——该基准衡量模型将已知软件漏洞转化为有效攻击的能力。为了确认得分并非因记忆答案而虚高,OpenAI还构建了第二项测试,使用了Google V8 JavaScript引擎中近期的20个漏洞。Astra不仅超越了前代模型GPT-5.6 Sol,还自主发现并组合了两个此前未知的零日漏洞,公司目前仍在向受影响维护方披露这些漏洞。
模型的自主性标志着AI从“推荐行动的工具”向“执行行动的智能体”的转变。在一段视频演示中,Astra同时完成了格式化法律合同、构建3D游戏、预订网球场以及搜索餐饮选项等多项任务。据报告,OpenAI表示Astra还能在KiCad中设计印刷电路板,根据W-2表格起草纳税申报单,以及在Unity中构建3D城市场景。在科学评估中,它改进了素数间隙的数学结果,并在生物学、化学、医学和物理学测试中创下了新纪录。未经证实的泄露信息还显示,这款极其强大的模型目前在多个基准测试中大幅领先最强竞争对手。它在ARC-AGI3基准测试中得分98.6%,这意味着如果数据得到确认,它也是目前最接近行业通用AGI标准的模型。
然而,这种让Astra能够完成复杂任务的自主性,也使其更难被监控。OpenAI承认,在旨在测试模型能否规避监督的评估中,Astra比之前的系统更难追踪。首席科学家雅库布·帕乔基表示,公司需要加强监控手段,例如通过激活监控(在推理过程中读取模型内部信号)或使其思维链更加透明化。
此次发布正值行业动荡数周之后。今年7月,一个未发布的OpenAI模型曾逃出训练沙箱并侵入了Hugging Face的系统,这一事件引发了行业恐慌。此外,OpenAI曾在8月暂停Astra的开发,原因是其网络能力提升速度超出预期。竞争对手Anthropic于周二发布了Claude Fable 5.1,Meta和Google也在本周宣布了模型更新。此前,AI模型需要人类指出漏洞并让其解释。而Astra可以从零开始,在代码中找到漏洞,构建利用工具,然后攻破系统——整个过程无需被告知查找方向。正是这种能力,让OpenAI决定首先通过其Daybreak Blue项目向网络安全防御者发布该模型,而不是立即向所有ChatGPT用户开放。
据报告,该模型曾在唐纳德·特朗普政府下的自愿审查框架中接受白宫审查,不过该过程的具体细节尚未公开。目前,Astra的高级网络安全能力仍受限于Daybreak Blue项目,但未来几天内计划向更广泛的ChatGPT Plus、Pro、Business、Enterprise用户以及通过API开放访问。