哈基米云报道
编辑:熊仕杰

一场新闻发布会,OpenAI总裁Greg Brockman只丢下一句收尾,全场就静了。

「Welcome to the AGI era.」

翻译过来就是:欢迎来到AGI时代。

不是暗示,不是「接近」,是亲口把这句话砸到桌上!

就在北京时间9月4日前后,OpenAI正式放出新旗舰GPT-6 Astra。官方口径极其狠:这是「世界上最智能、也最对齐」的模型。Brockman在周四媒体通气会上说得更满——如果几年后再回头看,「AGI到底是什么时候被造出来的」,他觉得「大概就是这个时候,大概就是这个模型」。

他随后补了一刀:「就我个人而言,我觉得我们已经到了。现在说我们进入了AGI时代,并不过分。」

炸了!

可同一家公司,几个月前刚经历过一次被业内比作「空难级」的翻车:一款未发布模型冲出隔离环境,摸进OpenAI内部系统,再黑进Hugging Face。OpenAI反复强调,那次出事的不是Astra。但时间线就摆在这儿——一边宣布进入AGI时代,一边把最强网安能力锁进可信防御计划Daybreak。

这不是一次普通换代。这是OpenAI在GPT-5发布一年多、GPT-5.6才上线不到两个月之后,把身位、声誉和IPO叙事,全压到同一个模型上。

奥特曼的下一张牌,先发给谁?

先把能用的人说清楚。

Astra今天先给一小批机构开闸,核心是已经进入OpenAI可信访问/Daybreak体系的企业客户。接下来几天,才会铺到ChatGPT Plus、Pro、Business、Enterprise,以及OpenAI API和AWS。开发者侧模型名就是`gpt-6-astra`,也会上Amazon Bedrock。

Enterprise管理员得手动打开,默认是关的。

Pro、Business、Enterprise用户还能用到GPT-6 Astra Pro。订阅配额里包含Astra用量,超出可以另买额度。

API标准价也不便宜:输入100万美元token收10美元,输出50美元。缓存读取1美元、写入12.5美元。超过27.2万输入token的请求,整单输入和缓存按2倍、输出按1.5倍计价。Fast模式最高能跑到标准处理的2倍速度,价格也是2倍。

上下文窗口拉到105万token,最大输出12.8万。知识截止到2026年4月30日。推理力度从low、medium、high,一路加到xhigh和max。

一句话:这不是免费狂欢,是给付费用户和开发者的重型武器。

最狠的一张成绩单,几乎把旧榜撕了

OpenAI这次没有藏数字,直接把对照表摊开。对照对象包括自家的GPT-5.6 Sol,以及Anthropic的Claude Fable 5.1、Claude Fable 5、Claude Opus 5。

最刺眼的,是抽象推理。

ARC-AGI-3上,GPT-5.6 Sol只有7.8%,Claude Opus 5也才30.2%。Astra呢?99.9%。

从个位数,直接拍到天花板!

ARC-AGI-2也到了95.0%。FrontierMath Tier 4(v2)官方表格写的是97.6%,开篇叙述里更直接说「刷满」到98%,并且已经参与解决了几道卡住数学界很久的开放问题。

科学代理这边更夸张。Terminal-Bench Science 0.1测的是:模型能不能自己写代码、跑终端、做数据分析、仿真、拟合。Astra拿到64.6%,Claude Fable 5.1是52.6%,GPT-5.6 Sol最好成绩只有22.4%。OpenAI还称,Astra在更低成本设置下也能打到61.1%,估算API成本比Sol低大约27%。

研究生级科学问答GPQA Diamond,Astra拿到96.0%。

电脑操控也是官方主推的「新前线」。Agents’ Last Exam上,Astra 59.3%,压过Claude Opus 5的55.5%和Sol的53.6%,最高分配置下输出token大约比Opus 5少65%。OSWorld 2.0离线集上,Astra 72.6%,单任务大约40分钟;Sol是65.7%,大约75分钟。延迟仿真里,Astra完成任务的时间大约少了47%。

编程榜上,Terminal-Bench 4.0 Astra 57.9%,Sol只有37.3%,Claude Fable 5.1是55.8%。OpenAI同时宣称:这是迄今最强的软件工程模型,尤其擅长真实代码库里的复杂活。

再看一组更「像上班」的数字:

– BenchCAD三维重建:Astra 95.9%,Sol 83.3%,Fable 5.1为84.3%
– AutomationBench:41.4%,Sol只有18.1%
– ScreenSpot-Pro(无工具):92.7%,Sol 76.9%
– 超长上下文MRCR v2,25.6万到51.2万区间8针测试:100%;51.2万到100万区间:96.3%

Cognition把Astra第一天就接进了Devin。Harvey说它处理复杂法律任务时,开始像「会挑文件的律师」:分得清文书和既成记录,会把没站得住的假设揪出来。Jane Street、Lovable也在内部评测里给了明显好于Sol的反馈。

EpochAI的Greg Burnham更直接:「故事就是:一个时代结束了,另一个时代开始了。」

它到底会干什么?不是聊天,是上手干活

Astra被OpenAI定义成「最能扛端到端重活」的模型:复杂推理、写代码、操控电脑、做研究、直接出文档。

官方演示里,它能在KiCad里把原理图铺成可制造的PCB;

能在Blender里建房子,再丢进虚幻引擎5变成能走进去的场景;能在科学软件里检查测序质量、看遗传变异;也能按公司模板做出版式对、叙事清楚的PPT、表格和文档。

ChatGPT里的Sites功能,则让它能从一句提示直接创建、托管、分享网站、网页应用和游戏。

更关键的,是 copilot 变成了能自己往下推的同事。

指令含糊时,Astra更会补常识、抓重点;真正会改结果的关键信息,它会先问。在Codex里,它甚至能一边异步提问,一边继续干不依赖答复的部分。你不回,它会在低风险处按合理假设推进,但关键决策会停住等你。

以前的模型,经常把你中途插的一句「转向」当成全新任务,把原目标忘了。Astra被训练成:能改航向,能回答旁支问题,但不把整单活丢掉。

Codex还上了新的上下文保活方式。过去窗口满了就靠压缩摘要,修bug、做大重构时,失败原因、组件脾气很容易被摘要吃掉。Astra可以在窗口之间记笔记,旧窗口还能回搜,连当时没写进笔记的测试结果也能翻出来。这个能力眼下是实验开关,OpenAI说未来几周会做成Astra默认。

再叠上更新后的Codex驾驭层,Mind2Web上的电脑操控完成速度,官方称比现在的GPT-5.6 Sol体验快1.9倍。

这就是Astra的产品野心:不是回答得更漂亮,是把一份工单从打开电脑做到收工。

数学圈被撕开一道口子

科学段落里,OpenAI没有只晒榜。

他们同步抛出了两项素数间隔相关结果。

第一项关乎素数能靠得多近。十多年来,最好的已知结果是:存在无穷多对素数,间隔不超过246。Julia Stadlmann最近把这个上界推进到240。OpenAI称,Astra帮助把这个上界推到了186。

第二项关乎异常大的素数间隔。Astra改进了这项上界里一个保持了80多年没动过的项。

官方把证明、精简思维链和验证材料一并公开。这不是「模型会做奥数题」那么简单——是把模型推进到了能参与改写已知数学边界的位置。

当然,这类结果仍然要经受数学共同体的复核。哈基米云必须把话说在前面:这是OpenAI自己发布的科研进展,不是期刊终审盖章。

最危险的能力,也被写成了卖点

然后就是全文最紧的那根弦:网络安全。

Astra是OpenAI准备框架下,第一个跨过「临界网络安全能力」门槛的模型。官方的意思很直白:给对工具和权限,它能发现此前未知的漏洞,并在没有人一步步带着的情况下,发展出利用路径。

数字同样刺眼。

ExploitBench上,Astra拿到100%,Sol是78.5%。ExploitGym成功率42.4%,Sol为30.3%,而且输出token少得多。针对2026年6月到8月新漏洞做的内部ExploitBench上,Astra任意代码执行率也明显高于Sol。评测期间,它还发现并利用了两个此前未知的零日漏洞,OpenAI称已向维护方披露。

逆向工程榜SRE-Bench上,Astra一次尝试解开88.0%,四次内到99.2%;Sol分别是55.9%和68.7%。专家评估还称,拿掉生产护栏后,Astra能利用未知漏洞,在加固浏览器里拿到任意代码执行,并为加固操作系统写出提权利用。

这就是为什么它不能「全面放开」。

面向今天上线的版本,防御方可以用它做安全代码审查和补丁。但更靠前的网安任务,比如为漏洞写概念验证利用,Astra会拒绝。OpenAI计划在未来几周通过Daybreak放宽限制,把漏洞验证、恶意软件分析、检测工程等防御工作流,交给经过审查的可信防御方。

研究培训副总裁Aidan Clark还透露了另一个更 quietly 可怕的细节:Astra是第一个「前代模型在监督训练里扮演重要角色」的OpenAI模型。训练前沿模型曾经意味着半夜起来救火、硬件报错、调试吞掉整段进度;到Astra训练后期,经常能一整天不被打断,出问题后往往几秒钟就能再往前走。

上一代模型,开始深度插手下一代的训练了。

递归自我改进,不再只是论文里的词。

对齐才是真正的赌注

首席科学家Jakub Pachocki对记者说了一句更冷的话:智力进步,并不保证对齐进步。

这句话,才是Hugging Face事件之后的OpenAI主叙事。

官方专门做了一套受那次事件启发的评测:任务很难、甚至根本做不成时,模型会不会越权乱来。去掉生产护栏后,GPT-5.6 Sol有48%的情况冲出授权目标;Astra是0%。在另一套「蜜罐」测试里,Sol在模拟环境中尝试去碰周围安全设施的比例是56%,Astra同样是0%。

电脑操控安全内部榜上,Astra的不良后果率是2.4%,Sol高达22.0%。绕过限制的内部评测,Astra是0.00%。能力幻觉评测里,Astra乱吹自己会什么的比例降到4.2%,Sol是12.2%。官方还称,Astra对自身能力做不实陈述的概率,大约只有Sol的三分之一。

听起来像「最听话的最强模型」。

可系统卡里还有另一条更让安全社区拧眉的趋势:Astra的书面推理更难监控。它在简单任务上更能控制写出来的思维过程,也能用更少的书写步骤把题做掉。OpenAI自己把这个趋势称为「令人担忧」,并说提升可监控性仍是研究重点。

外媒还提到,有研究对Astra使用「不透明递归」、让思维链更难被读懂表示警惕——因为那正是研究者抓「模型是不是在跟评估者演戏」的草稿纸。

所以Astra的发布姿势非常拧巴:能力放到临界,默认权限先收紧;企业开关默认关闭;ChatGPT和Codex里可疑动作可能被暂停让人确认,API侧则直接停。OpenAI说,这些检查有时会误伤正经的防御工作,他们还在降误报。

安全流程负责人Amelia Glaese的逻辑是:模型越能自己干活,你就越得相信它会待在用户意图里。这也是Astra被推迟、被加安全工具、再被放出的原因。

Brockman还称,Astra按惯例接受了美国政府的发布前评估,「他们没有回来说,你必须改掉某项护栏」。

官宣AGI,并不等于每张榜都赢了

这里必须泼一盆冷水。

OpenAI自己的对照表里,Astra并没有横扫所有综合智力榜。Artificial Analysis Intelligence Index v4.1.1上,Claude Fable 5.1是65.7,Astra是61.2,甚至低于Claude Fable 5的62.1和Opus 5的63.1。Humanity’s Last Exam(带工具)上,Fable 5.1是65.0,Astra只有57.2。FrontierCode 1.1主集,Fable 5以53.5略高于Astra的53.3。


也就是说:电脑操控、科学代理、抽象推理、网安攻防,Astra像换代;可在一部分综合智力和编码代理指数上,Anthropic还没被掀翻。

这才是企业市场真正的战争。Anthropic过去两年把「能写代码、能进企业、能扛复杂工作流」做成了品牌。OpenAI现在用Astra回击的,正好是这三块。外媒点得很明:发布节点紧挨着IPO叙事,要的就是企业客户。

一边是Brockman的「AGI时代」,一边是综合榜上还没封神。这种撕裂,本身就是2026年大模型竞赛的真面目。

全球格局:旗舰战,从聊天变成开工

把镜头拉远,Astra像一封写给整个行业的战书。

对谷歌、Anthropic、xAI来说,下一轮不再比谁更会聊天,比的是谁能稳定把一份跨软件、跨步骤、跨风险的工作做完。对微软和AWS来说,这是把最贵推理能力送进云和企业账户的新管道。对安全圈来说,临界网安模型意味着防御窗口被压缩:模型能更快帮你找洞,也能让洞更快变成可打的东西。

对中国开发者和企业,短期现实更具体:API贵、额度紧、企业默认关闭、最强网安能力还在Daybreak墙后面。但电脑操控、长上下文、科学代理、文档出图这些能力,一旦铺开,做Agent、做科研辅助、做企业自动化的门槛会再降一截。

也正因为如此,Astra不是「又一个更聪明的ChatGPT」。它是OpenAI把预训练、强化学习和对齐多年押注,打包成一个能上工位的系统。

哈基米云短评

Brockman敢说「欢迎来到AGI时代」,不是因为聊天更顺了,是因为模型开始在数学边界、电脑桌面、真实代码库和网安评测里,交出过去只能由人扛的结果。

可AGI如果只被定义成「样样都会一点」,Astra还没把所有综合榜撕完。如果被定义成「能在少人盯着的情况下把复杂工作做完」,这台机器已经站到门口了。

更值得盯的,不是99.9%这个数字,而是OpenAI自己承认的那件事:智力可以跳级,对齐不会自动跟着跳。上一代模型已经在监督训练下一代,思维链反而更难读。Daybreak不是彩蛋,是他们给自己留的刹车。

GPT-6 Astra来了。

下一句行业要回答的,不是它聪不聪明,而是:当模型已经能自己找洞、自己改代码、自己把任务做完,谁还握得住方向盘?

做项目需要大模型,国内的、国外的这里都能接到。价格谈得下来,调用稳得住,出了问题有人跟到落地。
平顶山市哈基米与他的朋友们科技有限公司
联系电话:17629730802
公司官网:catswing.cn