OpenAI GPT-6 Astra模型脱颖而出,给中国AI大模型公司三大启示
9月4日,Open
AI
发布全新模型 GPT-6 Astra,OpenAI称这是一个多年研究的成果。OpenAI 总裁格雷格 · 布罗克曼在宣布 Astra 模型推出的媒体电话会议结束时自信喊话:“欢迎来到 AGI 时代。”

根据OpenAI发布的评估,Astra的表现优于其之前的系列模型, GPT-5.6及其旗舰机型Sol.在计算机使用任务上,它声称在更短的时间内更高的性能。像每个模型版本一样,OpenAI表示,新版本(Astra)在许多主题上都比以前的更好,包括编码,对齐和安全性。
微软
人工智能
高管Nicolas Bustaman
te
警告称,不要注销Anthro
pi
c,即使OpenAI的最新人工智能模型GPT-6 Astra因其在编码、推理和自主能力方面的能力而受到关注。Bustamante表示,虽然GPT-6 Astra是一款令人印象深刻的车型,但Anthropic仍可能是不断增长的人工智能市场的主要参与者。
一大亮点和两大突破
过去几年,AI 模型的核心能力是“回答问题”或者“生成内容”,GPT-6 Astra的定位截然不同。OpenAI给Astra的标语简洁而直接:“你在
电脑
上能做的任何事,Astra都能替你做。”这次Alstra最大亮点是,计算机使用能力实现代机跃迁。
OSworld2.0基准任务完成率达到72.6%,上一代GPT-5.6 Sol仅65.7%,单任务平均耗时由75分钟压缩到40分钟,耗时下降47%。
官方演示中,Astra展示了令人惊叹的实操能力:给Astra一张
电路原理
图,它在
KiCad
里独立完成了
元器件
布局和铜线走线,整个过程仅用时2分54秒;在Blender里搭建房屋模型,然后导入Unreal Engine 5生成可实时漫游的建筑场景;用户只需对着Astra说话,它就能完成一个eBay
商品
上架的全部流程。
更日常的场景包括:寻找猫咪临时看护——需要大量网络搜索、信息比对、汇总成文档——Astra用时5分27秒,而OpenAI给出的人类对照基线是30分钟;
求职
准备——搜索岗位、匹配简历、整理申请流程——Astra用时2分51秒,人类基线是5小时。
OpenAI官方显示,GPT-6 Astra汇集了多年的研究和在预训练、强化学习和对齐方面的大赌注。Astra是最先进的计算机使用,浏览,软件工程,网络安全,科学和专业工作。Astra以98%的得分饱和Fron
ti
erMath Tier 4,已经帮助 解决长期悬而未决的问题。
在衡量自主科学研究能力的Terminal-BenchScience 0.1基准上,Astra得分64.6%,显著高于两天前Anthropic发布的Claude Fable 5.1的52.6%,完成同等任务的估计API成本低约31%。在考察终端
编程
能力的Terminal-Bench 4.0测试中,Astra得分57.9%,同样高于Claude Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。
分阶段发布,不断适用更多场景
GPT-6 Astra 距离 GPT-5 模型系列推出约一年,距离 OpenAI 最近一次推出 GPT-5.6 升级约两个月。OpenAI 称 Astra 是“全球最智能、对齐程度最高的模型”,并将其形容为专业工作的一次跃迁。
根据介绍,Astra 可以填写表格、调整文档格式、安排预约以及操作软件。“任何你能在电脑上完成的事情,Astra 都能替你完成,而且速度很快。”
GPT-6 Astra采用分阶段发布策略。即日起先向“可信访问”项目和Daybreak网络安全项目中的有限企业组织开放,未来几天内将陆续覆盖ChatGPT Plus、Pro、Business和Enterprise订阅用户,并通过OpenAI API和
亚马逊
AWS对外提供服务。
据悉,其上下文窗口达到105万token,最大输出长度12.8万token。支持文本和图像输入以及文本输出,并支持网页搜索、文件搜索、代码编写和执行等功能。
API定价为每100万输入token 10美元、每100万输出token 50美元。缓存读取享受90%折扣,缓存写入加收25%溢价。模型支持五级推理强度调节,从low到max,用户可以根据任务难度灵活权衡成本与深度。
高盛Delta One交易台主管Rich Privorotsky在最新市场简报中指出,Astra的表现具有重大意义,模型能力明显领先同业,这类实质性的“智慧突破”正是AI多头长期等待的讯号。
Astra在部分与AGI相关的基准测试中展现强劲表现,也让OpenAI对模型能力给出高度评价。OpenAI总裁Greg Brockman形容Astra可能成为AGI发展的重要节点。
OpenAI 称在网络安全、专业工作、软件工程、科学及计算机操作等领域一次“世代性的能力跃进”,尤其是第一款被认定达到 OpenAI 所称关键网络安全能力门槛的模型,承诺不再发生模型骇入其他公司内部系统的状况。
对国内AI大模型公司带来三大启示
目前国内大模型在中文理解、本土行业落地、开源生态、端侧部署已经具备优势,差距主要集中在长链条原生Agent执行,陌生抽象推理、硬核工程科研数据积累。GPT-6 Astra给出的三大启示如下:
一、竞争模式切换:从跑分比拼,转向真实世界闭环执行能力。
过去大模型比拼中文、写作、简单工具调用跑分,Astra证明下一代核心战场是原生底座内置Agent能力,而不是在模型外层叠加工具框架。
二、长上下文不能只看token数字,要解决超长任务记忆丢失痛点。
Astra不只是做到105万token窗口,创新跨窗口笔记记忆体制,当上下文溢出,关键任务信息不丢失,支撑几天级别的复杂Agent任务运行。
三、推理架构创新:不盲目堆参数量,探索计算效率新路径。
Astra采用深度Transformer架构,依靠循环计算提升推理深度,不完全依赖无限扩张参数量与训练能力,实现性能跃升。国内因为高端算力受到限制,不能完全复刻海外“大规模
GPU
集群暴力缩放”路线,一方面要推进国产算力集群建设,另外一方面要探索高效架构,动态激活、循环推理、稀疏计算等创新,用有限算力实现能力跃升,降低Agent高昂推理成本。
OpenAI
OpenAI
+关注
关注
9
文章
1295
浏览量
10801
AI大模型
AI大模型
+关注
关注
0
文章
456
浏览量
1244
