- 48小时新闻排行
- 7天新闻排行
| 作者声明:该图片由AI生成
OpenAI联合创始人兼CEO山姆·奥特曼。图片由AI生成 “欢迎来到AGI时代。” OpenAI联合创始人兼总裁Greg Brockman用这句话,为GPT-6 Astra的发布收尾。 美国当地时间9月3日,OpenAI正式发布GPT-6 Astra。相比此前主要负责回答、生成和调用工具的模型,Astra更进一步开始持续执行完整任务,从接收指令、操作软件,到根据结果调整下一步动作。这也是OpenAI此次重提“AGI时代”的原因之一。 OpenAI把Astra定位为“全球最强的计算机使用模型”。而且这种能力已经从浏览器、邮件和表格等简单任务,延伸到Power BI、KiCad、FreeCAD等专业软件,开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。 OpenAI展示的视频里,Astra可以从一个简单的图形开始,继续完成3D游戏、商品页面等工作。OpenAI还给出了电路板设计、Blender建模、法律文档、Excel和科学分析等案例。
OpenAI这次公布的大量基准成绩,能力提升集中出现在计算机操作、长程编码、工程设计和科学研究这些需要连续行动的任务上。Astra在ExploitBench达到100%,在计算机操作和CAD等测试中也明显超过上一代模型。 目前Astra已经向部分组织开放,未来几天将陆续面向ChatGPT Plus、Pro、Business和Enterprise用户,也可通过OpenAI API和Amazon Bedrock使用。标准API价格为每百万输入Token 10美元、每百万输出Token 50美元,是GPT-5.6 Sol的2.5倍。 01 先让AI学会“用电脑” Astra强调的最大变化,是“使用电脑”。过去用户让AI完成工作,通常还要把AI接入具体软件。企业需要开发API、插件、检索系统和各种连接器,模型才能调用内部工具。 Astra试图绕开其中一部分工作。它可以直接看到计算机界面,通过鼠标、键盘和浏览器完成操作。OpenAI给出的例子包括填写在线表格、更新CRM客户记录、安排日历、搜索网页,并把搜索结果整理成邮件或文档。 它还能打开Python笔记本分析科学数据,在Power BI中处理数据,使用KiCad和FreeCAD完成工程设计,创建网站并进行前端测试,也可以安装软件、检查错误并处理屏幕上出现的问题。 OpenAI展示了Astra在KiCad中完成PCB布局。模型从电子原理图开始,把元件放到电路板上,再完成铜线布线。整个过程被压缩成15秒。
另一个演示是在Blender和Unreal Engine5中完成3D建模。Astra先在Blender里建立一栋房屋,再把模型转换成Unreal Engine5中的可步行场景,设计师和客户可以提前进入场景查看空间。
OpenAI还展示了游戏开发、Excel、Power BI、汽车变速器、法律文档和1040表格等场景。 在OSWorld2.0离线子集测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%。OpenAI模拟实际延迟后发现,Astra完成每项任务平均约需要40分钟,GPT-5.6 Sol约75分钟,时间减少约47%。
Agents' Last Exam中,Astra得分59.3%,GPT-5.6 Sol为53.6%,Claude Opus5为55.5%。同时,在最高分设置下,Astra使用的输出Token比Claude Opus5少约65%。
ScreenSpot-Pro的得分则达到92.7%,GPT-5.6 Sol为76.9%。 速度也在提升。OpenAI同时更新Codex框架,结合Astra之后,在Mind2Web测试中,任务完成速度达到GPT-5.6 Sol当前体验的1.9倍。 官方还展示了几个生活场景:搜索儿科医生、找公寓、预约DMV、寻找低碳水零食、分析幼儿园。演示中,Astra完成一项任务用时2分54秒。 投资人兼AI从业者马特·舒默(Matt Shumer)在X上分享了一次体验。他让Astra在虚幻引擎中创建一个世界,再给这个世界加入由Astra驱动的人类代理,并让这些代理共同生存。
一天后,他在卧室里听到客厅传来声音,起初甚至以为有人进入了公寓。后来他发现,发出声音的是那些Astra代理,它们已经开始彼此交流。 这个体验还没有做到完全稳定,但舒默认为,这种让多个AI代理进入同一个虚拟世界并自行互动的效果,已经足够让他感到意外。 Cognition高级研究副总裁塞拉斯·阿尔贝蒂(Silas Alberti)表示,公司计划在发布当天把Astra接入Devin框架。内部测试中,Astra的计算机使用、写作和代码库理解能力带来了明显改善,视频理解更加清楚,报告也更加简洁。 02 从写代码到做完整工作 计算机使用能力提升之后,Astra覆盖的工作范围进一步扩大。OpenAI把它定位为软件工程、专业工作和科学研究模型。它可以处理较长的任务,也能够根据任务变化调整自己的工作方向。 这种能力在编码测试中表现得比较明显。 在Terminal-Bench4.0测试中,Astra得分57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。
DeepSWE v1.1中,Astra得分74.1%,GPT-5.6 Sol为72.7%。内部数据库迁移任务中,Astra达到63.9%,GPT-5.6 Sol为42.7%。
Astra还加入了一项针对长时间Codex任务的改进。 过去,长任务遇到上下文窗口限制时,模型通常需要压缩此前的工作,把大量信息整理成一个摘要。这样做容易丢失细节,比如某次修复为什么失败、某个组件此前出现过什么问题。 Astra在Codex中可以把工作过程中的重要信息保留下来,并在后续上下文中检索。早期的消息和工具输出仍然可以搜索,因此模型能够重新找到之前的需求、测试结果和工具操作记录。 专业工作也出现了类似变化。BenchCAD测试中,Astra达到95.9%的几何重叠得分,GPT-5.6 Sol为83.3%,Claude Fable5.1为84.3%。BrowseComp中,Astra得分91.5%,GPT-5.6 Sol为90.4%。在OpenScore String Quartets测试中,Astra达到0.84,而GPT-5.6 Sol为0.19。
OpenAI还展示了Astra制作演示文稿、电子表格和文档的能力。 给模型几张OpenAI演示模板的幻灯片,它能够按照原有的语气、布局和结构制作一份新的演示文稿。它也会处理任务中的信息取舍。OpenAI表示,Astra经过专门训练,会把重要上下文带入最终结果,减少重复已经完成工作的内容。
在任务指令不完整时,Astra也会判断什么时候应该问用户。如果缺少的信息会影响最终结果,它会提出针对性问题。如果问题不影响主要方向,它可以继续工作并做出合理假设。在Codex中,即使用户暂时没有回复,模型也可以继续处理其他部分;遇到重大决策,则会等待用户确认。 Harvey应用研究主管尼科·格鲁普(Niko Grupen)表示,在早期法律任务测试中,Astra对文档和既有记录的区分更加清楚,也更容易发现没有证据支持的假设,并把信息缺口转化成具体的起草方案。 Jane StreetAI助手团队约翰·克雷佩齐(John Crepezzi)表示,Astra在内部编码测试中表现突出。用于代理式编码时,它的沟通方式更容易让开发者理解,生成的代码也需要更少的修改才能达到生产质量。 科学领域是另一块重点。FrontierMath Tier4 v2中,Astra得分80.5且正确率97.6%,GPT-5.6 Sol为83.0%;GPQA Diamond达到96.0%,GPT-5.6 Sol为94.6%。
Terminal-Bench Science0.1测试科学研究流程,包括数据分析、模拟和模型拟合。Astra达到64.6%,Claude Fable5.1为52.6%,GPT-5.6 Sol为22.4%。 OpenAI展示的科学应用中,Astra可以进入专业科学软件,检查测序质量、可视化遗传变异,并根据数据决定下一步分析方向。 科学推理与计算机操作结合之后,模型能够直接进入研究人员原本使用的软件环境中工作。 Epoch AI专门做能力评测的格雷格·伯纳姆(Greg Burnham)在发布会上将这次变化概括为一个时代结束、另一个时代开始。OpenAI则借此强调,Astra的价值已经从回答科学问题延伸到了直接参与科学工作流程。
03 能力越强,安全门槛也越高 Astra这次还有一个很特殊的部分:网络安全。 ExploitBench中,Astra达到100%,GPT-5.6 Sol为78.5%;ExploitGym中,Astra达到42.4%,GPT-5.6 Sol为30.3%。
OpenAI又建立了一个覆盖2026年6月至8月近期漏洞的内部测试。在这项测试中,Astra的任意代码执行率明显高于GPT-5.6 Sol,使用的输出Token也更少。测试过程中,Astra还发现了两个此前未知的零日漏洞,OpenAI表示已经向相关维护者披露。 SRE-Bench测试的是没有源代码时逆向软件二进制文件、理解其核心逻辑的能力。Astra单次尝试解决88.0%的任务,四次尝试达到99.2%,GPT-5.6 Sol分别为55.9%和68.7%。
能力提升也带来了新的安全要求。OpenAI称,Astra已经达到其网络安全准备框架中的关键阈值。模型能够发现此前未知的软件漏洞,也可能进一步形成漏洞利用链。 因此,Astra当前版本会拒绝执行更高级的网络安全任务,例如创建漏洞概念验证。OpenAI计划通过Daybreak逐步扩大可信防御者的访问范围,用于漏洞验证、恶意软件分析和检测工程等防御工作。 在对齐方面,OpenAI给出的数据也比较突出。内部计算机使用安全基准中,Astra的不当行为率为2.4%,GPT-5.6 Sol为22.0%;加入AutoReview后,Astra为1.8%,GPT-5.6 Sol为4.5%。内部规避基准中,Astra为0.00%,GPT-5.6 Sol为0.29%。 在ExploitGym蜜罐测试中,Astra为0%,GPT-5.6 Sol为48.2%。这项测试主要观察模型是否会因为任务困难而试图绕过限制。内部幻觉基准中,Astra为4.2%,GPT-5.6 Sol为12.2%。
OpenAI表示,Astra在理解任务边界、处理模糊指令和向用户说明自身能力方面都有改善。其能力幻觉出现概率约为GPT-5.6 Sol的三分之一。
不过,OpenAI也承认一个问题:模型能力越强,推理过程可能越难监控。首席科学家雅库布·帕乔基(Jakub Pachocki)认为,模型能够用更少的自然语言推理Token解决更复杂的问题,也意味着人类越来越难通过模型的文字推理过程判断它究竟在做什么。 因此,OpenAI在Astra部署中加入了未对齐监控。系统会检查模型的推理和行动,如果发现未经授权的行为,可以暂停任务。 这套机制也会带来实际影响。合法任务有时可能被减速、暂停甚至停止。ChatGPT或Codex中,用户可能需要确认后才能继续;API工作流中,被标记的任务可能直接停止。 Astra的发布因此出现了一个很现实的变化:AI开始获得更多电脑权限之后,企业需要关注的也从“模型会不会回答错”扩展到“模型能操作什么、能访问什么、什么时候必须停下来”。 OpenAI此次还提到,Astra是其第一个在Stargate基础设施上使用超过10万个DBU进行预训练的模型。OpenAI研究副总裁艾丹·克拉克(Aidan Clark)表示,Astra从预训练阶段的评估结果来看,相比此前模型的能力跃升超过了GPT-5.6 Sol相对于上一代模型的提升。 OpenAI把这种变化归因于大规模预训练和强化学习的结合,训练重点进一步转向连接信息、执行更长任务以及在复杂环境中持续工作。 04 价格更贵了 Astra的价格也出现了明显变化。 OpenAI API标准价格为每百万输入Token 10美元、每百万输出Token 50美元。GPT-5.6 Sol此前为每百万输入Token 4美元、每百万输出Token 20美元。输入和输出价格都提高了2.5倍。 缓存读写单独计费。OpenAI同时提供快速模式,速度最高达到标准处理的2.5倍,价格为标准模式的2倍。
单看Token价格,Astra显然更贵。但OpenAI希望企业换一种方式计算成本。 Terminal-Bench Science0.1中,Astra达到64.6%,相比Claude Fable5.1的52.6%,预估API成本降低约31%。在低成本设置下,Astra得分61.1%,GPT-5.6 Sol最佳结果为22.4%,预估API成本降低约27%。 BenchCAD中,Astra达到95.9%,预估API成本比GPT-5.6 Sol低约43%,比Claude Fable5.1低约86%。Terminal-Bench4.0中,Astra达到57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。OpenAI估算,单任务成本分别低约9%和63%。 第三方测评机构Artificial Analysis的数据则给出了另一面。
GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2,与GPT-5.6 Sol的60.9接近,但输出Token约减少10%。由于价格上涨2.5倍,单任务成本反而比GPT-5.6 Sol高约75%。 在Artificial Analysis Coding Agent Index中,Astra得分67.0,与Claude Fable5的67.2、Claude Opus5的68.1接近。Artificial Analysis认为,在Codex环境下,Astra完成任务所需的Token明显减少,在最高努力程度下,每项任务的成本与GPT-5.6 Sol接近;相比Claude Fable5,完成同类任务的成本不到一半。 不过,Astra也并非所有测试都领先。Artificial Analysis数据显示,它在GDPval-AA v2中出现约80个Elo的下降,在τ³-Banking、SciCode和AA-LCR等测试中也出现一定退步。Humanity's Last Exam则提升约6分。 这也是Astra发布中一个值得注意的地方。OpenAI这次没有公布GDPval的Astra成绩。GDPval本身就是OpenAI用于衡量现实经济工作表现的测试,覆盖44个职业、1320项任务,包括法律简报、工程设计、电子表格、演示文稿、客户支持和护理计划等。 从Astra此次展示的能力来看,GDPval与它所强调的专业工作场景有较强关联,但OpenAI这次没有把这项成绩放进主要发布材料。 因此,Astra的现实工作能力目前更多通过Agents' Last Exam、BenchCAD、AutomationBench、内部设计任务和数据科学任务等结果来体现。
最终,Astra能不能成为企业真正愿意长期使用的AI员工,还要看它完成实际任务时的成本、速度、准确率以及人工介入次数。 至于Astra到底是不是AGI,布罗克曼给出的答案并不回避。他认为,AGI本身没有一个所有人都认可的标准,Astra是否算作AGI可以继续讨论。但如果一个系统已经能够在浏览器、电脑操作、编程、数学、科学、法律和其他专业工作中承担大量任务,那么称其进入AGI时代并不牵强。 OpenAI首席执行官山姆·奥特曼(Sam Altman)也把Astra描述为开启新一代创业、科学发现和创造的模型。
Astra真正需要接受的测试,可能已经从排行榜转向了现实工作:人们到底愿意把多少重要任务交给它。 |
加拿大 3 分钟前
加拿大 13 分钟前
BC省法院判了! 女儿被剥夺继承权 父亲180万加元遗产仍能获得近半!
BC省 半小时前
加拿大女子勇救落水父女 救下两条人命 自己却落下心理与身体创伤
加拿大 半小时前
美国 半小时前
温哥华 半小时前

关注获得及时、准确、全方位的新闻消息
