医疗健康
morning
AGI,真的来了?
2026-09-05
1 阅读
约10分钟阅读
AIX财经
字号:
文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠 9月3日凌晨,预热已久的GPT-6 Astra正式发布。 发布前半个月,OpenAI一直在为这款模型的发布释放信号。8月18日,在判断Astra可能达到“Critical”网络安全能力阈值后,公司放慢部分前沿模型训练,并暂停两周面向部署模型的强化学习训练,用来加强监控、对齐和研究环境安全。9月1日,OpenAI进一步披露Astra的安全评估情况。几轮信息提前放出之后,GPT-6 Astra在正式发布前已经积累了不少关注。 但发布之后,大部分用户暂时还用不了。目前,GPT-6 Astra只向少量机构开放,Plus、Pro、Business等付费用户将在未来几天陆续获得访问权限,API也会逐步开放。面对用户的等待,OpenAI很快给出了一套补偿方案。Codex负责人Tibo表示,付费用户每有一天无法使用Astra,就会获得一次可以留到之后使用的额度重置。这也缓解了部分用户对延迟开放的不满。 回到模型本身,这次更新最值得关注的变化主要有两个: 模型更能直接操作电脑,也更擅长完成复杂任务。 OpenAI称GPT-6 Astra是目前最智能的模型,相比GPT-5.6 Sol,它在软件工程、科研、网络安全和专业工作等方向都有提升,计算机操作进步尤其明显。 API的价格也提高了。 GPT-6 Astra的API价格为每百万Token输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍,与Anthropic最新旗舰Claude Fable 5.1处在同一价格水平。 OpenAI还提供Fast Mode,生成速度可以提高至约2倍,但价格也会翻倍。 OpenAI对这次升级的定调也比以往更高。在发布前的媒体沟通会上,公司总裁Greg Brockman表示,“欢迎来到AGI时代”,并认为几年后回头看,人们可能会把GPT-6 Astra视为AGI时代开始的一个节点。 关注度有了,能力也确实更强了。此外,OpenAI与Anthropic也都进入了上市筹备阶段。GPT-6 Astra足以支撑OpenAI口中的AGI时代了吗?又能不能帮OpenAI在新一轮竞争中占据主动? 01.跑分接近上限,长任务进步更明显 先来看最直观的跑分成绩。我们主要关注两类,一类是成绩已经接近测试上限的,另一类是相比上一代提升明显的。 先看第一类。在OpenAI公布的基准测试中,GPT-6 Astra在ARC-AGI-3上的得分达到99.9%,ExploitBench达到100%;FrontierMath Tier 4 v2的正确率也达到97.6%。 这三项测试考察的能力各不相同。ARC-AGI-3考察模型能不能在陌生环境摸索出规则并迁移到更难的关卡,测的是对新环境的理解和适应;FrontierMath Tier 4 v2考察高难度数学推理;ExploitBench则要求模型针对已知漏洞,构造出可以运行的漏洞利用程序。 这说明,GPT-6 Astra在研究级推理、陌生环境适应和复杂网络安全任务上已经表现出很强的能力。 尤其是ARC-AGI-3,今年3月刚推出时,前沿模型得分还不到1%。GPT-6 Astra如今接近满分,说明这类过去能够明显拉开前沿模型差距的陌生环境推理任务,已经很难再成为它的瓶颈。 图源 / Artificial Analysis官网 不过,第三方综合测试给出的成绩没有这么突出。在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档拿到61分,与GPT-5.6 Sol持平,排名第5,低于Claude Fable 5.1最高档的66分。 从综合成绩来看,GPT-6 Astra并没有和上一代拉开明显差距,它的进步更多集中在部分能力上。 接下来,我们再看相比上一代提升明显的部分。 这主要 集中在操作电脑、调用工具、连续执行步骤以及处理更长任务这些Agent能力上。 其中,科研工作流测试Terminal-Bench Science 0.1的变化最大,GPT-6 Astra从GPT-5.6 Sol的22.4%提高到64.6%,接近上一代的三倍。其他长程Agent和自动化任务测试也普遍提高了20个百分点左右。 电脑操作的成绩也有明显的进步。ScreenSpot-Pro从76.9%提高到92.7%,意味着GPT-6 Astra在看懂界面、找准操作位置这件事上更加实用了。OSWorld 2.0则达到72.6%,分数只增加了6.9个百分点,但完成一项任务的模拟平均时间从约75分钟缩短到40分钟,耗时减少了接近一半。 这些变化,也能从第一批拿到GPT-6 Astra的用户实测中看到。 一位网友让GPT-6 Astra在Unreal Engine(虚幻引擎,3D创作工具)里搭建曼哈顿的虚拟场景,整个任务持续了一周。他提到,GPT-6 Astra可以沿着街道逐步补充建筑和环境细节,持续运行多天后,仍能继续此前的进度完善场景。不过效率仍然有限,他提到,按照目前的速度,如果要把整个纽约做完仍需要数月。 曼哈顿的虚拟场景 另一位网友做了包括生成3D模型和动画、制作游戏等六组测试。他认为,这一代模型的能力提升比此前更明显,尤其是在长时间运行中表现稳定。实测期间,他同时运行了数百个Agent,也没有遇到明显问题。 摩托艇游戏 Codex团队的Thomas Ricouard则重点测试了GPT-6 Astra的3D建模能力。他让模型根据一栋房屋的平面图完成3D场景的搭建,GPT-6 Astra先在Blender中完成建模,再把场景转到Unreal Engine,最终生成一个可以实时“行走”的3D空间。除了最开始几次提示词,后续的天空盒、电影化灯光、镜头角度等都由GPT-6 Astra完成。Ricouard认为,GPT-6 Astra非常擅长3D建模,它对材质、纹理和视觉效果的处理比较到位。 房屋3D场景 这些实测还只是早期样本,但它们和官方跑分呈现出的方向基本一致。GPT-6 Astra明显的增量,集中在长时间执行、专业软件操作,以及把多种能力连续串进一项复杂任务。 02.模型开始吃掉Agent? GPT-6 Astra有两个变化值得单独展开。 一个是Computer Use(电脑操作能力),模型可以直接读取电脑界面,在软件里完成操作;另一个是Judgment(判断力),模型会自己处理一些不影响方向的小问题,只在真正需要用户拍板时停下来询问。 一个解决怎么动手,一个解决什么时候该自己做主。 先来看Computer Use。简单来说,就是让模型像人一样看着屏幕干活。它通过截图理解当前界面,根据用户目标判断下一步该做什么,再把计划转成点击、输入等实际操作。执行完成后重新读取页面,继续下一步,形成一个循环。 图源/OpenAI官网展示的寻找儿童医生的演示 它提供的是一条更通用的软件操作路径。很多Agent要接入外部系统,通常需要开发者提前接好API、MCP或者专用工具。Computer Use则让模型直接操作原本为人设计的图形界面,在没有现成接口的情况下,也可以继续完成任务。 这项能力此前已有过尝试。2024年,Anthropic就已经在Claude上开放了Compute
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱