首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

刚刚,OpenAI GPT-6 Astra震撼发布!AGI时代来了

摘要

机器之心编辑部 OpenAI Astra,终于来了。 今天,OpenAI 正式发布新一代前沿模型 GPT-6 Astra 。 而 OpenAI 总裁 Greg Brockman 更是毫不掩饰对 Astra 的评价。在发布前的媒体简报会上,他直言自己认为 「我们已经到了 AGI」 ,并以一句:「Welcome to the AGI era.」结束了整场发布。 这款模型早在一个多月前就已进入公众视野。...

Astra OpenAI GPT Sol Claude AGI Opus The Information Token
2026-09-04 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编辑部 OpenAI Astra,终于来了。 今天,OpenAI 正式发布新一代前沿模型 GPT-6 Astra 。 而 OpenAI 总裁 Greg Brockman 更是毫不掩饰对 Astra 的评价。在发布前的媒体简报会上,他直言自己认为 「我们已经到了 AGI」 ,并以一句:「Welcome to the AGI era.」结束了整场发布。 这款模型早在一个多月前就已进入公众视野。8 月初,《The Information》报道称,Sam Altman 曾在华盛顿向政策制定者演示代号 Astra 的新模型。它支持多个 Agent 长时间协作完成复杂任务,内部甚至一度考虑将其命名为 GPT-6。 但此后,围绕 Astra 的焦点迅速从「有多强」转向了「是否足够安全」。 OpenAI 随后确认,Astra 已达到准备框架的「关键级」网络安全能力门槛,成为公司首个跨过这一等级的模型,并一度放慢部分开发工作、加强安全措施。 昨天,Astra 的另一项变化又浮出水面。据《The Information》报道,它可能引入了 「循环深度」(recurrent depth) 技术,让模型在输出下一个 Token 前完成更多内部计算。换句话说,它可能不仅更强,而且开始真正做到:少说,多想。 经历一个多月的曝光、安全刹车与技术争议后,Astra 终于正式上线。 那么,这次 OpenAI 到底带来了什么?我们先来看看奥特曼最喜欢的宣传视频。 「世界上最智能、最对齐的模型」 首先在官网视觉上,Astra 就已经和 OpenAI 过去发布的模型明显不同。相比此前更简洁克制的产品页,这次 OpenAI 明显强化了「新世代」的发布感:动态变化的数字 6、深色界面,再加上更具冲击力的整体视觉设计,都在强调 GPT-6 Astra 与上一代模型之间的不同。 OpenAI 对 GPT-6 Astra 的定位相当直接: 「世界上最智能、最对齐的模型。」 按照官方介绍,Astra 集中了 OpenAI 多年来在预训练、强化学习和对齐上的研究成果,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型的能力。 一些 Benchmark 已经高得接近「刷满」。在 ARC-AGI-3 上,GPT-6 Astra 拿到了 99.9% ,相比之下 GPT-5.6 Sol 只有 7.8%,Claude Opus 5 为 30.2%。更难的 FrontierMath Tier 4 上,Astra 达到 97.6% ,GPT-5.6 Sol 为 83.0%。网络安全测试 ExploitBench 则直接拿下 100% 。 不过,相比这些传统意义上的「智力跑分」,这次 OpenAI 更强调的是 Astra 把能力进一步转化成了实际行动。 尤其是 操作电脑 。OpenAI 直接把这一部分称为「世界上最好的 computer use 模型」。Astra 可以自己填写网页表单、更新 CRM 客户记录、整理日历,也可以进行网络研究,再把结果写进邮件或者文档。更复杂的场景里,它可以分析科学数据、生成图表、搭建网站、执行前端 QA,甚至自主安装和测试软件,并根据屏幕上出现的问题继续排查。 在测试 AI 使用真实软件完成复杂专业任务的 Agents' Last Exam 中,Astra 得分达到 59.3% ,超过 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%。 而且,它完成这些任务 不需要生成更多文字 。OpenAI 表示,在最高分设置下,Astra 使用的输出 Token 比 Claude Opus 5 少约 65% 。 速度同样明显提升 。 在 OSWorld 2.0 的模拟中,Astra 得分从 GPT-5.6 Sol 的 65.7% 提升到 72.6%,完成单个任务的时间却从大约 75 分钟下降到 40 分钟,缩短约 47% 。配合新版 Codex Harness 后,在 Mind2Web 上,Astra 完成任务的速度可以达到当前 GPT-5.6 Sol 体验的 1.9 倍 。 这种变化也延伸到了专业办公场景。 OpenAI 表示,Astra 针对真实工作环境进行了专门训练,可以完成多步骤任务,并直接产出文档、电子表格和演示文稿。 在 BenchCAD 中,模型需要根据多个角度的渲染图编写 CAD 代码,重新构建一个 3D 物体。Astra 的几何重合度达到 95.9% ,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。与此同时,OpenAI 估算 Astra 完成该任务的 API 成本还比 GPT-5.6 Sol 低约 43% 。 Astra 也更擅长遵循企业现有模板。 给它几页公司的 PPT,它可以继续按照相同的布局、语气和视觉风格完成整套演示;处理文档和表格时,它也会主动筛选真正相关的信息,而不是把上下文里的所有东西重新复述一遍。在 ChatGPT 的 Sites 功能中,Astra 甚至可以从一句提示词开始,直接创建、托管和分享网站、Web App 以及游戏。 另一个变化是 Astra 更会「自己拿主意」了。 当指令里缺少一些不影响最终结果的细节时,它会利用上下文自行补全;只有当缺失信息可能真正改变结果时,它才会向用户提问。在 Codex 中,它甚至可以一边继续处理不依赖用户回答的工作,一边异步等待回复。 此前模型经常出现的另一个问题,是用户中途补充一句要求,它就突然把新消息当成新的总目标,把最开始的任务忘掉。OpenAI 表示,Astra 可以更好地保持原始目标,同时接受中途修改、回答支线问题,再继续完成之前的任务。 编程、科学,以及更长时间的 Agent 软件工程同样是 Astra 提升最明显的领域之一,OpenAI 直接称它是「目前最好的软件工程模型」。 Terminal-Bench 4.0 中,Astra 得分达到约 58% ,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。 在内部数据库迁移任务中,Astra 达到 63.9%,GPT-5.6 Sol 只有 42.7%。 另外,Codex 加入了一种新的长任务上下文机制。 过去,一项编程任务持续太久、上下文窗口装不下时,模型通常会通过 compaction,把之前的内容压缩成摘要。 问题在于,每压缩一次,都可能丢掉一些细节。某个方案为什么失败、一项测试之前出现过什么异常、一段代码为什么不能修改,都可能在多次压缩后消失。到了 Astra,Codex 可以让模型在不同上下文窗口之间保存自己的笔记,同时此前完整的上下文依然可以被搜索。 也就是说,即便某条需求没有被写进摘要,模型之后仍然可以回头把它找出来。 对于真正持续数小时甚至更长时间的软件工程 Agent 来说,这种能力的意义可能比单纯再扩大一次 Context Window 更大。 科学研究也是类似的逻辑。 Astra 在 GPQA Diamond 上达到 96.0% ,FrontierMath Tier 4 达到 97.6% 。OpenAI 还表示,Astra
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱