GPT-6 Astra 带着每日一次重置来了,游戏人怎么看

三家一起挂了
2026 年 9 月 3 日晚上,我同时开着 Claude Code 和 ChatGPT 写代码,两个都挂了。打开 Grok 看看情况,Grok 也挂了。
御三家集体宕机。OpenAI 放出了 GPT-6 Astra。
先说实用的
坏消息:现在还用不到。OpenAI 说"最近几天"推送给订阅用户。
好消息:在推送完成之前,每天会给用户一次额度重置。所以这几天每天都要把额度用光——白给的不用白不用。

GPT-6 Astra 来了
这次发布的是 GPT-6 Astra。后续还有 GPT-Image-2.5 生图模型和传闻中 750 Token/s 的超快版本,预计近期也会放出来。
官方给 Astra 的定位是"世界上最智能、最协调的模型",说在 Computer Use、Browser Use、软件工程、网络安全、科学和专业工作上都是新标杆。
先看数据再下判断。
Coding:贴身肉搏
Coding benchmark 数据(来源:量子位公众号):
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.7% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 67.4% | 73.7% |
| FrontierCode 1.1 Extended | 64.5% | 63.6% | 63.6% |
| FrontierCode 1.1 Main | 53.3% | 50.9% | 53.4% |
| Internal DB Migration | 63.9% | 57.8% | — |
| AA Coding Agent v1.4 | 67.0 | — | 68.1 |
Astra 在多数项上领先,但差距都在几个百分点以内。Claude Opus 5 在 DeepSWE v1.1 上拿到 73.7%,只比 Astra 的 74.1% 低 0.4 个点;Artificial Analysis Coding Agent Index v1.4 上 Opus 5 的 68.1 反超了 Astra 的 67.0。
不是碾压,是贴身肉搏。
定价:和 Claude Fable 5 一个价
| 模型 | Input ($/M tokens) | Output ($/M tokens) |
|---|---|---|
| Claude Fable 5 / Claude Mythos 5 | $10 | $50 |
| Claude Fable 5.1 / Claude Mythos 5.1 | $10 | $50 |
| GPT-6 Astra — Standard | $10 | $50 |
| GPT-6 Astra — Fast | $20 | $100 |
Astra Standard 和 Claude Fable 5 的 API 定价完全一样,50 输出。OpenAI 卡在同一个价位上,benchmark 比你高一点点。
Playbot:让模型进游戏引擎
这次 Astra 发布最让我多看了几眼的是 Playco 的 Playbot。
Playco 用 GPT-6 Astra 做了一个 AI 驱动的游戏开发 IDE,直接连到 Unity 和 Godot。模型能编辑场景、运行游戏、验证自己的修改、并行处理多个任务。
游戏开发不只是写代码。一个功能写完,你还得看它在场景里的空间布局对不对、UI 在不同分辨率下响应不响应、玩起来手感怎么样。以前的 AI 编程工具帮你写完代码就结束了,剩下的全靠人在引擎里一个个检查。
Playbot 的做法是让模型直接在引擎里跑。写完代码,模型自己启动游戏,看画面,发现 bug,改了再跑。Playco 说 Astra 的空间推理能力有提升,重建参考图像更准了,Unity 里 UI 的响应性也改善了。
模型能自己玩游戏并验证修改——这意味着它不只是在找编译错误,而是在找体验问题。
但这不应该是旗舰模型干的活
做了十年游戏引擎,我对 Computer Use 接入游戏引擎这件事的判断是:方向对,但模型选错了。
Astra 的 Computer Use 能力确实到了一个新水平。自主操作电脑、在引擎里搭场景、跑测试、找 bug——这些事情有价值。
问题是这些活的本质是什么?自动化测试。搭建场景、摆放物件、跑测试用例、做视觉回归。这些是需要大量重复执行的任务,对推理深度的要求远低于架构设计或方案决策。
用 50 的顶级模型去跑自动化测试,成本账算不过来。一个中等规模的游戏项目,光场景测试一天就能跑几百次。这些活应该是中低价位的模型来干。
我个人的判断:Astra 整体是 Fable 级别,没有超过 Claude Fable 5.1。Computer Use 是它最大的卖点,但这个卖点装在了错误的价位上。
真正期待的是 GPT-6 的 Luna 版本
当 Computer Use 这个能力下放到中低价位模型的时候,游戏开发才会真正受益。
GPT-6 的 Luna 版本如果能做到:用可接受的成本跑各种测试用例、找 bug、做图像识别、处理需要视觉验证的任务——那才是我会日常接入工作流的东西。不是每次测试都需要顶级智能,但每次测试都需要能看懂画面。
御三家的差距在缩小
Claude Fable 5.1 刚发布不久,Astra 在 coding 上就追平了。Grok 这边,Grok 4.7 将在一周后发布,Grok 5 预计 2026 年 11 月到。三家在大模型顶级能力上的竞争已经白热化。
从我做独立游戏和工具的角度看:顶级模型之间谁的 benchmark 高 1% 已经不重要了。重要的是这些能力什么时候下放到日常可用的价位。
我的工具栈不变。Claude 做上限,Codex 做日常开发。等 Astra 推送到位后试一把 Computer Use,但真正让我期待的是 GPT-6 的 Luna 版本。
💬 评论 0
Lumio暂无评论 — 选中段落或在下方留下第一条想法