GPT-6 Astra 带着每日一次重置来了,游戏人怎么看

GPT-6 Astra 带着每日一次重置来了,游戏人怎么看

Lumio 交流群与开发者社区二维码

三家一起挂了

2026 年 9 月 3 日晚上,我同时开着 Claude Code 和 ChatGPT 写代码,两个都挂了。打开 Grok 看看情况,Grok 也挂了。

御三家集体宕机。OpenAI 放出了 GPT-6 Astra。

先说实用的

坏消息:现在还用不到。OpenAI 说"最近几天"推送给订阅用户。

好消息:在推送完成之前,每天会给用户一次额度重置。所以这几天每天都要把额度用光——白给的不用白不用。

OpenAI 官方确认每日额度重置

GPT-6 Astra 来了

这次发布的是 GPT-6 Astra。后续还有 GPT-Image-2.5 生图模型和传闻中 750 Token/s 的超快版本,预计近期也会放出来。

官方给 Astra 的定位是"世界上最智能、最协调的模型",说在 Computer Use、Browser Use、软件工程、网络安全、科学和专业工作上都是新标杆。

先看数据再下判断。

Coding:贴身肉搏

Coding benchmark 数据(来源:量子位公众号):

BenchmarkGPT-6 AstraClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.057.7%55.8%52.3%
DeepSWE v1.174.1%67.4%73.7%
FrontierCode 1.1 Extended64.5%63.6%63.6%
FrontierCode 1.1 Main53.3%50.9%53.4%
Internal DB Migration63.9%57.8%
AA Coding Agent v1.467.068.1

Astra 在多数项上领先,但差距都在几个百分点以内。Claude Opus 5 在 DeepSWE v1.1 上拿到 73.7%,只比 Astra 的 74.1% 低 0.4 个点;Artificial Analysis Coding Agent Index v1.4 上 Opus 5 的 68.1 反超了 Astra 的 67.0。

不是碾压,是贴身肉搏。

定价:和 Claude Fable 5 一个价

模型Input ($/M tokens)Output ($/M tokens)
Claude Fable 5 / Claude Mythos 5$10$50
Claude Fable 5.1 / Claude Mythos 5.1$10$50
GPT-6 Astra — Standard$10$50
GPT-6 Astra — Fast$20$100

Astra Standard 和 Claude Fable 5 的 API 定价完全一样,50 输出。OpenAI 卡在同一个价位上,benchmark 比你高一点点。

Playbot:让模型进游戏引擎

这次 Astra 发布最让我多看了几眼的是 Playco 的 Playbot。

Playco 用 GPT-6 Astra 做了一个 AI 驱动的游戏开发 IDE,直接连到 Unity 和 Godot。模型能编辑场景、运行游戏、验证自己的修改、并行处理多个任务。

游戏开发不只是写代码。一个功能写完,你还得看它在场景里的空间布局对不对、UI 在不同分辨率下响应不响应、玩起来手感怎么样。以前的 AI 编程工具帮你写完代码就结束了,剩下的全靠人在引擎里一个个检查。

Playbot 的做法是让模型直接在引擎里跑。写完代码,模型自己启动游戏,看画面,发现 bug,改了再跑。Playco 说 Astra 的空间推理能力有提升,重建参考图像更准了,Unity 里 UI 的响应性也改善了。

模型能自己玩游戏并验证修改——这意味着它不只是在找编译错误,而是在找体验问题。

但这不应该是旗舰模型干的活

做了十年游戏引擎,我对 Computer Use 接入游戏引擎这件事的判断是:方向对,但模型选错了。

Astra 的 Computer Use 能力确实到了一个新水平。自主操作电脑、在引擎里搭场景、跑测试、找 bug——这些事情有价值。

问题是这些活的本质是什么?自动化测试。搭建场景、摆放物件、跑测试用例、做视觉回归。这些是需要大量重复执行的任务,对推理深度的要求远低于架构设计或方案决策。

50 的顶级模型去跑自动化测试,成本账算不过来。一个中等规模的游戏项目,光场景测试一天就能跑几百次。这些活应该是中低价位的模型来干。

我个人的判断:Astra 整体是 Fable 级别,没有超过 Claude Fable 5.1。Computer Use 是它最大的卖点,但这个卖点装在了错误的价位上。

真正期待的是 GPT-6 的 Luna 版本

当 Computer Use 这个能力下放到中低价位模型的时候,游戏开发才会真正受益。

GPT-6 的 Luna 版本如果能做到:用可接受的成本跑各种测试用例、找 bug、做图像识别、处理需要视觉验证的任务——那才是我会日常接入工作流的东西。不是每次测试都需要顶级智能,但每次测试都需要能看懂画面。

御三家的差距在缩小

Claude Fable 5.1 刚发布不久,Astra 在 coding 上就追平了。Grok 这边,Grok 4.7 将在一周后发布,Grok 5 预计 2026 年 11 月到。三家在大模型顶级能力上的竞争已经白热化。

从我做独立游戏和工具的角度看:顶级模型之间谁的 benchmark 高 1% 已经不重要了。重要的是这些能力什么时候下放到日常可用的价位。

我的工具栈不变。Claude 做上限,Codex 做日常开发。等 Astra 推送到位后试一把 Computer Use,但真正让我期待的是 GPT-6 的 Luna 版本。

评论 0

Lumio
选中正文可划线评论 — 点击高亮跳转到对应评论

    暂无评论 — 选中段落或在下方留下第一条想法