我终于能用 GPT-6 了!实测一波,Codex 要杀疯了?

大家好,我是程序员鱼皮。

前几天 OpenAI 发布了 GPT-6 Astra,号称全世界最智能的模型,主打像人一样操作电脑和自主完成编程任务。

我看了一圈官方展示的案例,3D 城市生成、3D 卡丁车赛车游戏等等,效果确实震撼。

官方展示的 3D 卡丁车游戏

当时我就想第一时间跑轮实测,结果打开 Codex 一看,没有 Astra 的选项。

我以为是自己账号的问题,又专门买了个新账号,结果还是没有!

唉,只能「望模兴叹」了……

现在,我的 Codex 终于有 GPT-6 Astra 的权限了,赶紧搞几个实战项目测测看。

这次我选择了 4 个案例,由浅入深:

  1. 3D 程序化城市生成器(对标官方 Showcase,纯前端)
  2. 3D 奥德赛战争视频动画(前端 + 后端,专业运镜)
  3. 全栈 AI 编程工具(复杂长程全栈任务,跟 Fable 5.1 横评对比)
  4. 操作 KiCad 完成电路板布线(Computer Use)

点个收藏,咱们开始~

1、3D 程序化城市生成器

OpenAI 官方的开发者展示馆里有一个用 GPT-5.5 做的程序化城市生成器,编辑器风格的界面加上实时 3D 渲染。我想看看 Astra 能不能做到更好的水平。

官方的城市生成器

提示词里我就强调了一件事,至少包含重庆、上海、西安、深圳、江南五种城市风格,要让用户一眼就能认出是哪座城市。

之所以选重庆当主打风格,是因为层叠立交的复杂地形在国内辨识度极高,最容易看出 AI 到底有没有理解城市特色。此外,参数维度和编辑器布局怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。

Case 1 提示词

AI 拿到任务后,先用 Firecrawl 搜索了官方 Showcase 的产品设计,又查了 Three.js 的文档,然后一口气把整个项目写完了。

过了大约 18 分钟,7 项自动化测试全部通过,前端项目构建成功。

来看看成品,第一眼就被惊艳到了……

重庆 · 8D 魔幻山城

网站右侧是完整的城市生成器控制面板,城市风格、城市形态、建筑密度、平均高度、地形与交通、光照氛围全都能调。你随便拖动一个滑块,3D 场景就会实时重新生成。底部是五种城市风格的预览卡片,一目了然。

重庆的 3D 场景确实做出了高差感,建筑群层叠在地形的起伏上,标注了立交层数和轨道交通的位置。

再看看切换其他城市风格的效果。上海版是滨江平地加超高层密集,色调完全变了,标注了东方明珠和上海中心。

上海 · 陆家嘴天际线

西安版的特色也很鲜明,城墙围合结构、中式屋顶、低矮建筑群,整个色调偏暖土色,标注了大雁塔和钟楼中轴。

西安 · 千年长安城

深圳版切换到了暗色调,超高密度的玻璃幕墙建筑群,标注了深圳湾,赛博感十足。还能看到道路上的小车,很细节。

深圳 · 赛博未来都市

江南版的画风跟前四个完全不同,白墙黛瓦、小桥流水、低层建筑,水系穿城而过。

江南 · 枕水人家

这五种风格切出来视觉差异非常明显,不是简单换个颜色,建筑形态、地形高差、地标标注全都跟着变了。

这个完成度已经超出我的预期了。只用一段提示词,AI 运行 18 分钟就完成了开发和校验。之前用 Claude Fable 5.1 做同等复杂度的项目基本上要半小时起步,Astra 快了不少。

2、3D 奥德赛战争视频动画

第二个案例难度拉高。我让 AI 做一个 3D 史诗级战争场面的视频动画,主题是古希腊奥德赛的特洛伊战争,而且这是一个前端 + 后端的全栈项目。

这个案例最核心的考点是运镜。我要求整段动画要体现专业的运镜手法,不同段落用不同类型的镜头,镜头之间的转场要自然,战场上要有大规模的士兵群体。具体怎么实现、后端承担什么职责,全部交给 AI 自己设计。

Case 2 提示词

AI 先搜了特洛伊战争的经典场面和电影运镜手法,然后自己设计了一套前后端架构。前端用 Three.js 做 3D 场景渲染和镜头动画,后端用 Node.js 提供两个接口,一个根据场景配置生成分镜脚本,另一个调用 ffmpeg 把前端渲染的帧序列编码成 MP4 视频。

大约 19 分钟后,AI 交卷了:

特洛伊之围 · 开场

打开网页,一整片黄昏色调的战场直接扑面而来,大规模的士兵方阵、城墙城门、远处的战舰群都在。底部有完整的时间轴播放器,可以拖拽进度、调倍速、全屏播放,右上角还有「导出影片」按钮,对接的就是后端的 ffmpeg 导出接口。

特洛伊之围 · 战争推进

动画播放过程中,镜头确实在持续运动,从远景推向近景,能看到摄像机角度在截图之间有明显变化。

特洛伊之围 · 镜头推进

整段动画分成了六个章节,72 秒完整叙事,从风暴将至的全景一步步推到近距离搏杀,最后拉远收束。镜头轨迹的加速度都做了连续性处理,章节字幕是渐隐渐现的。

特洛伊之围 · 六个章节

过程中,AI 在自验证阶段发现了远景雾气太重、角色脚底悬空等几个问题,自己修了两轮,最后跑了 9 项测试全部通过。

不过也有明显的瑕疵,有几处角色穿模,士兵的武器偶尔会穿过身体,这种问题让 AI 再跑一轮修复大概率能搞定。

特洛伊之围 · 穿模问题

整体来看,这个项目从产品设计到技术实现都很完整。虽然 3D 模型本身是低多边形风格的,不是很精细的建模,但考虑到这是一段提示词从零做出来的全栈项目,已经很强了。

3、全栈 AI 编程工具 - 复刻 Cursor

这是我经常用的一个测试案例,让 AI 复刻一个像 Cursor 那样的 AI 编程工具。提示词跟之前测 Claude Fable 5.1、Kimi K3、DeepSeek V4 Pro 时用的 完全一样,好跟这些模型横向对比。

简单来说,我要求 AI 先克隆 VS Code 的开源代码,然后在此基础上做一个支持 Editor Window 和 Agents Window 双窗口切换的 Web AI 编程工具。Editor Window 负责代码编辑,Agents Window 负责 AI 对话和自主开发,技术栈让 AI 自由发挥。

Case 3 提示词

AI 拿到任务后同时做了两件事,一边用 Firecrawl 搜索 Cursor 3 的产品设计,一边通过 Git 命令克隆 VS Code 仓库。

然后花了大约 23 分钟,完成了第一轮开发。

有意思的是,AI 没有直接把产品叫做「Cursor 复刻版」,而是自己取了个产品名叫「orbit」,顶部中间就是 Editor / Agents 双窗口切换按钮。

先来看看 Editor Window 编辑器模式的效果:

整体布局参考了 VS Code,比如左侧文件树、中间 Monaco 编辑器、上方多标签页和面包屑导航、下方终端面板、右侧 Agent 对话面板。但又跟 VS Code 不完全一样,比如暗色主题配色、活动栏图标、状态栏信息这些细节都做了自己的设计,更像是一个独立产品而不是简单的换皮。

切换到 Agents Window,这就是我们熟悉的 AI 对话界面了:

Agents Window

Agents 面板有完整的任务管理能力,中间是对话输入区,下方已经配好了 deepseek-v4-pro 模型选择和 Agent 模式。

AI 能够正常完成简单的开发任务,核心功能都能跑通:

跟之前我测试过的几个模型横向对比一下。

Kimi K3 那次花了半个多小时,核心功能跑通了,但是界面比较简陋。

Kimi K3 的复刻 Cursor

再来看看 Claude Opus 5 用同样的提示词做出来的版本,代码高亮、小地图、管理面板都在,还原度很高,但说实话跟 VS Code 太像了,少了点自己的想法。

Claude Opus 5 的复刻 Cursor

Claude Fable 5.1 的完成度最高,有完整终端、Agent 执行流程和文件审阅机制,还能逐文件接受或拒绝 AI 改动。

Claude Fable 5.1 的复刻 Cursor

GPT-6 Astra 这次最让我惊喜的是它有自己的产品想法。没有完全照着 Cursor 去抄,而是自己设计了 orbit 这个品牌、自己加了任务分类管理和三个快捷入口、自己定义了暗色主题的配色体系。在 Editor Window 的视觉还原度上也做到了几个模型里最好的。

不过整个编辑器的功能丰富度还差 Fable 5.1 一截,像逐文件审阅改动这种功能 Astra 是没有做出来的。

4、操作 KiCad 完成电路板布线

前面三个案例测的都是 AI 写代码的能力,但 GPT-6 Astra 这次主打的其实是「操作电脑」。官方称它是全世界最强的电脑操作模型,ScreenSpot-Pro 的屏幕理解准确率从上一代的 76.9% 直接拉到了 92.7%。

官方的案例展示中,让 Astra 打开 KiCad 电路设计软件,把一张电子原理图变成可以直接拿去生产的 PCB 布线图,元器件怎么摆、铜线怎么走全部由 AI 自己完成。

官方演示:Astra 在 KiCad 里完成电路板布线

要知道,以前这玩意是硬件工程师一点一点手工拖出来的,是整个电子设计流程里最费时间的环节之一。

我想仿照这个案例自己试一试,于是在本机装了 KiCad 10,看看 Astra 能不能自己操作 KiCad 完成从原理图到 PCB 布线的全过程。

Case 4 提示词

这个案例跟前 3 个完全不同,AI 没有写代码,而是像人一样看屏幕、点按钮、拖拽元器件。

过了大约 13 分钟,AI 完成了任务。

它确实成功操控了 KiCad 的界面,打开项目、进入 PCB 编辑器、从原理图导入网表,这些流程操作都做对了。原理图一致性检查也通过了,说明 AI 看懂了原理图和 PCB 之间的对应关系。最后它还自己跑了一次 DRC 设计规则检查。

但是没能完成正确的布局和布线。我发现 AI 在画布上点击和框选元器件的时候,坐标经常对不准,没法可靠地把元器件拖到指定位置,更别说一根根地画铜线了。最终 DRC 报了 12 项违规和 20 处未连接。

这个结果让我挺失望的,因为我看了很多博主分享 Astra 操作 Blender 创造各种 3D 大作,成品都很惊艳,怎么到我这就翻车了呢?

从我自己的测试结果来看,Astra 在「看懂专业软件界面」和「找到正确的菜单按钮」这两件事上做得不错,但是却卡在了精细的画布交互上。这也侧面解释了为什么官方的 ScreenSpot-Pro 跑分能到 92.7%(看懂屏幕没问题),但 OSWorld 的任务完成率只有 72.6%(真正把活儿干完就难多了)。

我的感受

跑完这几个项目,我最直观的感受是:Astra 的前端审美和产品设计能力比 GPT 5 系列提升太多了!

以前大家测试 GPT 系列的模型,前端效果经常是被吐槽的点,而且 GPT 特别爱偷懒,功能能省就省,以快速完成为主。

比如之前我用 GPT-5.6 Sol 做出来的足球游戏界面是这样的:

GPT-5.6 Sol 的足球游戏

是的,那一坨黑色方块就是球门……

这次 GPT-6 Astra 的使用体感有明显变化,比如 3D 城市生成器那个项目不光功能做全了,连每座城市的地标标注都自己设计了一套,这种用心程度在以前的 GPT 身上是看不到的。

奥德赛战争那个项目也是,完整的 72 秒六章叙事、后端分镜脚本引擎加 ffmpeg 导出、连镜头轨迹的加速度连续性都做了处理。而且速度真的很快,几个项目 20 分钟左右就交卷了,比其他同级别模型快了将近三分之一。

但是我实测下来,感觉 Astra 消耗的 Codex 额度明显更快了,价格比之前贵了不少。基础的 Plus 账号跑 2 ~ 3 个项目就能把 5 小时额度耗光了,Computer Use 消耗更大,想长期用至少得开 Pro。

所以 Astra 到底值不值得用呢?

如果你做的是视觉要求高的前端项目,或者需要一次性交付的全栈产品,Astra 目前确实是第一梯队。

对于日常大多数的办公任务,没必要用这么贵的模型,国产的 Kimi、GLM 或者 DeepSeek 够用了。

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:https://github.com/liyupi/ai-guide

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你用 GPT-6 Astra 了么?觉得它是目前最强的模型吗?

0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
下载 APP