编程导航计算机话题讨论

计算机

100 参与
分享

快来分享你的内容吧~

点击登录,快来和大家讨论吧~
表情
图片
话题
打卡
综合
交流
文章
问答

GPT Images 2.5 首发实测,手绘成图、指哪改哪、也太逼真了!

大家好,我是程序员鱼皮。 5 个月前我写过一篇 GPT Image 2 的测评,当时就已经被它的真实感震撼到了,连微信聊天记录都生成的无比真实。 刚刚 OpenAI 又放了个大招,ChatGPT Images 2.5 正式发布! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hrTWgXOk5GQtqR87.jpg) 这次升级不仅提高了生图的质量、提升了多达 50% 的生成速度、提升了多轮编辑的一致性,更关键的是 **改变了整个 AI 生图的创作方式**。 新增了 Sketch 草图参考功能,可以直接在 ChatGPT 里画草稿让 AI 帮你生成完整图片。还支持了在图片上放 Comment 标注来精准修改局部细节。此外,还新增了 Templates 创作模板、Prompt 共享、透明背景生成能力。 ![官方提供的成品图](https://pic.code-nav.cn/post_picture/1601072287388278786/apmfAFTgqBv7x7Ul.jpg) 现在打开 ChatGPT 生图,默认就是 Images 2.5 了,所有用户都已经可以直接体验。 我第一时间把这些新能力全测了一遍,整理出 10 个最有意思的邪修玩法分享给大家,每个都附上了完整提示词和操作流程,傻子可懂。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l2LJEwZXPCNP39AH.jpg) ## 一、Sketch 草图 - 画给 AI 看 Sketch 是这次最让我兴奋的新功能。以前想让 AI 生成特定构图的图片,只能用文字描述"左边放什么、右边放什么",来来回回调半天。现在直接在 ChatGPT 对话框里输入 @Sketch,就能打开一个画板,随手画个草稿当构图参考。 重点是,你完全不需要有任何绘画基础,画得越「灵魂」越有反差效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HiUtcj3axVvlylx5.jpg) ### 1、草图变文章封面 作为一个天天写文章、做视频的博主,封面图是我最头疼的事情之一。以前要么用设计软件自己拼,要么纯靠文字描述让 AI 反复试,构图经常不是我想要的。 现在有了 Sketch,我可以先用草图画出封面的大致布局,比如标题放在哪、文字是什么、人物在什么位置、背景有哪些元素。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qWcl6b6K071gGH72.jpg) 然后把我的真人照片也上传作为参考,AI 就能理解我要的是什么效果。 提示词: ```markdown 制作 16 比 9 的封面图,画面为写实风格,标题醒目,构图和人物参考我提供的图片 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ob9pOuSREhBbbLWG.jpg) 不到一分钟,AI 就生成了封面。整体构图完全按照我画的草图来的,人物位置、标题区域全都对上了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/R1nLXRWmmJGWS7dk.jpg) 这个流程比纯文字描述高效太多了。以前我得花好几轮对话才能让 AI 理解我想要的构图,现在花几十秒画个草稿就搞定了。以后做封面图可以省下不少时间。 ### 2、草图秒变室内设计 Sketch 的另一个实用场景是室内设计。你不需要会用任何 3D 建模软件,只要能画出房间的大致布局,比如沙发在哪、桌子在哪、窗户在哪个方向,AI 就能帮你生成一张像模像样的室内设计效果图。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JoCheduA9AbRRM8x.jpg) 提示词: ```markdown 根据房间布局草图生成现代简约风格的实拍房间图,暖色调灯光,北欧风家具,窗外是城市夜景 ``` 如果你正在装修或者搞出租屋改造,完全可以先用这个功能快速出效果图,看看自己的想法实现出来是什么感觉,满意了再动手。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kCpjZ1LG2DaZzjuC.jpg) ### 3、草图变漫画分镜 这个玩法我觉得特别适合有故事想法,但是不会画画的人。用 Sketch 画出 4 格漫画的分镜草图,每一格只需要画个火柴人和简单的场景轮廓,再用文字描述每格的内容和对话,AI 就能生成一张完整的漫画页面。 来感受一下我的大作,你能看出来我画的是什么故事么? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xWU8oICHPBAYn25J.jpg) 然后我把自己 cosplay「老头程序员」的照片也上传了上去,让 AI 参考我的形象来画主角。 提示词: ```markdown 根据四格漫画分镜草图,生成一页完整的彩色漫画。风格是日系轻松搞笑风,主角是一个程序员,参考我上传的照片中的人物形象。 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/S36DYcUejEfM5uWc.jpg) 来看下成品效果,不错吧! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mDLrPlmvLBlZaZs6.jpg) 以前想做个漫画要么自己学画画,要么请人画,成本都不低。现在有了 Sketch 加持,别说做个草图了,可发布的成品大作都能给你搞定。 ## 二、Comment 评论编辑 - 改图之王 Comment 是这次另一个很实用的新功能。 生成图片后,你可以直接在图上点击某个位置放一条评论,写上修改指令。操作逻辑和 Figma 里给设计稿打标注差不多,AI 会按你标注的位置精准修改,其他地方保持不动。 在图片编辑工具栏里,除了 Comment,还有 Markup 标记、Remove BG 去背景、Erase 擦除、Resize 调整尺寸等工具,编辑能力比 2.0 丰富了很多。 ### 4、Comment 标注精修 我先让 AI 给自己的编程导航生成了一张宣传海报,提示词如下: ```markdown 生成一张编程导航(codefather.cn)的宣传海报:深蓝色科技感背景,中央大标题「编程导航」,副标题「从学编程到做项目到找工作,一站搞定」,下方展示三个核心卖点图标(学习路线、实战项目、面试刷题),底部放网址 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0hPoG581AbSYOyy0.jpg) 生成之后,点击图片进入编辑模式,点击上方工具栏上的「评论」按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xvQKrZHr7XGt65f7.jpg) 我在图上添加了 3 个 Comment: 1. 标题上标注「加大字号,换成渐变金色」 2. 副标题标注「改为:近 30 套项目教程 + 万道面试真题」 3. 背景标注「加一些代码粒子飘落的视觉效果」 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tK6S2gO4bYPnQ9zj.jpg) 标注完成后,点击发送评论,可以看到所有的改动都精准生效了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Fxcokr2PnGUpFaXO.jpg) 以前只能跟 AI 对话,通过文字描述要修改的内容,AI 经常搞错位置。现在直接点击图片的某个位置添加具体的改动,准确率高了太多。 ### 5、修改微小细节 既然 Comment 编辑主打精准,那我就来测测它的极限。 这次我选了个高难度任务,先让 AI 生成一张火影忍者中宇智波佐助的半身像,默认是万花筒写轮眼,然后用 Comment 只修改眼睛这一个微小细节。 先生成图片,提示词如下: ```markdown 生成一张宇智波佐助的动漫风格半身像,黑色头发,穿着经典的鹰小队白色开襟上衣,双眼为永恒万花筒写轮眼(六芒星图案,红色瞳孔),表情冷峻,背景为暗色调 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yb9jwYxqpKk8kDA8.jpg) 生成之后,我在佐助的左眼上精准添加了一个 Comment 标注「把左眼的万花筒写轮眼改为轮回眼」。 来看下效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ztbKOTavmqws7xtU.jpg) 卧槽,真牛啊! 眼睛在整张图里就那么一小块区域,AI 做到了只修改瞳孔图案和颜色,佐助的发型、表情、衣服、背景全都纹丝不动,这个精准度真的能用在实际创作中了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1HfNeSKDoO7TOAVZ.jpg) 再见 PS,真的可以卸载了! ## 三、Templates 模板 - 快速复刻 Templates 是给不想写提示词的人准备的功能。ChatGPT 内置了一批高频创作模板,比如 Poster 海报、Merch 周边、Product Photo 商品图、Logo 等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lJA0QFJVvttnOMGX.jpg) 选一个模板,按提示填写信息和风格偏好,就能生成对应的图片,省去了从零构思提示词的过程。 ### 6、一键电商大片 试试 Templates 的 Product Photo 商品图模板。随便拿一个日常物品,看看模板能不能帮它拍出带有「高级感」的电商产品图。 选择 Product Photo 模板,然后上传一张图片(比如鱼皮的光头小企鹅盆栽),点击发送: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VApnQSizXxo5rpJl.jpg) AI 会询问你一些问题,比如产品照的用途、摄影风格、背景和灯光等等: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hhkfITOr1Q9C5pRm.jpg) 看看效果,还不错吧,很有生活气息。感觉哪天我的头像可以更新一波了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bf0L7g3Sk2KGyMcf.jpg) 对于做电商、做小红书带货的朋友来说,这个功能太实用了。以前拍一张像样的产品图要么请摄影师,要么自己搭灯光布景折腾半天。现在手机随手拍一张,选个模板就能出一张可以直接上架的商品图。 ## 四、多轮编辑 + 精准局部编辑 ChatGPT Images 2.5 的多轮编辑一致性是一个重要升级。以前用 Images 2.0 连续编辑几轮之后,画面质量会越来越差,人物五官也会慢慢跑偏。 这次官方说多轮编辑时,之前的修改结果会更稳定地保留下来,每一轮新编辑都是在上一轮的基础上叠加,而不是重新生成。 精准局部编辑也有提升,AI 在修改指定区域的时候,能更好地保持其他区域的构图、光线和细节不变。 ### 7、同一人物七十二变 上传一张照片,连续 5 轮让 AI 把同一个人变成不同的风格,看看到最后一轮人物还像不像本人。 提示词如下: ```markdown 上传一张人物照片。 第 1 轮:把这张照片转换成日系动漫风格,保持人物五官特征 第 2 轮:在上一张的基础上,换成文艺复兴油画风格 第 3 轮:换成赛博朋克风格,加上霓虹灯光效 第 4 轮:换成中国水墨画风格 第 5 轮:换成乐高积木风格 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BffbqhYqyz0BmzMs.jpg) 等 AI 生成完所有图片后,我再让 AI 把原图和生成的所有图片按顺序拼接成一张图,便于我对比效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sk1GlVgnfiAHwxAV.jpg) 显然 5 轮下来,人物是始终保持一致的,多轮一致性做得很好!(第二张图我打算拿来做头像了哈哈) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NL3SfRvHB2BHJbkE.jpg) 另外我还测了个搞笑版本。同一条狗的照片,每一轮都让 AI 把主体的头发再减少一点: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BWVSqpgydocgbNPK.jpg) 几轮下来,除了发量在肉眼可见地减少之外,人物的五官、表情和动作始终保持一致,说明 Images 2.5 的多轮一致性能力确实靠谱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xd0f4pfiJSxwY8p1.jpg) TNND,仿佛看到了自己从前和以后的样子…… 但哪怕时光流逝,年少不再,也要始终保持自信的微笑呀! ### 8、上海迪士尼四季轮转 上传一张上海迪士尼城堡的照片,只通过文字描述,让 AI 连续变化春夏秋冬四个版本。 ```markdown 第 1 轮(春):春天,城堡前的花坛换成盛开的粉色樱花,草地嫩绿,天空晴朗 第 2 轮(夏):夏天,在上一张的基础上,植被变成深绿色,加强阳光感,天空湛蓝配几朵白云 第 3 轮(秋):秋天,树叶变成金黄和橙红色,地面铺满落叶,天空变成暖色调黄昏 第 4 轮(冬):冬天,树木变成光秃秃的枝干,城堡屋顶和地面覆盖一层雪,天空变成灰白色 ``` 注意,我甚至不需要在提示词中告诉 AI「要和原图保持一致」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gUSWnPKomIDx9iil.jpg) 这个测试的关键是看城堡的造型、尖塔的位置、前方广场的布局这些元素,在四轮编辑中是不是始终保持一致。 来,感受一下 GPT Images 2.5 可怕的局部编辑能力和一致性! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ewJfKtmwTOl69hUz.webp) ## 五、透明背景 - 直接生成可用素材 透明背景是 Images 2.5 新增支持的能力。以前想要一张透明背景的素材,得先生成完整图片,再用第三方工具抠图,经常抠得不干净。现在可以直接在提示词里要求输出透明背景的 PNG 图片,生成出来就能直接贴到其他设计里用。 ### 9、DeepSeek 鲸鱼娘表情包 DeepSeek 的鲸鱼娘形象大家应该都很熟悉了,蓝色渐变长发、鲸鱼鳍耳朵、女仆装,性格设定是爱吃白饭、嘴硬心软、理直气壮偷懒,活脱脱一条「蓝色大肥鱼」。 这次我提供鲸鱼娘的标准素材作为参考,让 AI 生成一套透明背景的表情包贴纸,每张表情都融入鲸鱼娘的经典梗。 ```markdown 参考上传的 DeepSeek 鲸鱼娘素材图片(蓝色渐变长发、鲸鱼鳍耳朵、鲸鱼尾巴、女仆装),生成一套 9 张透明背景的表情包贴纸。角色形象必须和参考素材保持一致,卡通 Q 版风格,表情夸张可爱,必须输出透明通道背景 PNG。9 个表情分别是: ①开心大笑,手举「开源大法好!」小牌子 ②无语翻白眼,旁边飘着「又在深度求索了...」文字 ③加油打气,握拳冲刺姿势,配文字「低成本冲冲冲!」 ④哭泣委屈,抱着空碗,配文字「白饭吃完了...」 ⑤比心,配文字「满血版上线!」 ⑥疑惑挠头,头上冒出「思考中...」气泡 ⑦生气鼓腮,配文字「谁说我在摸鱼!」 ⑧困了打哈欠,趴在键盘上,配文字「推理好累...」 ⑨竖大拇指,配文字「大肥鱼认证 👍」 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6bdf4CUyAEAMj7i2.jpg) 虽然过程有点曲折,但最终 GPT Images 2.5 一口气生成了 9 张高清无背景的大图! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/p8tYktZ5ailQcqwf.jpg) 每张鲸鱼娘的风格都是一致的,背景也是干净透明的,以后做品牌 IP 的周边素材就方便多了,不用再手动抠图了。 好了,我现在可以到黄色大咸鱼上开个店了,有没有人需要代做表情包的? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sgNN5sjm2kBjA6pC.jpg) ## 六、Prompt 共享 - 创意接力 Prompt 共享是一个偏社交属性的功能。当你生成了一张满意的图片,分享的时候可以选择把提示词也一起发出去。 别人看到你的图片后,可以直接用同一个提示词模板,上传自己的照片和细节,生成属于自己的版本。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/E6K0iIsspmweeDOQ.jpg) 在 ChatGPT 的图片页面可以浏览当前热门的共享 Prompt 和 Templates 模板,看看大家都在玩什么花样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5hJdgXvDgU1kcF7z.jpg) ### 10、80 年代复古照 GPT 官方提到,目前有一个 80 年代复古照的共享 Prompt 正在全网刷屏。 那我干脆就用这个 Prompt,来体验一下这个共享功能。 点击「80s flashback」这个热门 Prompt,上传一张自己的照片,提交任务就好: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/49eMNYChWWXbRwYz.jpg) 看看效果,真不戳,鱼皮成功穿越了! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yTDfeSB8cjBJaAPE.jpg) 其实之前我给自己的 AI 导航网站也做过类似的图片提示词大全功能,现在官方下场了,AI 生图的生态将被无限放大。 以后热门的创意 Prompt 可以像表情包一样在社交平台上传播,每个人都能用同一个模板生成自己的版本,还挺有意思的。 ## 写在最后 这次测完 Images 2.5,我用几十秒画的草稿变成了一张能直接用的文章封面,随手画的房间布局变成了精美的室内设计图,甚至还做出了一套完整的鲸鱼娘表情包。 要知道,我是完全没有任何美术技能的。 以前这些事情,要么得找专业设计师,要么得自己折腾 PS。 现在画给 AI 看、指给 AI 看、随随便便就能生成图片大作。感谢 AI,创作这件事的门槛,真的已经低到了前所未有的程度。 **人人都是艺术家的时代,真的到来了。** 除了 GPT 官方提供模板之外,我的 [鱼皮 AI 导航](https://ai.codefather.cn) 也提供了「AI 绘图提示词」模块,包含提示词模板大全、提示词生成器、图转提示词三大能力,完全免费,可以快速帮你复刻想要的图片。 > 指路:https://ai.codefather.cn/painting ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SvKj22EeFCfYGaQB.jpg) 你最想用 Images 2.5 的哪个新功能?欢迎在评论区分享你的作品和玩法~

刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!

TNND!DeepSeek V4 Pro 才发布了多久啊,新东西又来了…… 刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OQPKyMO5Cq67GL1D.jpg) 使用方法很简单,无论你使用什么 AI 工具,先像之前一样接入 DeepSeek,然后只需要把模型名称改为 `deepseek-v4.1-flash-expires-on-0910` 就可以了。 举个例子,比如我使用 DeepSeek 的角色专武 —— DeepSeek Harness 来内测新模型,还不会用的朋友可以看看我之前写的[《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ)。 启动 DeepSeek Harness 后,在网页左下角点击设置,编辑内置的 DeepSeek 模型配置: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YS2lTiLOVJbzLsUd.jpg) 在 DeepSeek 模型配置中,点击「添加模型」,输入完整的模型名称 `deepseek-v4.1-flash-expires-on-0910` 并保存: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XSTy4GpKrG7dYTro.jpg) 然后就可以愉快使用了,输出速度嘎嘎快! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IlTzPUiQxAbXkgse.jpg) 但有个问题,明明 DeepSeek V4.1 Flash 模型是原生多模态的,却在 DeepSeek Harness 中显示「不支持图片」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OREbfhMskv7cO1jZ.jpg) 没关系,咱们换个其他的 AI 工具试试,我这里随便用个国产的 AI 工具,比如智谱的 ZCode。 进入模型设置,添加一个 DeepSeek 的供应商,根据 [DeepSeek 官方的 API 文档](https://api-docs.deepseek.com/zh-cn/) 来填写信息就好: ![image-20260908182944707](https://pic.code-nav.cn/post_picture/1601072287388278786/7h3nIqdAt90zwOye.jpg) 点击添加模型,模型 ID 填写 `deepseek-v4.1-flash-expires-on-0910`,并且输入类型一定要把「图片」勾选上: ![image-20260908182917035](https://pic.code-nav.cn/post_picture/1601072287388278786/FBqFSCJySvyonaFw.jpg) 保存之后,就能愉快使用 DeepSeek V4.1 Flash 了,能够正常识图! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yWhDsBhyifT65MO3.jpg) 有趣,DeepSeek 官方的工具反而不适配自家最新的模型吗? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3Uqg4TUP6f4W1PsU.jpg) 简单测试下来,我发现 DeepSeek V4.1 Flash 的速度真心非常快,大概是新模型还没多少人知道的原因吧,也算是带大家吃一波螃蟹了。 目前 DeepSeek V4.1 Flash 的计费和 DeepSeek V4 Flash 完全相同,不过看官方的意思,估计 V4.1 Flash 发布后会降价? 我不知道,我猜的,我希望如此。 --- 往期更多模型评测和 AI 编程教程可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/V37OvgR0ovjdYSTV.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

我终于能用 GPT-6 了!实测一波,Codex 要杀疯了?

大家好,我是程序员鱼皮。 前几天 OpenAI 发布了 GPT-6 Astra,号称全世界最智能的模型,主打像人一样操作电脑和自主完成编程任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/C4DFE5ZjxYXMIq5o.jpg) 我看了一圈官方展示的案例,3D 城市生成、3D 卡丁车赛车游戏等等,效果确实震撼。 ![官方展示的 3D 卡丁车游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/wvlG6UT1ozsjExD2.jpg) 当时我就想第一时间跑轮实测,结果打开 Codex 一看,没有 Astra 的选项。 我以为是自己账号的问题,又专门买了个新账号,结果还是没有! 唉,只能「望模兴叹」了…… 现在,我的 Codex 终于有 GPT-6 Astra 的权限了,赶紧搞几个实战项目测测看。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aFF4DHxlllFoGV87.jpg) 这次我选择了 4 个案例,由浅入深: 1. 3D 程序化城市生成器(对标官方 Showcase,纯前端) 2. 3D 奥德赛战争视频动画(前端 + 后端,专业运镜) 3. 全栈 AI 编程工具(复杂长程全栈任务,跟 Fable 5.1 横评对比) 4. 操作 KiCad 完成电路板布线(Computer Use) 点个收藏,咱们开始~ ## 1、3D 程序化城市生成器 OpenAI 官方的开发者展示馆里有一个用 GPT-5.5 做的程序化城市生成器,编辑器风格的界面加上实时 3D 渲染。我想看看 Astra 能不能做到更好的水平。 ![官方的城市生成器](https://pic.code-nav.cn/post_picture/1601072287388278786/1nkf1dWG8ax7mE95.jpg) 提示词里我就强调了一件事,至少包含重庆、上海、西安、深圳、江南五种城市风格,要让用户一眼就能认出是哪座城市。 之所以选重庆当主打风格,是因为层叠立交的复杂地形在国内辨识度极高,最容易看出 AI 到底有没有理解城市特色。此外,参数维度和编辑器布局怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。 ![Case 1 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/Jts3ZJiuEzBrVGvX.jpg) AI 拿到任务后,先用 Firecrawl 搜索了官方 Showcase 的产品设计,又查了 Three.js 的文档,然后一口气把整个项目写完了。 过了大约 18 分钟,7 项自动化测试全部通过,前端项目构建成功。 来看看成品,第一眼就被惊艳到了…… ![重庆 · 8D 魔幻山城](https://pic.code-nav.cn/post_picture/1601072287388278786/Vf6A8UGYQHxBIkBH.jpg) 网站右侧是完整的城市生成器控制面板,城市风格、城市形态、建筑密度、平均高度、地形与交通、光照氛围全都能调。你随便拖动一个滑块,3D 场景就会实时重新生成。底部是五种城市风格的预览卡片,一目了然。 重庆的 3D 场景确实做出了高差感,建筑群层叠在地形的起伏上,标注了立交层数和轨道交通的位置。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CoYVgMCkdB2GnomK.jpg) 再看看切换其他城市风格的效果。上海版是滨江平地加超高层密集,色调完全变了,标注了东方明珠和上海中心。 ![上海 · 陆家嘴天际线](https://pic.code-nav.cn/post_picture/1601072287388278786/eZrY4Z203cvWWjRU.jpg) 西安版的特色也很鲜明,城墙围合结构、中式屋顶、低矮建筑群,整个色调偏暖土色,标注了大雁塔和钟楼中轴。 ![西安 · 千年长安城](https://pic.code-nav.cn/post_picture/1601072287388278786/IRAVQTnufyzDf6yT.jpg) 深圳版切换到了暗色调,超高密度的玻璃幕墙建筑群,标注了深圳湾,赛博感十足。还能看到道路上的小车,很细节。 ![深圳 · 赛博未来都市](https://pic.code-nav.cn/post_picture/1601072287388278786/3p7u48ugJxED6TOH.jpg) 江南版的画风跟前四个完全不同,白墙黛瓦、小桥流水、低层建筑,水系穿城而过。 ![江南 · 枕水人家](https://pic.code-nav.cn/post_picture/1601072287388278786/gZiE6ifLn2uQWW5l.jpg) 这五种风格切出来视觉差异非常明显,不是简单换个颜色,建筑形态、地形高差、地标标注全都跟着变了。 这个完成度已经超出我的预期了。只用一段提示词,AI 运行 18 分钟就完成了开发和校验。之前用 Claude Fable 5.1 做同等复杂度的项目基本上要半小时起步,Astra 快了不少。 ## 2、3D 奥德赛战争视频动画 第二个案例难度拉高。我让 AI 做一个 3D 史诗级战争场面的视频动画,主题是古希腊奥德赛的特洛伊战争,而且这是一个前端 + 后端的全栈项目。 这个案例最核心的考点是运镜。我要求整段动画要体现专业的运镜手法,不同段落用不同类型的镜头,镜头之间的转场要自然,战场上要有大规模的士兵群体。具体怎么实现、后端承担什么职责,全部交给 AI 自己设计。 ![Case 2 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/VwLgHlpaGI333V4T.jpg) AI 先搜了特洛伊战争的经典场面和电影运镜手法,然后自己设计了一套前后端架构。前端用 Three.js 做 3D 场景渲染和镜头动画,后端用 Node.js 提供两个接口,一个根据场景配置生成分镜脚本,另一个调用 ffmpeg 把前端渲染的帧序列编码成 MP4 视频。 大约 19 分钟后,AI 交卷了: ![特洛伊之围 · 开场](https://pic.code-nav.cn/post_picture/1601072287388278786/ZUXMN8XBPUYqke6r.jpg) 打开网页,一整片黄昏色调的战场直接扑面而来,大规模的士兵方阵、城墙城门、远处的战舰群都在。底部有完整的时间轴播放器,可以拖拽进度、调倍速、全屏播放,右上角还有「导出影片」按钮,对接的就是后端的 ffmpeg 导出接口。 ![特洛伊之围 · 战争推进](https://pic.code-nav.cn/post_picture/1601072287388278786/sCpUVswiwKYrVHCy.jpg) 动画播放过程中,镜头确实在持续运动,从远景推向近景,能看到摄像机角度在截图之间有明显变化。 ![特洛伊之围 · 镜头推进](https://pic.code-nav.cn/post_picture/1601072287388278786/GGor5qaLR8LoxfHk.jpg) 整段动画分成了六个章节,72 秒完整叙事,从风暴将至的全景一步步推到近距离搏杀,最后拉远收束。镜头轨迹的加速度都做了连续性处理,章节字幕是渐隐渐现的。 ![特洛伊之围 · 六个章节](https://pic.code-nav.cn/post_picture/1601072287388278786/qgWsJCYBYAWsgOEe.jpg) 过程中,AI 在自验证阶段发现了远景雾气太重、角色脚底悬空等几个问题,自己修了两轮,最后跑了 9 项测试全部通过。 不过也有明显的瑕疵,有几处角色穿模,士兵的武器偶尔会穿过身体,这种问题让 AI 再跑一轮修复大概率能搞定。 ![特洛伊之围 · 穿模问题](https://pic.code-nav.cn/post_picture/1601072287388278786/TPXyYGrnsmp3g5Af.jpg) 整体来看,这个项目从产品设计到技术实现都很完整。虽然 3D 模型本身是低多边形风格的,不是很精细的建模,但考虑到这是一段提示词从零做出来的全栈项目,已经很强了。 ## 3、全栈 AI 编程工具 - 复刻 Cursor 这是我经常用的一个测试案例,让 AI 复刻一个像 Cursor 那样的 AI 编程工具。提示词跟之前测 Claude Fable 5.1、Kimi K3、DeepSeek V4 Pro 时用的 **完全一样**,好跟这些模型横向对比。 简单来说,我要求 AI 先克隆 VS Code 的开源代码,然后在此基础上做一个支持 Editor Window 和 Agents Window 双窗口切换的 Web AI 编程工具。Editor Window 负责代码编辑,Agents Window 负责 AI 对话和自主开发,技术栈让 AI 自由发挥。 ![Case 3 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/iImCknBmQB99iyu6.jpg) AI 拿到任务后同时做了两件事,一边用 Firecrawl 搜索 Cursor 3 的产品设计,一边通过 Git 命令克隆 VS Code 仓库。 然后花了大约 23 分钟,完成了第一轮开发。 有意思的是,AI 没有直接把产品叫做「Cursor 复刻版」,而是自己取了个产品名叫「orbit」,顶部中间就是 Editor / Agents 双窗口切换按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5lan0PHbPfYan1HB.jpg) 先来看看 Editor Window 编辑器模式的效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xqK1CYm6PVcyWrOP.jpg) 整体布局参考了 VS Code,比如左侧文件树、中间 Monaco 编辑器、上方多标签页和面包屑导航、下方终端面板、右侧 Agent 对话面板。但又跟 VS Code 不完全一样,比如暗色主题配色、活动栏图标、状态栏信息这些细节都做了自己的设计,更像是一个独立产品而不是简单的换皮。 切换到 Agents Window,这就是我们熟悉的 AI 对话界面了: ![Agents Window](https://pic.code-nav.cn/post_picture/1601072287388278786/HGgXknfYuTVLNEJs.jpg) Agents 面板有完整的任务管理能力,中间是对话输入区,下方已经配好了 `deepseek-v4-pro` 模型选择和 Agent 模式。 AI 能够正常完成简单的开发任务,核心功能都能跑通: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SbkT9gb45e5YuujJ.jpg) 跟之前我测试过的几个模型横向对比一下。 Kimi K3 那次花了半个多小时,核心功能跑通了,但是界面比较简陋。 ![Kimi K3 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/tj989YnqALguPqxO.jpg) 再来看看 Claude Opus 5 用同样的提示词做出来的版本,代码高亮、小地图、管理面板都在,还原度很高,但说实话跟 VS Code 太像了,少了点自己的想法。 ![Claude Opus 5 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/OLY2vO1hwz9FTjQ5.jpg) Claude Fable 5.1 的完成度最高,有完整终端、Agent 执行流程和文件审阅机制,还能逐文件接受或拒绝 AI 改动。 ![Claude Fable 5.1 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/LIWlMJYHK8hHacFL.jpg) GPT-6 Astra 这次最让我惊喜的是它有自己的产品想法。没有完全照着 Cursor 去抄,而是自己设计了 orbit 这个品牌、自己加了任务分类管理和三个快捷入口、自己定义了暗色主题的配色体系。在 Editor Window 的视觉还原度上也做到了几个模型里最好的。 不过整个编辑器的功能丰富度还差 Fable 5.1 一截,像逐文件审阅改动这种功能 Astra 是没有做出来的。 ## 4、操作 KiCad 完成电路板布线 前面三个案例测的都是 AI 写代码的能力,但 GPT-6 Astra 这次主打的其实是「操作电脑」。官方称它是全世界最强的电脑操作模型,ScreenSpot-Pro 的屏幕理解准确率从上一代的 76.9% 直接拉到了 92.7%。 官方的案例展示中,让 Astra 打开 KiCad 电路设计软件,把一张电子原理图变成可以直接拿去生产的 PCB 布线图,元器件怎么摆、铜线怎么走全部由 AI 自己完成。 ![官方演示:Astra 在 KiCad 里完成电路板布线](https://pic.code-nav.cn/post_picture/1601072287388278786/e8rjAq2InDT1zWvF.jpg) 要知道,以前这玩意是硬件工程师一点一点手工拖出来的,是整个电子设计流程里最费时间的环节之一。 我想仿照这个案例自己试一试,于是在本机装了 KiCad 10,看看 Astra 能不能自己操作 KiCad 完成从原理图到 PCB 布线的全过程。 ![Case 4 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/tRgOaX7vYEOlVTZ9.jpg) 这个案例跟前 3 个完全不同,AI 没有写代码,而是像人一样看屏幕、点按钮、拖拽元器件。 过了大约 13 分钟,AI 完成了任务。 它确实成功操控了 KiCad 的界面,打开项目、进入 PCB 编辑器、从原理图导入网表,这些流程操作都做对了。原理图一致性检查也通过了,说明 AI 看懂了原理图和 PCB 之间的对应关系。最后它还自己跑了一次 DRC 设计规则检查。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QOapRjefxc9eg2Vc.jpg) 但是没能完成正确的布局和布线。我发现 AI 在画布上点击和框选元器件的时候,坐标经常对不准,没法可靠地把元器件拖到指定位置,更别说一根根地画铜线了。最终 DRC 报了 12 项违规和 20 处未连接。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l569FT2I2oz6UL85.jpg) 这个结果让我挺失望的,因为我看了很多博主分享 Astra 操作 Blender 创造各种 3D 大作,成品都很惊艳,怎么到我这就翻车了呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6vYhHLwzyNXyZ6cG.jpg) 从我自己的测试结果来看,Astra 在「看懂专业软件界面」和「找到正确的菜单按钮」这两件事上做得不错,但是却卡在了精细的画布交互上。这也侧面解释了为什么官方的 ScreenSpot-Pro 跑分能到 92.7%(看懂屏幕没问题),但 OSWorld 的任务完成率只有 72.6%(真正把活儿干完就难多了)。 ## 我的感受 跑完这几个项目,我最直观的感受是:**Astra 的前端审美和产品设计能力比 GPT 5 系列提升太多了!** 以前大家测试 GPT 系列的模型,前端效果经常是被吐槽的点,而且 GPT 特别爱偷懒,功能能省就省,以快速完成为主。 比如之前我用 GPT-5.6 Sol 做出来的足球游戏界面是这样的: ![GPT-5.6 Sol 的足球游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/e1wie1kWp5CDklsq.jpg) 是的,那一坨黑色方块就是球门…… 这次 GPT-6 Astra 的使用体感有明显变化,比如 3D 城市生成器那个项目不光功能做全了,连每座城市的地标标注都自己设计了一套,这种用心程度在以前的 GPT 身上是看不到的。 奥德赛战争那个项目也是,完整的 72 秒六章叙事、后端分镜脚本引擎加 ffmpeg 导出、连镜头轨迹的加速度连续性都做了处理。而且速度真的很快,几个项目 20 分钟左右就交卷了,比其他同级别模型快了将近三分之一。 但是我实测下来,感觉 Astra 消耗的 Codex 额度明显更快了,价格比之前贵了不少。基础的 Plus 账号跑 2 ~ 3 个项目就能把 5 小时额度耗光了,Computer Use 消耗更大,想长期用至少得开 Pro。 **所以 Astra 到底值不值得用呢?** 如果你做的是视觉要求高的前端项目,或者需要一次性交付的全栈产品,Astra 目前确实是第一梯队。 对于日常大多数的办公任务,没必要用这么贵的模型,国产的 Kimi、GLM 或者 DeepSeek 够用了。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/jVK9OvPFNdLVU4r2.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你用 GPT-6 Astra 了么?觉得它是目前最强的模型吗?

刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!

大家好,我是程序员鱼皮。 时间过得真快啊,距离 GPT-5 发布竟然已经过去一年多了。 昨天凌晨 3 点多,OpenAI 终于把 GPT-6 Astra 放出来了! 官方把它叫做「全世界最智能、也最对齐的模型」。而 OpenAI 总裁 Greg Brockman 在发布前的媒体闭门会上,最后说了这么一句话。 **现在觉得我们已经进入 AGI 时代,并不算什么不合理的想法,欢迎来到 AGI 时代。** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8277A3KX0uR75rPR.jpg) 我本来是想第一时间跑一轮实测的,案例都准备好了。结果打开 ChatGPT 翻了一圈模型列表,没有;去看 API,也没有…… 去官方博客看了一下,目前 Astra 只开放给一小批安全厂商,普通订阅用户是用不了的,接下来几天才会陆续开给 ChatGPT 的 Plus、Pro、Business 和 Enterprise 用户。 吊大家的胃口嘛这不是? OpenAI 自己也知道这件事说不过去,于是负责 ChatGPT 的 Tibo 发了一条推特,说会给每一个订阅了付费计划但还没拿到 Astra 权限的用户,按天补偿额度重置,一天没用上就补一次。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZlAcH4SlNXiiJLQE.jpg) 行行行,原谅你了(正好周五我可以摸鱼了~ ## GPT-6 Astra 强在哪 这次,OpenAI 官方推文并没有吹 GPT-6 的编程能力,而是操作电脑能力。 他们把 GPT-6 Astra 称为「全世界最强的电脑操作模型」,AI 可以像人一样看屏幕、点按钮、填表单、刷应用,无所不能。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OLR6WLaJ7N4rH2n2.jpg) 先看看跑分,有个叫 ScreenSpot-Pro 的测试专门考模型能不能看懂屏幕、并且精准点到该点的位置,上一代 GPT-5.6 Sol 是 76.9%,Astra 直接干到了 92.7%。 ![ScreenSpot-Pro 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/ChflZokbLfdqWykV.jpg) 还有一个更接近真实工作的测试叫 OSWorld,就是把 AI 扔进一台真电脑里让它自己干活。Astra 的完成率是 72.6%,比 Sol 的 65.7% 高了不少。更关键的是完成同样的任务,Sol 平均要 75 分钟,Astra 只要 40 分钟! ![OSWorld 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/EYYDEywr8WXVLc8h.jpg) 我觉得主攻「屏幕理解」是个正确的方向。现实里绝大多数软件根本没有 API,很多公司的内部系统还是二十年前写的,文档都不知道在哪。但所有软件都有界面,那界面本身就是最通用的 API,AI 不用等谁来适配,自己看屏幕操作就完了。 GPT-6 Astra 的编程能力也有大幅提升。Terminal-Bench 4.0 考的是在终端里完成软件开发、系统配置和数据分析这类复杂任务,Astra 拿到 57.9%,Sol 只有 37.3%,Claude Fable 5.1 是 55.8%。 ![Terminal-Bench 4.0 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/AYnLRZJdBBD3iqrg.jpg) 不过这次最让我意外的跑分是 ARC-AGI-3。 这个测试难在不给 AI 说明书、不给规则、甚至都不告诉 AI 目标是什么,模型进去只能自己乱按,慢慢摸清怎么才算赢,再把摸出来的规律用到更难的关卡上。 它考查的不是 AI 的知识,是悟性。 今年 3 月这个测试刚发布的时候,最强的 AI 只有 0.51 分,人类平均 48 分,GPT-5.6 Sol 是 7.8 分。 而 Astra 做到了 99.9 分! ![ARC-AGI-3 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/ASV7VCdK3xhONqfx.jpg) 把这称作 AI 的开悟时刻,不过分吧? 再看看 GPT-6 的数学能力,FrontierMath Tier 4 这套题 Astra 拿到 97.6%,基本上算是打穿了。 ![FrontierMath Tier 4 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/1UsrMsdmVdAuuJNr.jpg) 最后说说大家关心的价格。API 里的模型 ID 是 `gpt-6-astra`,每百万输入 token 10 美元、输出 50 美元,跟 Claude Fable 5.1 一模一样,是自家上一代 GPT-5.6 Sol 的 2.5 倍,涨得还是挺狠的。 但是考虑到大多数用户都是在 Codex(ChatGPT)中使用套餐,再加上官方老是赠送重置额度,实际开销没有那么大。 ## 实战案例 跑分看着很爽,但我更关心 GPT-6 做出来的东西是什么效果。 官方这次放了不少实际案例,我挑几个有意思的说说。 先看一个最能体现「操作电脑」能力的。官方让 Astra 打开 KiCad 这个电路设计软件,把一张电子原理图变成可以直接拿去生产的电路板布线图,元器件怎么摆、铜线怎么走全都是它自己完成的。 ![Astra 在 KiCad 里完成电路板布线](https://pic.code-nav.cn/post_picture/1601072287388278786/vQVI9yuSU1m6wduM.jpg) 这活儿平时是硬件工程师一点一点手工拖出来的,也是整个电子设计流程里最费时间的环节之一。 然后是 3D 建模能力,官方展示了让 Astra 直接建出一整座城市场景,楼体、道路、绿化带、斑马线、路上的车,一个都不少。 ![Astra 建出来的 3D 城市场景](https://pic.code-nav.cn/post_picture/1601072287388278786/T1P6XBu2XIDWVKuZ.jpg) 不光是建静态模型。官方还演示了先在 Blender 里把一栋房子建出来,再导进 Unreal Engine 5 变成可以自由走动的场景,让设计师和客户在开工之前就能提前逛一遍。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Sz7psxB25TakWJHW.jpg) 再看看游戏开发能力,官方直接在发布页面里嵌了两个能玩的网页项目,鼠标点进去就能上手。 第一个是卡丁车竞速游戏,这是完全用 AI 程序化生成的 Three.js 卡丁车赛车,赛道和场景不是靠网上的素材堆出来的,是靠代码算出来的。 ![Tidal Rush 卡丁车游戏的实际画面](https://pic.code-nav.cn/post_picture/1601072287388278786/UDUB6QYNpwIAFr1I.jpg) 我自己上手跑了两圈,速度表、漂移条、小地图、名次和圈数都在,手感也不飘。沙滩的高光、水面的透光、椰子树的剪影、彩旗的排布,这水准我觉得已经超过不少外包团队交的活儿了。 第二个案例更酷炫,是个宇宙飞船船厂。每换一个随机种子就能生成 1000 艘不重复但可复现的飞船,全部由 177 个模块化零件拼出来,每一艘还带尺寸、载货量、推力、装配模块数这些参数。 ![飞船船厂里 1000 艘飞船的图鉴](https://pic.code-nav.cn/post_picture/1601072287388278786/jwwszai6x6wM74VB.jpg) 左边是舰队列表,中间是整页图鉴,右边是选中那艘船的详细规格,还能导出成一张拼版图。 除了官方,一批提前拿到内测权限的人也在 Twitter 上晒了自己的测试,有几个我觉得比官方演示还带劲儿。 Matt Shumer 让 Astra 在 Unreal Engine 里造一个世界,往里面填满由 Astra 驱动的角色,要求他们必须互相合作才能活下去。第二天他在卧室里听见客厅有人说话,以为家里进人了,走出去还有点害怕,结果是那些 AI 角色自己开始互相聊天了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/A57K0hBeI7nv5aMi.jpg) 一位研究 T 细胞三十五年的免疫学教授,只给了 AI 一句「做一个 5 分钟讲 T 细胞的教学视频」,Astra 自己挑了视频框架、调文生图做画面、还主动建议用 AI 配音,最后一次性把讲什么、怎么讲、配什么画面全组装好了。 教授说:凭他三十五年的经验,他自己也讲不了比这更好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TgvAcViw61yeWzVB.jpg) 看完案例你可能会想:官方是拿什么样的提示词做出这些东西的? 这个问题其实有答案。OpenAI 有一个 [开发者展示馆](https://developers.openai.com/showcase),里面收录了五十多个用 Codex 做出来的项目,而且 **每个案例的详情页都把当时用的提示词原文一字不改地贴出来了,后面还列了每一轮迭代都改了什么**。 ![OpenAI 官方开发者展示馆](https://pic.code-nav.cn/post_picture/1601072287388278786/LAbfIpvkOJtkpLWF.jpg) 虽然这个展示馆不是这次跟 Astra 一起发的,里面的案例大多是用 GPT-5.5 和 5.6 做的,但我觉得值得给大家分享一下,看官方的提示词能收获不少 AI 编程的启发。 随便分享 2 个,第一个启发是 **要逼 AI 自己验收**。 比如玻璃塔堆叠游戏的提示词,最后一句是这么写的: ``` Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors. ``` 意思是先跑构建和代码检查,然后让 AI 在浏览器里玩几局,把碰撞、计分、失败和重开都验一遍,控制台不许有报错。 ![Glass Towers 玻璃塔游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/bsrmi9Zuf2QU7iEr.jpg) 这就是我一直在讲的 Loop Engineering,让 AI 写完自己验,验证不通过就自己修复。官方把它写成了提示词里的硬要求。 第二个启发是 **先画图再写代码**。 小镇模拟游戏的提示词最后一段,是让模型先用文生图工具画几张玩法概念图,把视觉方向定下来,再开始写代码。 ![MiniTown 小镇模拟游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/FXxDxfWSqJf4rnHU.jpg) 如果你平时让 AI 做前端总觉得出来的东西土,这一招直接助你羽化登仙。 剩下的案例我就不逐个讲了,放一张成品感受一下水平。 ![Terrain Mixer 程序化地形生成器](https://pic.code-nav.cn/post_picture/1601072287388278786/L7eQENNQP6hm4v7m.jpg) ## AGI 时代真的来了么 虽然官方把 GPT-6 Astra 吹得狂拽炫酷吊炸天,我看了官方展示的案例也觉得很牛呗,但是网上有很多不同的声音。 第三方评测机构 Artificial Analysis 在发布当天就出了独立评测,结论跟官方不太一样。在他们的综合智能指数里,Astra 是 61 分,跟上一代 GPT-5.6 Sol 一模一样,比 Claude Fable 5.1 还低了 5 分。 ![Artificial Analysis 的独立评测](https://pic.code-nav.cn/post_picture/1601072287388278786/U7P4IDCcwv6w4QSo.jpg) 图里右边那一栏是单个任务的成本,Astra 1.67 美元,GPT-5.6 Sol 0.94 美元。**智能指数一分没涨,成本快翻倍了!** 所以「全球最强」这个说法,在 OpenAI 自己挑的那批测试上成立,一换成第三方的综合指数就未必成立了。 而且根据历史情况,我们可以大胆假设,GPT-6 Astra 大概会像其他模型一样,第一周用起来像是在跟神说话,一周后厂商为了省算力搞一波降级,再用起来就像是在跟三岁小孩说话,两周后被用户投诉多了,就再把智力调回来一点,几周之后再发布 GPT-6.1,然后循环…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uC3UBzuXbdkswKBx.jpg) 就分享到这里吧,等我拿到 GPT-6 Astra 的使用权限,再跑几个 AI 编程实战项目测测看。 本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/66qzga081WA3bBBB.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区有没有已经用上 GPT-6 Astra 的朋友,聊聊你们的使用感受?

刚刚 Gemini 3.8 Flash 模型发布,遭全网狂嘲。。谷歌这波拉完了?

大半夜的,Google 发布了 Gemini 3.8 Flash 新模型。 这已经是他们六周之内发的第三个 Flash 模型了,从 3.6 到 3.7 再到现在的 3.8,差不多每三周就来一版,我真的已经写不过来了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ljF4S444S69FWJsu.jpg) 每次新模型发布,大家最关心的无非就是两件事,**能力怎么样** 和 **价格贵不贵**。 先看价格。Gemini 3.8 Flash 的单价一分钱没涨,还是每百万 token 输入 0.75 刀、输出 3.75 刀。 这是什么概念呢? Claude Opus 5 是输入 5 刀、输出 25 刀,也就是说 3.8 Flash 的单价只有 Opus 5 的七分之一左右。 再看看能力。最能说明问题的是 DeepSWE v1.1 这一项,它专门考查模型能不能自己端到端做完一整套长周期的软件工程任务。 3.8 Flash 拿了 73.7%,上一代 3.7 Flash 只有 65.3%,而贵了七倍的 Claude Opus 5 是 74.0%,两者只差 0.3 个百分点! ![DeepSWE 长周期软件工程跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/sQq4mppYsNt7lBqY.jpg) 考察 Agent 终端编码能力的 Terminal-bench 2.1 测评上,它拿了 89.4%,是全场第一,超过了 Opus 5 的 89.1%! ![官方总跑分表](https://pic.code-nav.cn/post_picture/1601072287388278786/UT7vdiFTXoGLqSDX.jpg) 单价只有七分之一,跑分却跟顶级旗舰模型不分上下,光看这些数字,我对这个模型还是有点期待的。 但这次发布最有趣的地方,恰恰藏在单价的背后。 Google 一直在强调 3.8 Flash 跟上一代 **同价同速**,可第三方评测机构 Artificial Analysis 拿真实任务测下来,单任务消耗的 token 从 3.7 万涨到了 4.8 万,涨了将近 30%,单任务的实际成本也从 0.40 刀涨到了 0.58 刀,整整贵了 40%。 更要命的是首字延迟,它吐出第一个字平均要等 13.3 秒,而同类模型的中位数只要 2.99 秒。 所以有网友制作了这样一张梗图: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ya5XoVoiShm2Esad.jpg) 官方自己在博客里交代了原因,说 3.8 Flash 会「works harder」,遇到复杂任务会在背后反复推理、多次调用工具、自己纠错。 那 Gemini 3.8 Flash 模型到底怎么样呢? 老规矩,好不好用还是得自己试了才知道。 接下来我会在 Cursor 里使用 Gemini 3.8 Flash 模型,通过 **3 个全新设计的项目** 来测试它的实际编程能力: 1. 3D 动画短片《一个 HTTP 请求的一生》 2. 3D 烟花仿真燃放系统 3. Markdown 写作图床工作台 测试方法很简单,我在 Cursor 里同时起了 3 个子 Agent,每个 Agent 负责一个独立项目、一个独立目录,全程不需要人工干预,让 AI 自己跑到底。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/u0VXU2MNYNNuvzya.jpg) 大家可以猜猜看,跑完这 3 个项目要花多少钱?答案在结尾揭晓。 ## 项目实战测评 ### 1、3D 动画短片 平时我们天天跟 HTTP 打交道,但在浏览器地址栏敲下回车之后、页面显示出来之前,中间那一串过程大多数人只在架构图上见过,从来没见过它动起来。 第一个项目我就让它做一支能在浏览器里全屏播放、还能导出成视频文件的 3D 动画短片《一个 HTTP 请求的一生》,把这个过程讲明白。 提示词里我把片长卡在 40 到 60 秒、分成四段,其余的全部放开,不指定任何技术栈,只要求它用 Context7 查所用 3D 库的最新文档,而且片子里所有的模型和场景必须用代码生成,不许用任何外部的图片或者模型文件,其他的全部留给 AI 自己编排。 ![CASE 1 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/jZE2fTtxhbpVfWUt.jpg) 拿到任务之后,AI 先用 Context7 查了 Three.js 里三维样条曲线和管道几何体的最新用法,然后花了大约 14 分钟做完。 整个过程它不光用 Canvas 2D 纯代码画出了发光芯片和机房指示灯的贴图,还自己写了个自动化脚本逐帧抓取渲染画面,再转码成视频。 来看看成品效果。 短片开场是一台发光的显示器,模拟用户在地址栏敲入网址然后按下回车的瞬间。 ![输入网址敲下回车](https://pic.code-nav.cn/post_picture/1601072287388278786/IxGg90Nx4uAUex4X.jpg) 回车按下去,镜头立刻拉进微观电路,第一幕 DNS 递归查询开始,发光的数据包沿着光纤在根域和顶级域名服务器之间穿梭。 ![DNS 递归查询](https://pic.code-nav.cn/post_picture/1601072287388278786/pTQGcJJnCNWzReRn.jpg) 镜头再推近权威域名服务器,芯片亮起并返回解析出来的 IP 地址,第一幕的动画流畅度还不错。 ![权威 DNS 返回 IP](https://pic.code-nav.cn/post_picture/1601072287388278786/ylxxwT4kkAU2AfBA.jpg) 第二幕切换到 TCP 三次握手,数据包变成金色脉冲在客户端和服务端之间往返,先是发起 SYN 报文。 ![TCP SYN 握手](https://pic.code-nav.cn/post_picture/1601072287388278786/ZU2Y9afWesfuv04z.jpg) 服务端收到之后回复了 SYN+ACK,画面上两端的节点跟着闪烁确认。 ![TCP SYN+ACK 握手](https://pic.code-nav.cn/post_picture/1601072287388278786/UjYkxbReItpZzvU1.jpg) 客户端再回传 ACK,三维世界里立刻贯通出一条双向的数据光纤隧道,这个连通感做得挺到位。 ![TCP 建立双向通道](https://pic.code-nav.cn/post_picture/1601072287388278786/KnjxHIeI2BQY4p6x.jpg) 其他镜头我就不挨个儿介绍了,最终完整的网页呈现在屏幕中央,天上还放起了烟花。 ![网页渲染完成的结尾特效](https://pic.code-nav.cn/post_picture/1601072287388278786/dZD7wWXuJ25Y3bLo.jpg) 通过这个任务,我发现确实如 Google 官方所说,AI 主动做了不少事情。 比如网页 Canvas 导出视频的时候,默认只会录到三维画布,外面所有的 HTML 字幕都会丢掉。它自己搭了一套双层复合录制管线,把底部字幕和协议标签直接压进了视频帧里,导出来的 MP4 可以直接发到视频平台。 **不足之处也很明显了,整套前端效果真的不好看!!!** 我印象中前端设计能力一直是 Google 系列模型引以为豪的亮点,怎么这次这么拉了,无论是配色还是字体都透露着浓浓的 AI 味儿,甚至有些字体根本看不清…… ### 2、3D 烟花仿真燃放系统 第一个项目考察 AI 对镜头和叙事的编排,接下来这个就纯粹看图形算法、物理建模和性能优化能力了。 我让 AI 做一个 3D 烟花燃放的仿真网页,做球形、牡丹、柳条三种形态,升空和炸开都要按真实的重力和空气阻力来算,不许用预先做好的动画糊弄,爆炸的时候还要有声音。技术栈依然完全放开,让 AI 自己想办法。 ![CASE 2 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/g4CYVm3X6tuXgegY.jpg) AI 这次花了大约 11 分钟,用 Context7 插件查了 Three.js 动态缓冲顶点属性的用法,然后自己写了一套着色器。 先看初始场景,夜幕下是城市天际线的剪影,下方水面还有微光在荡。 ![夜空天际线初始场景](https://pic.code-nav.cn/post_picture/1601072287388278786/oTqGHDGuL4jREKp2.jpg) 第一种是经典的金色球形烟花,它用斐波那契球面算法算初速度,炸开之后是一个非常规整对称的球壳。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YiZe0FV0jgB51Sp0.jpg) 第二种是牡丹,它做成了双层结构,外层是主花瓣、内层是星蕊,炸开的一瞬间花团锦簇。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dTAloi4x7r5u6se7.jpg) 第三种柳条烟花最考验 AI 的物理建模能力,火星受重力和空气阻力双重作用往下垂,燃烧时间长达 3.5 秒以上,拖出一挂金色的瀑布。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lBx5QCkK2oGo19kn.jpg) 接下来是这道题的重头戏,验帧率。我要求的是上万颗粒子维持 60 帧,AI 在压测模式里直接把同屏活跃粒子拉到了 40000 颗,是我要求的 4 倍,画面依然稳稳跑在 120 帧上。 ![4 万粒子 120 帧极限压测](https://pic.code-nav.cn/post_picture/1601072287388278786/R2jAZpMfe2mrYS1l.jpg) 总体来说,AI 完成的还是不错的,但还是老问题,整个前端 AI 味儿太足了,用了很多 Emoji 图标,没有什么让人惊喜的地方。 ### 3、Markdown 写作图床 前面两个项目都在看 AI 的图形表现力,接下来试试它的全栈能力。 我写文章的时候经常要配图,截完图要压缩、转格式、上传、再手动复制链接,比较麻烦。 所以我打算让 AI 做一个自用的图床,截图拖进去或者直接粘贴进去,它自动把图片转成 WebP 格式压缩,然后返回一条能直接贴进 Markdown 的链接。 ![CASE 3 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/XoZcGrTfMfdXTYYc.jpg) 大约 5 分钟,AI 就完成开发并且跑通测试了。它选的是 Express 配 Sharp 做图像处理,数据库用了轻量的 better-sqlite3 并开了 WAL 模式。 来看看成品效果。 界面是暗色玻璃拟态的风格,顶部是已存图片、节省体积和压缩比率三个统计,中间是拖拽上传区。 ![图床大盘与图片墙](https://pic.code-nav.cn/post_picture/1601072287388278786/MC5hLXCAKjtPUgPC.jpg) 传一张图上去,它自动转成了 WebP,体积从 87.87 KB 压到了 12.13 KB,压缩了 86.2%,同时给出了可以直接复制的 Markdown 代码。 ![上传图片与 WebP 压缩率](https://pic.code-nav.cn/post_picture/1601072287388278786/8V4v6hmip7MNsT78.jpg) 把同一张图再传一遍,它立刻通过 SHA-256 认了出来,弹出黄色提示,并且直接把上次的链接还给我,没有额外占用磁盘空间。 ![智能秒传去重识别提示](https://pic.code-nav.cn/post_picture/1601072287388278786/JT0x9jvg6QsVHCQt.jpg) 点击图片卡片,可以打开大图详情弹窗,能看到原图和 WebP 的体积对比、分辨率,还能一键复制不同格式的链接。 ![大图详情与尺寸对比](https://pic.code-nav.cn/post_picture/1601072287388278786/PtcA1LuiPs2ZEqWo.jpg) 支持按照文件名称实时搜索图片,也能按照时间和体积正反序排列。 ![搜索过滤与排序](https://pic.code-nav.cn/post_picture/1601072287388278786/Adb25P4ot8ZazLDl.jpg) 勾选卡片左上角的复选框就进入批量管理模式,支持全选,删除前还有二次确认。 ![多选与批量删除模式](https://pic.code-nav.cn/post_picture/1601072287388278786/mnYXL5cKgicQpB47.jpg) 整个系统的功能还是很完整的,美中不足的是,如果我传一张特别长的代码截图进去,图片墙在算瀑布流高度的时候卡片底部偶尔会错位。 ## 我的感受 3 个项目全部跑完了,我个人对 Gemini 3.8 Flash 还是有点失望的。 虽然能够顺利完成全栈开发任务,但这已经是现在新模型的门槛了,关键是新模型在前端的表现上有点拉,尤其是我昨天刚测试完 Claude Fable 5.1,跟顶级模型的差距非常明显。 而且测试中,我也发现了 Gemini 3.8 Flash 模型首字延迟的问题,起步速度略慢于 Grok 4.6、DeepSeek V4 Flash 等模型,不知道你们有没有遇到? 最后揭晓开头的谜底,这 3 个项目花了多少钱。 答案是 30 块钱左右,如果直接用官方的 API 可能会更便宜一些,你觉得这个价格怎么样? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OKSwlCsxhZCKor9R.jpg) 虽然肯定比 Claude Opus 5 这种顶级模型便宜,但是跟 GLM、Kimi 等国产模型相比,基本上没有什么价格优势。而且同样的任务,交给 GLM-5.3、Kimi K3 来做,效果可能更好。 **所以测完这次之后,我应该不会再用 Gemini 3.8 Flash 这个模型了。** 怎么回事,谷歌那么强大的公司,怎么在大模型领域被其他公司按在地板上反复摩擦呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nziu3do0pVurxtIB.jpg) OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/pK9Tg24YWwLeUADq.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你觉得 Gemini 3.8 Flash 怎么样?

刚刚 Claude 最强模型 Fable 5.1 发布,最高降价 75%!系统提示词还被人扒出来了?

大家好,我是程序员鱼皮。 大半夜的,Anthropic 发布了 Claude Fable 5.1,这是目前 Claude 家族里最强的模型,专门为长程 Agent 编程和复杂知识工作打造的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iSSMhxKPpfgjVxCd.jpg) 这次 Fable 5.1 加入了反蒸馏机制,新的 API 账户没办法在多轮对话中篡改 Claude 之前的上下文来偷取思考过程了,防止其他厂商大规模蒸馏 Claude 的能力。 不过这个跟咱们用户关系不大,每次发布新模型,大家最关心的无非就是两件事:**能力怎么样** 和 **价格贵不贵**。 先看下能力。Fable 5.1 在 Agent 科学研究和 Agent 编程这两个方向上提升最猛。Terminal-Bench-Science 拿了 52.6%,Fable 5 只有 24.7%,直接翻倍了!Agent 编程的 Terminal-Bench 4.0 拿了 55.8%,也远超 Fable 5 的 42.0% 和 GPT-5.6 Sol 的 37.3%。在 Cursor 场景下的 CursorBench 也拿了 73.4%,是目前跑过这个基准得分最高的模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nQIzyZ0CBer9fH0G.jpg) 再看价格,Fable 5.1 的输入输出价格跟 Fable 5 一样,还是每百万 token 输入 $10、输出 $50。但是 Anthropic 把缓存读取的价格砍了 75%!从 $1 降到了 $0.25。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XTJ5zI9Emc4aJ83f.jpg) 别小看这个改动。Agent 编程场景下,模型会反复读取之前的上下文,缓存读取占了大头成本。官方实测下来,普通任务便宜了约 25%,重度 Agent 任务最高能省 45%! 当然,以上只是官方信息,模型好不好用,还得拿真实项目来检验。 接下来我会在 Cursor 里使用 Fable 5.1 模型,通过 **3 个不同类型的项目** 来测试它的实际编程能力: 1. 3D 网页动作游戏《黑神话 - 牛来》 2. 全栈 AI 编程工具(复刻 Cursor,横评对比) 3. AI 智能视频剪辑工具 测试方法很简单,我在 Cursor 里同时起了多个子 Agent,每个 Agent 负责一个独立项目、一个独立目录,全程不需要人工干预,让 AI 自己跑到底。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/K4eXMiO3dYKJVQuV.jpg) 激动的心,颤抖的手,点个收藏,咱们开始~ ## 项目实战测评 ### 1、3D 网页游戏《黑神话 - 牛来》 第一个项目,致敬《黑神话:悟空》和国产动画电影《牛来》,做一个 3D 网页动作冒险游戏,复刻黑神话悟空的核心玩法和战斗机制。 提示词很简单,我只给了核心定位和方向,让 AI 自己用 Loop Engineering 循环工程的方式迭代推进,具体怎么实现完全交给 AI 自己发挥: ``` 开发一个致敬国产动画电影《牛来》和《黑神话:悟空》的 3D 网页动作冒险游戏,名为《黑神话 - 牛来》。主角是牛来,在奇幻大陆上闯关战斗,复刻黑神话悟空的核心玩法和机制。 必须先用 Firecrawl 联网搜索《黑神话:悟空》的战斗系统和游戏机制资料,以及《牛来》电影的视觉风格和角色设计资料。开发时用 Context7 查询所用 3D 库的最新文档。 开发过程中通过 Loop Engineering 方式推进:每完成一个功能模块就自己在浏览器中验证效果,发现问题立刻修复,确保最终交付时所有功能正常运行、没有报错。 ``` 开发过程中,每完成一个模块,AI 都会自己打开浏览器验证效果,发现问题就立刻修复,不需要我做任何干预。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ud1GlkwBLVa70Rbb.jpg) 来看看成品效果。 先看主页,这段开场描述写得还挺有味道的,还提供了详细的游戏说明,不过也是浓浓的 AI 味儿。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fpwkQteQDm6CEm8l.jpg) 进入游戏,第三人称跟随摄像机,可以自由旋转视角,确实有黑神话那个味儿了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9XzTyICYieeIJPq1.jpg) 场景里有小怪和 BOSS,你需要清除区域内的妖怪才能解开结界,进入下一个区域。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/F0rGpMrrcKiBjHtu.jpg) 最让我惊喜的是战斗系统。牛来的攻击方式非常丰富,除了轻棍、重棍、闪避这些基操之外,重点还原了黑神话悟空中的棍势机制,支持四段连招、蓄力重击等多种连招玩法。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/awG561GWR6E6msVA.jpg) 还复刻了黑神话中的经典技能,比如定身术,可以直接定住一名敌人,然后一顿输出,跟原版游戏的体验很接近。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NlDcIsL102K4xpGf.jpg) 还有分身技能,会召唤出多只小牛来一起攻击,BOSS 战的时候特别好用,来感受下这个技能的还原度: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ir4Ybk0bW0ElBvHk.jpg) 还有狂牛变身,怒气攒满之后可以变身为狂牛形态,攻击力提升 1.8 倍,而且所有招式不消耗体力,广智助我! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mqzXsw9vGl30xz4J.jpg) 可惜,游戏的不足之处也很明显。整个游戏没有声音,部分场景会出现穿模的情况,牛来偶尔会卡在地形里面。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eScLmYGqUEoCkw9Q.jpg) 综合来看,只用一段提示词就能让 AI 做出一个拥有完整战斗系统、多种技能和 BOSS 战的 3D 动作游戏,我觉得已经非常厉害了。 之前我让 GLM-5.3 做过《牛来》跑酷游戏,也就是个简单的躲避障碍物。但 Fable 5.1 直接一把梭出了有攻击连招、法术技能、BOSS 多阶段的动作游戏,完全不是一个量级。 ### 2、全栈 AI 编程工具(复刻 Cursor) 经常看我文章的朋友应该对这个项目不陌生了。 之前我在测评 Kimi K3 和 Claude Opus 5 的时候,都用了同一段提示词让模型复刻一个 Cursor 风格的 Web AI 编程工具,正好拿来横向对比。 这次我用和之前完全一致的提示词,让 Fable 5.1 基于 VS Code 的开源代码,开发一个支持 Editor Window 和 Agents Window 双模式的 Web AI 编程工具: ``` 克隆 VS Code 的开源代码 https://github.com/microsoft/vscode,在此基础上开发一个复刻 Cursor 核心体验的 Web AI 编程工具。 请先用 Firecrawl 联网搜索 Cursor 3 的 Agents Window 和 Editor Window 的产品设计和交互方式,了解需要复刻的核心体验。开发时用 Context7 查询 VS Code 扩展 API 和所用框架的最新文档。 支持两种窗口模式:Editor Window(传统代码编辑器界面,包含文件树、多标签页、语法高亮,用于浏览和手动编辑代码)和 Agents Window(Agent 优先的工作台,可以启动 AI Agent 任务,Agent 自主读取文件、编辑代码、执行终端命令来完成开发任务,支持并行运行多个 Agent)。两种窗口可以切换使用。 AI 后端调用兼容 OpenAI 协议的大模型接口,base_url 为 https://api.deepseek.com/v1,API Key 为 sk-xxx,模型 id 为 deepseek-v4-pro。 这是一个复杂的长程任务,用 Loop Engineering 方式推进:先搭出 Editor Window 的基础骨架(文件树 + 编辑器),确认能跑;然后搭 Agents Window 的 UI 并接入 AI 接口实现基本的 Agent 对话;再实现 Agent 读取和修改文件的核心能力;最后打通两个窗口的切换。每完成一步都要自己验证能否正常工作,通过截图查看界面渲染效果,判断布局和交互是否符合预期,发现问题就自主修复。 ``` 先看看成品效果。Editor Window 界面复刻得非常到位,代码高亮、代码小地图、文件树、多标签页都有了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GlWGYjAM6nDVLShY.jpg) 比之前 Opus 5 做出来的成品更精致了,这次甚至连终端都完整地做出来了,可以自由输入命令、浏览文件目录。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3hAzvBwiKEB3TY2U.jpg) 切换到 Agents 面板,让 AI 执行一个任务,可以清晰地看到完整的执行过程,包括思考过程、工具调用、代码编辑等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/je2ADJ3l50io5OFe.jpg) 我再让 AI 开发一个贪吃蛇游戏,它可以自主完成开发,而且界面上支持灵活地接受或拒绝 AI 改动的每个文件,跟真正的 Cursor 交互体验很像了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6OLEheyTevHylnej.jpg) 还支持多轮对话,而且默认设置了 AI 单次执行步骤不超过 20 步的保护机制,避免 AI 无限制地跑下去浪费资源,非常贴心了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aJY0hGQLiToVQL14.jpg) 复刻出来的贪吃蛇游戏也是完全可玩的,你觉得这个效果怎么样? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dFb2d7DHGEa4tcn8.jpg) 对比一下之前几个模型在同样任务上的表现。 当时我让 Kimi K3 做这个项目的时候,Editor Window 的基本骨架是有了,但界面比较简陋,文件树和编辑器之间的联动也不太顺畅。 ![Kimi K3 的 Editor Window](https://pic.code-nav.cn/post_picture/1601072287388278786/mhfe6n8geu6CdKLw.jpg) Agent 执行任务时虽然能看到工具调用,但整体完成度跟成熟产品还有很大差距。 ![Kimi K3 的 Agent 执行](https://pic.code-nav.cn/post_picture/1601072287388278786/4x2Y7j2Ai9lroWHA.jpg) 后来我用 Claude Opus 5 跑同样的提示词,效果好了很多,保留了 VSCode 的代码高亮、管理面板等核心功能: ![Opus 5 的编辑器界面](https://pic.code-nav.cn/post_picture/1601072287388278786/1szI0D28tBi9Odna.jpg) Opus 5 的 Agent 也能调用终端自主测试开发出的代码,而且你可以清晰地看到 AI 的思考信息和工具调用过程。 ![Opus 5 的 AI 执行](https://pic.code-nav.cn/post_picture/1601072287388278786/FTELiev6wQppFX4b.jpg) 而这次 Fable 5.1 做出来的效果又上了一个台阶。对比下来,Fable 5.1 的版本在编辑器完整度、终端交互、Agent 执行流程、文件审阅机制这几个方面都做到了最好。同样一段提示词,你能明显感受到模型真的是一代比一代强。 ### 3、AI 智能视频剪辑工具 最后一个项目是全栈 AI 应用,让 Fable 5.1 开发一个 AI 智能视频剪辑工具,支持 AI 生成字幕、识别精彩片段、一键去水词等功能。 提示词同样很精简,我只给方向,让 AI 自己调研和发挥具体的技术实现: ``` 开发一个 AI 智能视频剪辑工具,用户上传视频后,AI 自动分析内容并提供智能剪辑功能,包括 AI 自动生成字幕、识别精彩片段、一键去口水话等。同时支持专业的时间轴手动编辑和视频导出。 必须先用 Firecrawl 联网搜索主流视频剪辑工具(如剪映、CapCut、Descript)的核心功能和 AI 剪辑特性,了解行业标准的产品设计。开发时用 Context7 查询 FFmpeg.wasm、WaveSurfer.js 等所用库的最新文档。 界面参考 CapCut / Premiere 的布局风格:上方预览区、下方时间轴、左侧素材面板。UI 设计要专业美观,暗色主题。 AI 大模型使用兼容 OpenAI 协议的接口,base_url 为 https://api.deepseek.com/v1,API Key 为 sk-xxx(请替换为你的实际 Key),模型 id 为 deepseek-chat。 开发过程中通过 Loop Engineering 方式推进:搭建完基础框架后先跑通一个最小闭环(视频上传 + 预览 + 基础时间轴),然后逐步补齐 AI 功能和手动编辑功能,每步都自己验证前后端联通性,发现报错立刻修复。 ``` 来看成品效果。 整个界面布局相当专业,左侧素材库、中间是视频预览和时间轴、右侧是属性和设置面板,还做了暗色主题,第一眼看上去确实像个成熟的剪辑软件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6fhpufVUubGApeLg.jpg) 导入一个视频试试。跟正常的剪辑软件一样,可以在时间轴上浏览视频、分割片段、撤销重做,音频波形也能正常显示。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L4FhgPv4gJYnfc2Q.jpg) AI 生成字幕功能也做出来了,不过由于我本地没有部署语音识别服务(ASR),AI 是用模拟数据生成的字幕,内容跟视频是对不上的。如果接入一个真实的语音识别服务,这个功能应该就能正常工作了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/atBmbiOWUROvQO7z.jpg) AI 识别精彩片段功能也一样,能看到界面上标记了高光时刻,支持预览和直接添加为片段,但由于缺少语音识别服务,识别出来的内容并不准确。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6RK8lCoHwmaCqFFP.jpg) 口水话检测功能做得很用心,可以自动识别各类语气词,列出来之后支持一键删除选中的部分。这个功能的前端交互是完全没问题的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZG1iy8JV8A30m5sV.jpg) 剪辑完的视频也可以正常导出,支持服务端 FFmpeg 和浏览器端 FFmpeg.wasm 两种导出方式,甚至还支持软字幕。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/cX3wp8a3IcvwEquw.jpg) 虽然 AI 字幕和精彩片段这些功能因为缺少语音识别服务没法真正跑通,但整个产品的前端界面布局和后端核心业务流程都是完整的。 只要接入一个语音识别 API,再让 AI 调试一轮,这些功能应该就都能用了。作为一轮提示词做出来的 demo,这个完成度我是很满意的。 ## 我的感受 3 个项目全部跑完了,聊聊我的真实感受。 Fable 5.1 给我最大的感觉是 **又强又稳**。我测试的三个项目涵盖了 3D 游戏、全栈 Web IDE、多媒体处理三个完全不同的方向,每个都一次跑通、直接能用,没有遇到启动报错或者核心功能跑不通的情况。 而且 Fable 5.1 特别擅长自己给自己加活儿。3D 游戏那个项目我只说了「复刻黑神话悟空的核心玩法」,它自己搜索了游戏机制资料之后,搞出了四段连招、蓄力棍势、定身术、身外身、狂牛变身这一整套技能系统。Cursor 复刻那个项目,我也没提过要做 20 步限制保护,它自己加上去的。 **你能感觉到 Fable 5.1 没有应付作业,而是在努力做出一个可以交付的成品。** 从 Kimi K3 到 Opus 5 再到 Fable 5.1,同一个 Cursor 复刻任务的效果一路在提升,能明显感受到模型能力的进步。 不过,贵也是真的贵…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eOGb1SD63cGdz5K5.jpg) 这 3 个项目的 Fable 5.1 消耗加起来大约 $63,算上调度用到的 Opus 零碎开销,总共花了约 $66,折合人民币将近 470 块。平均每个项目 150 多块,跑完这轮测评,把我一个月的鸡腿钱都干没了。 还记得么,之前我用 Claude Opus 5 跑 7 个项目花了 900 多块,这次 3 个项目就快 500 了。虽然官方说缓存便宜了 75%,但 Fable 5.1 本身太能想、太能写了,token 消耗量摆在那里,省下的缓存钱又被额外的 token 给填回去了。 所以我的建议是,如果你做复杂任务时想追求更好的效果,用 Claude Opus 5 就足够了,价格只有 Fable 5.1 的一半,效果也很能打。只有当你需要处理真正复杂的长程任务时,比如大型项目重构、跨多个服务的架构调整、搭建和优化完整的工作流,才使用 Fable 5.1。千万别拿它来写个简单的增删改查,那是纯烧钱。 抛去这些顶级国外模型,其实大多数的日常任务,使用国产的 Kimi K3 和 GLM-5.3、或者 DeepSeek 就足够了,编程能力在线、成本只有 Claude 的几分之一。 ## Fable 5.1 提示词泄露 最后再提个有趣的事情,Claude Fable 5.1 发布才几个小时,系统提示词就被越狱大神 Pliny the Liberator 扒出来了。 足足超过 27.5 万字符,包含了全部 46 个工具的 JSON 架构和各种内部行为规则,感兴趣的同学可以去 GitHub 仓库围观。 > 开源指路:https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/Claude-Fable-5.1.md ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UeiNsm81o0tpYTfe.jpg) OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/yloxVqEt7qYniHFr.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你觉得 Claude Fable 5.1 怎么样?你现在主力用的是哪个模型?

又一个 AI 新项目完结,用 DeepSeek 搞了个 PPT 生成器!

大家好,我是程序员鱼皮。 又经过了一段时间的爆肝,我在编程导航的保姆级新项目教程《AI 智能 PPT 生成器》,完结啦! 这是一套以 **AI 工程化 + 工作流 + 异步任务编排** 为核心的全栈项目教程,基于 Python FastAPI + LangChain + LangGraph + React 开发。用户只需要输入一句主题、粘贴一段长文本,或者上传一份文档,就能先得到一份可修改的 PPT 大纲,然后并发生成完整页面,最终导出原生可编辑的 PPTX 文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hqBDPTxXmVH0BvkE.jpg) 每一期文字教程都详细讲解了设计决策和实现细节,让你不只会做,还知道为什么这么做。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/G06LawjINLdA8JGv.jpg) 这还不够,每个项目我都写了详细的简历写法和面试题解,做完项目直接写到简历上、突击面试,一条龙服务! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iQAORGZyr0SXRlox.jpg) 真心换真心,我做项目教程的付出也得到了大家的认可,也帮很多同学拿到了大厂 offer~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Milbv9Cg18M3PO8Q.jpg) 接下来鱼皮给大家快速介绍这个项目,希望让更多需要它的同学看到,把它变成自己的项目。 秋招正处于黄金时段,简历上写满前沿技术,不仅求职有底气,做项目的能力也会大幅提升! 而且为了让更多同学参与学习,我直接把所有代码 **完整开源**!能力强的同学可以自学,点个 star 就算对鱼皮的支持啦~ > 开源仓库:[https://github.com/yuyuanweb/ai-ppt-generator](https://github.com/yuyuanweb/ai-ppt-generator) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8xHURD9LeIFZtF8M.jpg) ## 项目介绍 项目有 4 大核心能力。 1)多种输入方式,自动生成大纲 项目支持从主题、长文本和文档三种入口创建 PPT,用户可以自由控制页数、排版模式、文字量、语气和目标受众。系统不会跳过用户直接生成最终页面,而是先生成一份结构化的大纲,包括每页的标题、页面目标和核心要点,你可以随意修改内容、增删页面、调整顺序,确认满意后再开始生成。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hPrfcyQLLW0UQNDT.jpg) 2)异步并发生成,实时推送进度 一份 10 页的 PPT 如果串行调用模型,很容易让用户等上一分钟以上。项目把每一页拆成独立的任务,通过 ARQ Worker 并发执行,用 Redis 保存任务状态并传递事件,前端通过 SSE 实时接收生成进度。 生成过程中,已经完成的页面可以立即预览,失败的页面可以单独重试,用户也可以随时软取消剩余任务,不需要整份重来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Xs1Arthgzs2j2KBa.jpg) 3)功能完善的在线编辑器 生成完成后进入在线编辑器,左侧是页面缩略图,中间是 16:9 的画布区域,右侧提供 AI 修改、主题切换、版式选择和图片管理四个面板。 文字内容支持直接编辑,灵活排版的页面可以拖动分隔线调整内容块尺寸,也支持跨容器移动和更换排布方式。切换主题后,Web 预览和 PPTX 导出会读取同一份主题数据,保证效果完全一致。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OdjU86oxVuJgifbv.jpg) 4)原生可编辑的 PPTX 导出 AI 输出的文字长度不可预测,直接导出很容易出现文字溢出、缺页或整页被渲染成图片的问题。项目在导出前会自动检查结构、文字占用、数字来源和页面边界,将问题分成 error 和 warning 两个级别,error 会阻断导出,warning 则提醒用户核对但允许继续。 通过检查后,后端用 python-pptx 逐块构造文本框、表格、图表和图片,再回读生成的文件进行验证。最终得到的 PPTX 不是一张铺满全页的截图,而是每个元素都能继续修改的原生对象。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IFFXL8gw1bIiHa5B.jpg) 学会这个项目后,你不仅能做出一个 AI 智能 PPT 工具,还能完整解释它为什么这样设计、哪里容易失败,以及怎样把一个模型 Demo 做成可持续运行的工程项目。这些经验可以复用到任何 AI 全栈项目中,绝对让你收获满满! ## 项目收获 本项目选题新颖,紧跟 AI 工程化时代,以 **实用工具 + 完整工程** 为导向。区别于增删改查的烂大街项目,这套教程讲解的是一个经过市场验证的完整项目,重点不是带你照着代码从零敲一遍,而是把每个关键决策背后的动机、替代方案和踩坑讲清楚,快速给你的简历和求职大幅增加竞争力! 项目内容精炼,**不到一周就能学完**,帮你成为 AI 时代企业的香饽饽,给你的简历和求职大幅增加竞争力! Python 后端 + LangChain + LangGraph + React + 企业级 AI 应用开发,技术丰富,学完后在 AI 工程化、异步编排、文档渲染、前端编辑器、工程质量 5 个方向都能获得完整实践。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c7bbDVcfc3Kt5Bhe.jpg) 鱼皮给大家讲的是 **完整的 AI 工程化实践和从模型调用到产品交付的全流程**,从这个项目中你可以学到: + 如何基于 LangChain 实现 AI 结构化输出,保证模型输出始终可用? + 如何基于 LangGraph 构建自纠环工作流,系统性提升单页生成质量? + 如何设计 AI 工具调用机制,让模型快速修改页面? + 如何使用 ARQ 实现页级并发生成,控制模型调用频率? + 如何通过 Redis + SSE 实现实时进度推送和断线重连恢复? + 如何设计内容、布局、主题三分离的数据模型,让 Web 和 PPTX 同源渲染? + 如何构造原生可编辑的 PPTX,处理中文字体和 emoji? + 如何实现结构化编辑器,保证光标稳定? + 如何通过乐观锁 + 按页串行保存队列处理编辑冲突? + 如何实现字形级文字溢出检测和分级门禁? + 如何快速生成前端 TypeScript 类型,消灭前后端接口不一致? + 如何实现 PPT 灵活排版,并保证前后端求解器双端一致? 此外,还能学会很多 AI 工程化、系统架构设计、技术方案对比的方法,提升排查问题、自主解决 Bug 的能力。每一期还附带了项目的扩展方向,有能力的同学可以进一步拉开和别人的区分度,无限进步! 满满的项目正反馈: ![编程导航 26 年报喜](https://pic.code-nav.cn/post_picture/1601072287388278786/iVW731qBweZCyMqs.jpg) 除视频教程外,鱼皮编程导航的项目还提供: | 教程资料 | 求职助力 | | ---------------------------- | ------------------------------ | | 详细的文字教程 / 直播笔记 | ⭐️ 现成的简历写法,直接写满简历 | | 完整的项目源码 | ⭐️ 项目相关面试题解和真实面经 | | 1 对 1 答疑解惑 + 专属交流群 | ⭐️ 项目扩展思路,拉开区分度 | | 前端 + Java 后端万用项目模板 | ⭐️ 从学项目到拿 Offer 一条龙 | ![](https://pic.code-nav.cn/post_picture/1601072287388278786/EsluyvVZl7wcUS8Q.jpg) 下面是更多关于本项目的介绍。 ## 更多介绍 该项目功能完整,涵盖用户项目管理、输入解析、大纲生成、页面生成、在线编辑、主题布局、图片管线、导出质量检查 8 大模块。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ErR8GGp5fh2dkCg5.jpg) 本项目采用前后端分离 + 异步 Worker 架构。前端是 React + TypeScript SPA,后端是 FastAPI + ARQ Worker 服务,通过 REST API + SSE 通信。 后端内部按照 API 层、领域层、工作流层、渲染层分层,耗时的 AI 任务通过 ARQ 异步队列和 Redis pub/sub 来管理。内容、布局、主题三种数据通过 `shared/` 目录下的 JSON 文件前后端物理共享。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mVh3XuzP46odR5yw.jpg) 项目的核心业务流程非常清晰,能够帮你理清 AI 工程化项目的开发思路。整个流程从注册登录开始,经过创建项目、输入主题或材料、生成并确认大纲、并发生成页面、在线编辑、质量检查,最终导出 PPTX 文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xjoiZ3GkmXDlQJhg.jpg) 不得不说,做项目真的给了很多同学坚持学习的目标、也有了更多拿 Offer 的机会,大家的动力也更足了! 学起来,冲冲冲!

爆火的《牛来》模型正式发布!DeepSeek 的排名又下降了。。

大家好,我是程序员鱼皮。 前几天,海外 AI 平台 OpenRouter 和 OpenCode 上突然冒出了一个没有任何背景介绍的匿名模型 `Ox-Alpha`,俗称「牛来」模型。 没人知道它是谁做的,但开发者们试用之后纷纷上头了。上线首日直接冲到 OpenRouter 榜首,刷新了平台单日 Token 用量的历史纪录,甚至终结了 DeepSeek 在 OpenCode 连续 56 天霸榜的纪录! ![ox 模型的 LLM Leaderboard 排名](https://pic.code-nav.cn/post_picture/1601072287388278786/kBRU5Rfk8IGUvOvZ.jpg) 谷歌还屁颠屁颠儿地跑出来蹭热度认领,说这是自家的模型,结果被全网笑惨了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/akICRfJlO7rj9GJQ.jpg) 就在昨天,这个神秘模型终于正式揭晓身份。 它是智谱的 GLM-5.3-Flash,是国产模型! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fN9gcuwxX08Hwruo.jpg) GLM-5.3-Flash 是智谱的首个 **原生多模态模型**,采用全新架构,仅 320B 参数(激活仅 18B),能力就可以对标 Claude Opus 4.8,**而且价格竟然只有 Opus 4.8 的 1/40 !** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/b4IaQyqdQnUHu5Tv.jpg) GLM-5.3-Flash 上线即开源,采用 MIT 协议,而且全部流量跑在 10 万张国产芯片上! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KAvqVyOq6Os1v58p.jpg) 在 Artificial Analysis Intelligence Index 这个国际权威综合能力榜上,GLM-5.3-Flash 拿到了 57 分,跟 Claude Opus 4.8 持平,超过了 DeepSeek V4 Pro(53 分)和 DeepSeek V4 Flash(52 分)。在 Coding 方向的多项基准上也都逼近甚至超过了 Opus 4.8,但价格目前仅为 Opus 4.8 的 1/40,常规场景下也比涨价后的 DeepSeek V4 Flash 更便宜。 ![智谱 GLM-5.3-Flash 跑分图](https://pic.code-nav.cn/post_picture/1601072287388278786/TW7eXh9xiwgQVgtH.jpg) 一条新的 AI 模型斩杀线,正在形成。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pvkmTbUF6iApE5Z2.jpg) 以前大家默认 AI 具有前沿能力就意味着高昂的价格,GLM-5.3-Flash 把这个等式打破了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hoUB6U3KQrvpiRK8.jpg) ## GLM 终于开眼 对我来说,这次最兴奋的升级不是价格,而是原生多模态。 GLM-5.3 虽然编程能力很强,但它是个「瞎子模型」,写完代码之后没办法自己看一眼页面长什么样。同样的问题在测试 DeepSeek V4 Pro 的时候也遇到了,前端做出来的效果对不对、好不好看,模型自己完全判断不了。 AI 公司当然能意识到这个痛点,于是前阵子 DeepSeek V4 Flash 率先放出了多模态版本 DeepSeek-V4-Vision-Exp,这次智谱直接跟上,而且视觉能力是从预训练阶段就原生融入的,让 AI 天生就有一双慧眼。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8l5fLPKI82EOOTOt.jpg) 也就是说,AI 写完一段前端代码之后,它自己就能截图看效果、发现布局错位或者配色不对、然后自己修复,不需要你人工介入一步步测试和验收了。这对 AI 编程的体验提升是巨大的。 官方提供了几个 Demo 案例,咱们一起来看看。 ### 1、3D Blender 建模 GLM-5.3-Flash 在没有任何外部素材的情况下,自主运行了 16 个小时,用 Blender 从零搭建了一套约 400 平方米的专业主厨自宅和厨房。模型通过反复渲染、查看画面、定位问题、再迭代修正的方式,完成了整个场景构建。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tVWviEwKI9L8J9ip.jpg) ### 2、设计稿到完整 APP 让 AI 基于参考页面的截图进行像素级复刻,模型会分析设计体系、页面关系、共享组件、导航结构和动效逻辑,然后逐页截图与参考图对比,持续修正差异,直到视觉还原度达标。 设计稿原型图: ![设计稿原图](https://pic.code-nav.cn/post_picture/1601072287388278786/UDrxnFWQZZyu5afA.jpg) 复刻出来的成品 APP,还原度很高: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XLCpRdOUztqA2yoT.jpg) ### 3、主题视觉复刻 基于节日视觉设计,复刻红包封面的平面艺术风格和动态展示体验。 这个复刻效果,你觉得怎么样? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dXRPVFcKfkxgLGWE.jpg) ### 4、游戏复刻 让 AI 自主复刻经典的 Godot 游戏《喷射战士》。 好家伙,看看这个效果,我甚至以为是原作…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c4Cu2hzy2ijc69MM.jpg) 当然,官方 Demo 再好看也只是参考,到底好不好用还是得自己试了才知道。 下面我准备了 3 个项目来实测 GLM-5.3-Flash 的编程能力,从前端视觉复刻、全栈应用开发到多模态综合任务,由浅入深。 ## 工具准备 这次实战我选用的 AI 编程工具是 [ZCode](https://zcode.z.ai/cn),这是智谱 GLM 系列的官方 Harness 工具。 如果你平时就打算用 GLM 系列模型来 AI 编程,那 ZCode 是更好的选择,毕竟是角色专武嘛。它对自家模型 GLM-5.3-Flash 的多模态能力支持得最好,还内置了浏览器控制和电脑控制功能,模型可以直接操作浏览器、截图验证、自主调试。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nzStTaQkVSZ0bEwd.jpg) 打开 ZCode,会先让你登录授权,国内选择连接 BigModel 平台。 登录之后就进入了熟悉的 Agent 面板,跟 Codex 长得几乎一模一样,可以在对话框中直接切换使用最新的 GLM-5.3-Flash 模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5fwLQyQT4UiRHbNn.jpg) 另外,为了让 AI 运行时能够获取到最新的信息,还需要准备好联网搜索插件 Firecrawl、以及获取最新文档的插件 Context7。分别到各自的官网安装就好了,ZCode 会自动识别出本地已经安装的技能。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9EuIUjHwzbBUi9qq.jpg) ZCode 自带浏览器控制和电脑控制功能,开启之后模型就能直接打开浏览器截图验收、操作桌面应用。需要先在设置里点击授权,允许辅助功能和屏幕录制权限。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rRvwutwNNgZn8yim.jpg) 准备工作搞定了,下面开始实战。 ## GLM-5.3-Flash 实战测评 ### 实战 1、复刻 Apple Vision 产品页 第一个任务,我想测的是 GLM-5.3-Flash 的视觉理解能力,看看到底有多强? 最直观的方式就是让 AI 去复刻一个视觉效果很复杂的网页。我选了 Apple Vision Pro 的官方产品页,这个页面有大量的滚动触发动画、3D 产品展示、深色科技感背景和精致的文字排版节奏,是公认难度很高的前端设计。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CYPCQc3gkU6KzRmi.jpg) 提示词里我要求 AI 先用 Firecrawl 抓取目标页面的结构信息,然后充分利用视觉理解能力,先截图分析目标网站的布局和风格,开发过程中每完成一个模块就自己截图对比验证,不满意就优化,直到满意再交付。 我特地开启了完全访问模式,让 AI 可以自由安装依赖和启动服务,省去中间的确认环节: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pmUecXoHKt5Ki4NA.jpg) AI 拿到任务之后,先加载 Firecrawl 技能联网抓取了 Apple Vision Pro 产品页的网页结构,然后加载浏览器自动化技能,对目标页做了 8 个不同滚动位置的截图分析,提取出页面的章节节奏、双导航结构、文字韵律等设计细节。 做完这些准备工作之后,AI 才正式开工写代码。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hJ8gKg7tsbWxTc4f.jpg) 整个开发过程中,AI 会不断截图对比自己的成品和 Apple 目标页的效果,发现差异就调整。比如它会检查缩放舞台的文字与产品淡出时序是不是跟原版一致,章节标题的亮度对不对,媒体辉光效果够不够。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SctMIP6QRXB0CSmn.jpg) 经过了 12 轮截图验证,AI 花了大约 19 分钟完成了整个任务,并且自动帮我启动了项目: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rJmsDY58sxjhRiL0.jpg) 来看看成品效果。在没有使用任何 Apple 官方图片素材的情况下,整体布局的还原度相当高! 举个例子,对比一下导航栏的复刻效果,双层导航结构、胶囊按钮、产品子导航的排列方式都还原了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/guVcsQ2uqwN5yGdq.jpg) 整个页面的深色科技氛围和原版很相似,文字的排版节奏也是对味儿的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V3SFh4Qb7dwlriS1.jpg) 虽然没有真实的产品摄影图片,但整体的视觉还原度已经很不错了。如果把正式的产品图片替换上去,基本可以直接当成一个完整的产品宣传页来使用。 以后如果你想做个产品宣传网站,直接把要复刻的网址或者 UI 截图发给 AI,它就能帮你搭出来个八九不离十的版本,然后再手动微调细节就行了。 ### 实战 2、全栈 AI 绘图工具 第二个任务我换了方向,测试 GLM-5.3-Flash 的全栈工程能力。 我选了跟之前测评 GLM-5.3 时完全一样的案例,让 AI 开发一个 AI 智能绘图工具。 用户输入自然语言描述,后端调用大模型生成 draw.io 兼容的 XML 图表结构,前端嵌入 draw.io 开源编辑器实时渲染,还支持连续对话修改。 之所以用同一个案例,是为了跟之前在 DeepSeek Harness 里测试的 GLM-5.3、DeepSeek V4 Pro、Kimi K3 做横向对比,看看 GLM-5.3-Flash 在 ZCode 环境下表现如何。 而且 GLM-5.3-Flash 本身就支持 API 接入,正好可以作为这个应用内置的 AI 模型,一举两得。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TGWULXGnDfSuFfzU.jpg) 提示词跟之前完全一样,只是把内置的 AI 模型从 DeepSeek V4 Pro 换成了 GLM-5.3-Flash。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VAyRByaERll1YeI0.jpg) AI 通过 Firecrawl 联网抓取了 draw.io 仓库结构和嵌入协议文档,发现了一个关键信息:draw.io 支持 AUTOSAVE 事件,编辑器会主动推送 XML,这样就能实现双向实时同步,不需要魔改源码。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0ISknzzaAQouQTKE.jpg) 大约 46 分钟后,AI 完成了任务,主要的时间都花在了自动化验证上。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vzB6BPyYiONDX1YL.jpg) 来看看成品效果。刚打开页面我就被吸引到了,这个 UI 设计很有科技感,而且 draw.io 的集成非常自然,不像是生硬嵌入的第三方组件,而是融合成了产品本身的一部分。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Uy9QBVKLWBQVFD3F.jpg) 我让 AI 帮我画出 DeepSeek Harness 的架构图。左侧可以实时看到 AI 工作的过程,右侧显示了一个加载动画。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JZZiDrthuCgiwgK6.jpg) 生成完成后,右侧立刻渲染出了完整的架构图,分层清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fqVVMOjedidaTSTX.jpg) 更强的是,网站支持连续对话修改。比如我说「帮我把 Harness 服务层这块的背景改为红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布也会实时更新。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FktDYvWF7WWJLpN0.jpg) 不过偶尔也会出现 AI 生成的 XML 跟 draw.io 不兼容的情况,弹出解析错误的提示。之前我用 Kimi K3 跑同一个案例的时候也遇到过类似的问题,这估计是目前 AI 生成结构化代码时的通病了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5kb74NaGwgP0PH9d.jpg) 看了 GLM-5.3-Flash 生成的效果后,再跟之前在 DeepSeek Harness 里测试的其他模型对比一下。 之前 GLM-5.3 做的版本界面科技感最强,把 draw.io 深度融合到了自己设计的界面中,生成的架构图分层清晰,连续对话修改也很顺畅: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/cgbaYWbCDvZxc14c.jpg) DeepSeek V4 Pro 的版本虽然功能跑通了,但整体界面粗糙,draw.io 是直接整个嵌入的,给人的感觉很生硬: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7pRJNXqaO6GqkNhl.jpg) Kimi K3 的版本前端设计挺好看,draw.io 的融合度也不错,但后端偶尔翻车,会直接把 XML 源码糊在界面上而不是渲染成图形。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yXRWQRMWzIcmzCr2.jpg) 综合来看,GLM-5.3-Flash 这次的前端效果比 GLM-5.3 和 Kimi K3 略逊一筹,主要体现在界面精致度上。 后端能力比 GLM-5.3 弱了一些,偶尔会出现 XML 不兼容的情况,跟 Kimi K3 的水平差不多。但综合效果明显超过 DeepSeek V4 Pro,毕竟 draw.io 的集成方式和整体产品设计意识都好了不止一个档次。 ### 实战 3、3D 联机对战游戏 最后一个任务我想测的是 GLM-5.3-Flash 的多模态综合理解能力和长程工程能力。 一方面看它能不能从图片中提取视觉信息并转化成实际的代码产出,另一方面看它能不能在复杂的大项目中稳定运行而不翻车。 最近《牛来》不是很火么? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0XzqiqPQYGKVxsaa.jpg) 于是我让 AI 开发一个 3D 双人联机实时拳击对战游戏《牛来格斗》,致敬拳皇和奥特曼格斗进化系列的经典对战体验。 关键在于,我会提供 6 张《牛来》动画电影的角色原片图片,让 AI 分析这些角色的造型、体态比例和色彩风格,然后把它们还原成游戏中的可选角色。 这个任务对多模态能力的要求非常高,AI 不仅要理解格斗游戏的玩法机制,还得从图片中提取视觉信息并转化成 3D 角色建模。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JwsnIEg00W7Kihjf.jpg) AI 拿到 6 张参考图之后,通过联网搜索获取了拳皇和街霸的核心机制,然后分析参考图确定了 4 个可选角色的方案: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9hGNxKam1uXuqS7K.jpg) 整个 ZCode 的开发体验还是很丝滑的。AI 自己就能打开内嵌浏览器,操作页面然后截图验证效果,发现问题就自己修复,不需要我做任何干预。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kGc6hFPh56nZ27ud.jpg) 苦苦等待了 2 个多小时,AI 终于完成了任务。总共经历了 4 轮完整的开发 - 验证循环,长程任务没有翻车。 我已经开始期待成品了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QdAX6RIggcBmv7Bh.jpg) 打开游戏主页,《牛来》那股抽象的味儿扑面而来~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/liLL4Mj9GciZVEAG.jpg) 试试人机练习模式,先选择你的斗士。这 4 个角色的 3D 建模我觉得还不错,金黄色的牛麻麻、橙色的小牛来、斑点金钱豹、棕色的牛霸霸,跟我给的参考图还是挺像的吧? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TDOQbiMQNOV6LDma.jpg) 开始对战! 角色的出招方式很丰富,轻拳、重拳、轻踢、重踢、防御、闪避一应俱全。 看我豹拉一脚把牛来踹了个跟头,打的牛来叫「妈妈」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hPZE6f2xnSWzvcUb.jpg) 就你欺负我儿子牛来是吧? 牛麻麻亲自下场,先给你来一连串牛家拳,15 连击! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7zySLB7WPVmgfnH9.jpg) 还可以释放必杀技,蛮牛冲撞!特效还可以,打击感十足~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ec6BeF2Jhepchfy2.jpg) 每个角色的必杀技风格都不一样,小牛来的必杀是「飞天小牛弹」,会把对手轰出画面,动画效果很流畅: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vWB1FijASJeZznC0.jpg) 再试一下局域网联机功能。虽然能够正常加入房间开局,但双方的画面并没有实时同步。说明 GLM-5.3-Flash 在处理复杂的实时网络同步逻辑上还有一些不足。这也算是意料之中的事,WebSocket 状态同步本来就是后端最难搞的场景之一。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GZaOFvGUjdUsIccO.jpg) 但游戏单机对战的体验确实超出了我的预期。一个 AI 从 6 张图片出发,自己搜索格斗游戏的设计规范,自己分析角色造型转化成 3D 建模,最后做出一个有连招系统、必杀技特效、完整 UI 流程的格斗游戏,整个过程不需要人工干预。 视觉理解能力对 AI 编程的加持,在这个测评中体现得淋漓尽致。 ## 我的感受 三个项目都跑完了,聊聊我的真实感受。 这次 GLM-5.3-Flash 最大的亮点毫无疑问是视觉理解能力。之前测试 DeepSeek V4 Pro 和 GLM-5.3 的时候,前端效果好不好看、布局有没有错位,模型完全判断不了,只能靠人工验收或者 Playwright 做一些基础的文字化断言。 现在 GLM-5.3-Flash 能自己截图验证了,整个开发体验完全不一样。复刻 Apple 产品页的时候 AI 做了 12 轮截图对比,开发格斗游戏的时候 AI 通过截图抓到了一个纯代码审查根本发现不了的视觉 Bug。这种「写完代码自己看一眼效果」的能力,对 AI 编程来说真的是质的提升。 除了模型能力之外,大家最关心的肯定还是性价比。我开通了 GLM Coding Plan 的 Pro 套餐,三个项目跑完之后看了一下使用统计,5 小时额度才花了 40% 左右,这周才花了 8% 的额度。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rsucq1G0SeRbajEv.jpg) 换算一下,GLM-5.3-Flash 相比 GLM-5.3 额度翻了 3 倍,而且非高峰时段(包括周末全天)积分消耗减半。按照 Pro 套餐的周额度和我实际消耗的比例来算,跑完这 3 个项目的成本才不到 10 块钱。而且我测的项目复杂度都不低,如果你只是日常写点小工具、做个页面的话,一周的额度根本用不完。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7nhHyUnQ2U4zMMa3.jpg) 相比之下,DeepSeek 八月份全面提价之后,同样的任务量如果用 V4 Pro 来跑,估计要花几十块,V4 Flash 来跑也要花 20 多块,差距一目了然。 此外,智谱也学会 Codex 那一套了,GLM-5.3-Flash 发布当天直接重置了所有用户的使用限额。对用户来说这当然是好事,白票一波新模型的机会,说不定以后有事儿没事儿就能重置一波呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BdFQSLMs7sgHgayr.jpg) 不过 GLM-5.3-Flash 的能力上限肯定是比不过 GLM-5.3 这个旗舰模型的。在 AI 绘图工具的横评里能明显看出,GLM-5.3 做出来的产品可用性和精细度还是更高一截。 GLM-5.3-Flash 的定位是 **日常好用、高性价比的牛马模型**,大部分任务它都能胜任,偶尔遇到需要极致效果的场景再切换到旗舰模型就好。 综上,我单方面不负任何责任地宣布,DeepSeek 的排名又下降了一位。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/haWmjsskFTBWd4S8.jpg) OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/9gfxRzAdhpxh80St.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区分享你自己使用 GLM-5.3-Flash 模型的体验。

3 大 DeepSeek Harness 进阶玩法,招多个大肥鱼帮我干活!

大家好,我是程序员鱼皮。 最近 DeepSeek Harness(DSH)真是太火了!之前我发过 [《首发实测 + 入门教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ) 教大家如何安装使用,还盘点过 [《16 个超火的 DSH 插件》](https://mp.weixin.qq.com/s/gbsL7qsPD7wd6iI0DGojng)。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SwqJjsCnMUCqn5EA.jpg) 不过显然大家对这些玩法并不满足,所以本期我会继续分享 DSH 的 3 大进阶玩法: - 通过斜杠命令减少重复输入 - 自定义工具给 AI 装上手脚 - 打造多 Agent 军团帮你干活 这套组合拳打下来,让你的黑色鲸鱼直接起飞! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WRnbqKTWCM1Jhxoi.jpg) ## 一、斜杠命令 先来说最容易上手、使用频率也最高的一个进阶玩法,就是斜杠命令。 如果你用过 Codex 或者 Cursor,那么你对斜杠命令应该并不陌生,比如 Codex 中的 `/compact`、`/plan` 等命令,你不需要每次都写一大段提示词,敲一下就能快速执行某一项操作。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VFMqCr8yI1d3pZ0c.jpg) DSH 也是类似的套路。当你在对话框中输入 `/` 的时候,界面就会弹出当前已经注册的命令列表。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RLWmquVaHXZJhMx6.jpg) 因为在 DSH 中,一切皆插件。这些命令同样由插件提供,因此不同版本、不同配置下,菜单里的命令可能略有区别。 我用的这个版本里一共注册了 6 个内置命令,下面挨个介绍一下。 ### /compact 压缩上下文 在对话框中输入 `/compact` 后,DSH 会把当前对话中的关键信息整理成一份更加紧凑的摘要,在接下来的对话中 AI 会带着这份摘要继续工作。 如果一个任务已经做了很久,但又不想重新开启会话,就可以用它给你的大肥鱼「减减肥」了。既能让 AI 更专注,又能省下不必要的 Token 消耗。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l89enET2Hp1zm9Ll.jpg) ### /export 导出当前对话 输入 `/export`,DSH 可以直接把当前对话框内容打包下载。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Bmlt1T56jHrDSLa1.jpg) 命令执行成功后,浏览器会自动下载一个 zip 压缩包,里面是完整的对话记录。当你想保存对话,或者把 AI 的回答整理成文档时,就不用再一个一个地从聊天窗口里复制粘贴了。 ### /goal 设置长期目标 直接在对话框中输入 `/goal`,后面跟上你的目标描述,DSH 就会把它存成一个长期目标。接下来每一轮对话,AI 都会自动围绕这个目标往下推进,就算聊到一半跑题了,它也会自己绕回来。 ``` /goal 重构项目的登录模块,并补齐测试和迁移说明 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xpItdm8r9SpMclet.jpg) `/goal` 还提供了几种控制目标的用法: ``` /goal /goal edit < 输入修改后的目标 > /goal pause /goal resume /goal clear ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/m6EmzQKDJfE55kTA.jpg) 其中,单独输入 `/goal` 可以查看当前目标。`edit` 用来修改目标,`pause` 和 `resume` 分别用来暂停和恢复目标,`clear` 用来清除当前目标。 ### /plan 开启计划模式 输入 `/plan`,后面跟上你的需求,比如: ``` /plan 帮我规划登录模块的重构方案 ``` 计划模式会引导 DSH 先了解项目、整理方案并交给你确认,等你同意了才开始动手。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ktexV0jr6Hd9BJd3.jpg) 不需要继续规划时,可以通过 `/plan off` 命令退出。 `/plan` 命令比较适合陌生项目、大范围重构或者风险较高的改动,可以减少 AI 没有理解清楚需求就直接动手修改代码的情况。 ### /permission 调整操作权限 直接输入 `/permission`,就能查看并切换当前对话的权限设置。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/k6C35HaVLJqQWqYQ.jpg) 但其实在 Web 界面,点一下输入框旁边的权限按钮就能切换,所以这个命令更适合习惯终端操作的用户,在 `/permission` 命令后面直接跟上权限预设就可以了。 ### /feedback 提交使用反馈 在 `/feedback` 后面写上反馈内容,就能把这条意见记到当前对话的日志里。 ``` /feedback < 输入你想反馈的内容 > ``` 如果你在使用 DSH 的过程中碰到了 Bug 或者哪个交互用着别扭,随手敲一行就直接给大肥鱼反馈了。不过要注意,只有开启了相应的遥测能力,反馈才会继续传给官方;遥测关闭时,内容只留在本地。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5uK6vTIulwTVxwqb.jpg) ### 自定义一个斜杠命令 如果你觉得上面这些内置命令还不够用,DSH 还支持自定义斜杠命令。 比如每次打开一个项目,我都想先看看当前在哪个分支、最近提交了什么。虽然可以反复让 AI 执行 Git 命令,但我觉得更省事的做法,是把整个流程压缩成一条 `/repo` 命令,以后一键搞定。 所以我让 DSH 给我自定义了一条斜杠命令,下面这段提示词直接丢给它就行: ``` 请帮我创建并安装一个 DSH 斜杠命令插件。 命令名是 /repo,执行后显示当前 Git 仓库所在的分支和最近 3 次提交。如果当前目录不是 Git 仓库,请给出友好提示。 完成后检查插件是否安装成功,并告诉我怎么重启和验证。 ``` 运行成功后,重启一下 `dsh web`,在任意 Git 项目对话框中输入 `/repo` 命令,来看看效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IUuoa7sLVhpLoA6L.jpg) 当前分支和最近 3 次提交直接就出来了,很方便吧~ 所以,只要你有一套流程需要反复描述,而且每次步骤都差不多,完全可以把它交给 DSH 压缩成一条斜杠命令,以后用起来就方便多了。 ## 二、给 AI 提供工具 斜杠命令解决的是重复操作的问题,接下来这个玩法,解决的是 AI 能不能动手干活的问题。 有时候你让 AI 顺手查个数据库、调个第三方接口,它只会阿巴阿巴,这是因为 AI 只是个大脑,它没有对应的工具来做这些事情。 装上工具之后就不一样了,`read` 是它的眼睛,能看文件;`bash` 是它的手,能敲命令;`write` 是它的笔,能把结果写进项目。这时候 AI 才从「嘴强王者」变成真正能动手干活的帮手。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7vuLMDAlrLlkgwLo.jpg) ### DSH 自带的工具箱 刚才提到的 `read`、`bash` 和 `write` 只是冰山一角。DSH 默认内置了一大批工具,覆盖文件读写、命令执行、任务管理、联网搜索和多 Agent 协作等方向。 除了这三个核心工具之外,还有几个高频工具。比如 `glob` 和 `grep` 负责查找文件和搜索内容,`todo_write` 让 AI 自己维护一份任务清单,`ask_user_question` 会在 AI 拿不准的时候回头问你确认,`web_search` 负责联网搜索信息,`skill` 用来调用预设的技能流程。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Y1Ogk4yKL46NfKgK.jpg) 工具数量会随着版本和插件变化,因此不用记住这些。 另外还有 `subagent`、`workflow` 那一串多 Agent 工具,后面我会专门介绍。 ### 工具、插件和 Skill 的区别 在动手之前,先搞清楚三个容易混淆的概念。很多人分不清工具、插件和 Skill 之间的关系,但它们其实是三个不同层次的东西。 **工具** 是 AI 的手脚,解决的是「能不能动手」的问题。比如 `read` 能读取文件、`bash` 能运行命令、`web_search` 能搜索网络,这些都是具体的操作能力。 **插件** 是 DSH 的扩展模块,解决的是「怎样把新能力装进系统」的问题。一个插件可以注册工具,也可以扩展命令、模型、服务甚至界面,是整个 DSH 的能力载体。 **Skill** 更像一份操作手册,解决的是「这件事应该怎么做」的问题。Skill 本身不会凭空增加系统权限,它的作用是告诉模型该按什么流程干活、什么时候该调用哪些工具。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yrrL96Skl9VFHqPz.jpg) 举个例子,`write` 是一支笔,提供写文件的能力。安装这支笔的模块就是插件,而文章的「写作教程」就是 Skill,用来教 AI 应该如何使用这支笔写出更好的文章。 ### 通过 MCP 把现成服务接进来 搞清楚工具、插件和 Skill 之后,接下来就可以继续给 AI 扩展能力了。 但问题来了,如果每需要一个新工具,都得自己写插件,那也太麻烦了。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MDMl9wuoGyTBpsT7.jpg) 好在很多工具早就有人做好了,我们只需要通过 MCP 拿来用就行。 MCP 全称 Model Context Protocol 模型上下文协议,你可以把它理解成 AI 世界的 USB 接口。就像键盘、鼠标、U 盘都可以通过 USB 接到电脑上一样,MCP 给 AI 和外部工具也定了一套统一的连接标准。只要一个服务实现了 MCP 协议,DSH 就能直接把它接进来当工具用。 现在社区里已经有大量现成的 MCP 服务了,比如我的 [鱼皮 AI 导航](https://ai.codefather.cn) 专门整理了优质的 MCP 资源大全,还支持分类搜索,找起来很方便。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/a12tKYmubiYlYHvt.jpg) 这里我拿一个最简单的例子来演示效果。我给 DSH 接入了一个文件系统 MCP,然后让它读取演示目录中的文档。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Fvmn84iGclBlKXPs.jpg) DSH 很快调用了 `mcp__files__read_text_file` 这个工具,成功读取了文件内容,还总结出了这只大肥鱼刚刚解锁的能力。 这样一来,别人已经做好的能力,我们只需要一行配置就能接进来,没必要每次都自己从头造轮子。 ### 让 AI 临时创造一个工具 现成的服务可以通过 MCP 接进来,那想造一个全新的工具怎么办? DSH 提供了一个叫做 Creator Mode 创造模式的运行模式,在这个模式下,AI 可以使用动态 Cordis 插件的能力,不需要建文件、不需要装依赖,直接在对话里现写现运行一个临时工具。 比如我让它创建一个 `word_count` 工具,接收一段文字,返回字符数、行数和单词数。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bqTY4Pb4SvTfEUOm.jpg) 插件运行成功后,`word_count` 会真正加入当前进程的工具列表。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/br5OyNIGEmqpHY5b.jpg) 接下来再给它一段文字,模型就能调用刚刚创造出来的工具了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0xrDk01Z3JMLCEyD.jpg) 工具调用卡片上真的出现了 `word_count`,并且成功返回了字符数、行数和单词数。 需要注意的是,动态工具主要适合临时实验和快速验证想法。它只在当前进程生效,停止插件或者重启 DSH 后就会消失。如果验证通过想长期使用,再让 AI 把它整理成正式的仓库插件就好。 另外提醒一句,动态插件虽然运行在沙箱环境里,但并不是安全边界。运行之前一定要先检查一下生成的代码逻辑,再确认它申请了哪些权限。 ## 三、打造 AI Agent 军团 斜杠命令解决了重复操作的问题,工具让 AI 能够完成更多工作。但还有一个问题没解决,就是任务一旦复杂起来,一个 AI 还是容易忙不过来。比如你让它同时兼顾代码审查、写测试、查安全漏洞,不仅效率低,还有可能顾了这头丢了那头。 既然一个 Agent 忙不过来,那就多叫几个,打造一支 AI 军团。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/M02gsscsf7ybXb0H.jpg) DSH 内置了几种多 Agent 工具,主 Agent 可以把复杂任务拆成相对独立的部分,再根据依赖关系选择并行或者分阶段处理,最后汇总结果。 ### 内置 Agent 工具 DSH 一共内置了 4 个 Agent 派活工具和 3 个后台管理工具,先从最容易上手的 `subagent` 开始介绍。 `subagent` 会创建一个拥有独立上下文的后台子 Agent,它不会看到父会话的任何对话历史,适合处理和主任务无关的独立工作。任务完成后,结果会回到父会话。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GzGG6w0imkHG0n0U.jpg) `subagent_fork` 跟 `subagent` 的用法差不多,区别在于 `subagent_fork` 会把父会话中已经完成的对话内容一并带给子 Agent,让它从一开始就拥有前文信息。 比如我没有重新提供完整的审查报告,只让 AI 根据刚才的结果整理一段总结。从总结内容里能看出来,它确实拿到了上一次 `subagent` 的审查报告。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/65T6HvzbYm3WiIn2.jpg) `workflow` 同样是一个内置的 Agent 工具,它可以在一段脚本中定义多个任务,让它们并行执行,等所有结果全部返回后再统一汇总。 我让 AI 同时完成变更总结、风险检查和测试清单三个任务,它等到三个 Agent 全部完成后,才交给第四个 Agent 整理成发布前的总结清单。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Lrg2FRqeyANwpJtt.jpg) 最后一个派活工具是 `ralph`,它比较特殊,每一轮都会换一个全新的子 Agent 来继续推进同一个目标,目的是防止同一个 Agent 越干越钻牛角尖。每轮之间只靠一份结构化的交接报告传递进展,不会继承上一轮的对话历史,相当于换个人从新的角度重新审视问题。 我让它执行 3 轮,检查最近的一次仓库提交,并反馈给我风险清单。结果第二轮的 Agent 修正了第一轮的优先级判断,还合并了重复内容、补上了第一轮遗漏的问题。第二轮干完以后,它直接判定目标已完成,第三轮都省了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/EUtRtFMDa3SiS4z5.jpg) 除了派活,DSH 还提供了 3 个后台管理工具,方便你随时掌握子 Agent 的状态。 `list_agents` 可以查看后台子 Agent 的运行状态,`send_message` 可以继续给某个子 Agent 补充新的要求,`interrupt_agent` 则可以中断它当前正在执行的任务。 我先启动一个子 Agent 审查代码,通过 `list_agents` 看到它正在运行。接着用 `send_message` 让它重点检查触控区域和减弱动效的实现,最后用 `interrupt_agent` 停止当前任务,Agent 的状态也从 `running` 变成了 `idle`。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5GRsB6Lg6SAQvvDB.jpg) 需要注意,`interrupt_agent` 只是中断当前这一轮任务,并不会销毁这个子 Agent。已经排队的消息也不会自动消失,之后你还可以继续用 `send_message` 找它干活。 了解了这 4 个工具之后,再来看看怎么选择。 我的建议是,独立任务用 `subagent` 就够了,需要让子 Agent 了解前文背景就用 `subagent_fork`,多个任务要并行跑就交给 `workflow`,同一个目标想让不同 Agent 反复迭代审视就用 `ralph`。 上面这些内置工具,手动派两三个 Agent 确实很方便。但任务一多,谁负责什么、哪些任务有依赖、现在执行到哪一步了,光靠脑子记就开始吃力了。 如果想真正拉起一支有队长、有分工、还能看到任务面板的 AI 军团,就得请出 Agent Teams 插件了。 ### Agent Teams 插件 Agent Teams 是一个社区开发的多 Agent 协作插件,可以让 DSH 同时拉起多个 Agent 各自干活,结果统一汇总到一个 Captain 队长节点。 > 开源仓库:https://github.com/NanmiCoder/dsh-agent-teams ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1N57vrS63clKgJkh.jpg) 插件的安装方法很简单,输入一条命令就能装好: ``` dsh plugin --profile web add @nanmicoder/dsh-agent-teams@latest ``` 当然,你也可以直接把开源地址丢给 AI,让它帮你安装: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VyqYbdGZrzImEKUd.jpg) 来试试看,我要用它检查一个前端项目,创建了 3 个成员 Agent,分别负责三个方向: ``` 前端 Agent 检查页面结构、交互逻辑、响应式和明显的前端问题 代码质量 Agent 检查项目结构、依赖管理和代码可维护性 安全 Agent 检查敏感信息泄露、依赖风险和明显的安全隐患 ``` 任务跑起来后,当前会话会自动成为 Captain,也就是整支团队的队长。 Captain 负责拆分任务、分配工作,最后统一汇总结果。下面的成员 Agent 则各自处理不同方向的问题。右边的活动面板能直接看到 3 个 Agent 同时在工作,等它们各自检查完成,结果会统一回到 Captain,由 Captain 汇总并给出最终报告。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RPSYsVPYt2vpQQOS.jpg) 更牛的是,这支 Agent 团队做完一次任务后不会马上消失,后面还能继续复用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zPy25AWBOzMLNJkt.jpg) 这一轮检查结束后,我又追问了一个 WebGL 降级的问题,并且指定只让 frontend 成员继续处理。结果活动面板里真的只有它重新进入了工作状态,另外两个成员没有被重复调度。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RlCqlEGSv9zSUP3o.jpg) 这也是 Agent Teams 和临时派几个子 Agent 最大的区别。Agent Teams 不只是派活,它还提供了成员管理、任务依赖、自动调度、持久化状态和实时活动面板,更像是一套完整的 AI 团队管理系统。 不过它也有一些限制。一个 Captain 同时只能带一个活跃团队,团队状态默认保存在当前工作区,不会自动同步到其他电脑。如果多个 DSH 进程同时操作同一个团队,也可能出现状态冲突。 如果只是临时拆分几个任务,DSH 内置的多 Agent 工具已经完全够用了。只有任务需要长期推进、成员反复协作,还要管理任务依赖和查看执行状态时,才适合上 Agent Teams。 当然,一个 Agent 能搞定的事情就没必要拉一支团队了。多用 AI 之后你自然会形成判断,什么时候该拆分 Agent、拆几个、要不要上 Agent Teams,这些都是靠实际任务跑出来的经验。 ## 最后哔哔 写到这里,DSH 的 3 大进阶玩法就全部介绍完了。 简单总结一下,斜杠命令可以把高频操作变成快捷指令,一键触发;工具可以让 AI 读取文件、运行命令和调用外部服务;多 Agent 协作可以把复杂任务拆开,让一支 AI 团队同时帮你干活。 如果你只是偶尔使用 DSH,可以先从内置命令和现成工具开始。等任务逐渐复杂了,再尝试 MCP、动态工具和多 Agent 协作就好。关键是先动起来,用得越多,你对这些能力的判断就越准。 OK 就分享到这里,到目前为止我已经给大家分享了很多期 DeepSeek Harness 的玩法了,可以在我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 中阅读,帮你玩转 DSH 和 AI 编程。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/EtUYKq1iOGOOxhJ4.jpg) 你有用过 DeepSeek Harness 么?还有哪些不错的玩法?欢迎在评论区聊聊

DeepSeek 终于能看图了!教你免费使用 + 8 大场景实测

大家好,我是程序员鱼皮。 最近 DeepSeek 的活可真是太多了,我对老 D 真是又爱又恨的。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OQ8ZcFnDs5W0OupN.jpg) 先是 7 月底放出了 V4 Flash 模型正式版,紧接着 8 月又上线 V4 Pro 正式版,还涨了一波价。与此同时还发布了自家的 AI 工具 DeepSeek Harness,一切皆插件,可玩性极强。 在很多用户吐槽 DeepSeek 不能看图之后,DeepSeek 竟然很快推出了一个船新模型 **DeepSeek-V4-Flash-Vision-Exp**,名字可真够长的。 我用最直白最不绕弯子的说法告诉你,这个模型就是在 V4 Flash 的基础上,加了一个识图能力 DLC 扩展包,且价格不变! 太好了,蓝色大肥鱼终于能看图了,不用安装任何识图插件,迈出了原生多模态能力的第一步。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rgQjdj4PO2wX1Fhj.jpg) 那这双「鱼眼」的能力到底怎么样呢? 我准备了大量的测试案例,来一起看看吧。 ## 识图能力测试 这次测试我主要用的是 DeepSeek Harness(DSH)来接入视觉模型,之前我出过一期 [《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ),还没用过的朋友建议先去看看,这里我不再重复讲了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DHcSXNECUhwfvj7S.jpg) 首先需要将 DSH 升级到最新版本,如果你是通过 `npm` 进行安装的 DSH,通过以下命令进行升级: ``` bash npm update -g @deepseek-ai/dsh ``` 升级完成后,运行 `dsh -V` 命令,确认版本号是否为最新。然后接入 DeepSeek 官方的 API,就可以切换到最新的视觉模型了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BWYTjoao6MJbjJcX.jpg) ### 1、OCR 文字识别测试 环境准备就绪,先来个开胃菜。我找了一张由 GPT Image 生成的发票,里面故意包含了一处错误,看看视觉模型能不能找出其中的猫腻。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Pw0WBzaEoO0Dm11S.jpg) 在 DSH 中,你可以直接把图片拖进输入框: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/40Kk2y7ddN0mm5Jy.jpg) 除了拖拽,DSH 也支持通过图片链接或复制粘贴的方式添加图片。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gr1FFus46aUmIl7T.jpg) 识别结果非常精准,而且我并没有告诉 AI 要找出其中的错误,它也顺便把问题给指出来了,好评。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Q74EjHfGcxtVnoWW.jpg) 看来 OCR 文字识别能力没什么问题,毕竟早在去年 DeepSeek 开源的 OCR 模型就已经很强了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QhfB60ohLGVHqxAQ.jpg) 我把同样的图片丢给国外顶尖的 Claude Opus 5 模型,它同样主动找出了发票中的问题。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/txlprfN6a5VkSSSt.jpg) ### 2、身份识别 接下来我把 DeepSeek 的亲爹梁文锋的照片发给 AI,看看它能不能认出来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/y27LCm46ILM6Jhm3.jpg) 结果模型思考了 1 分 29 秒后,信心满满地告诉我,照片中的人物是泡泡玛特的 CEO 王宁: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pgEJ6uACcNdTZRxt.jpg) 也有其他网友让 DeepSeek 视觉模型来识别梁文锋的照片,有识别出张雪峰的、有识别出张一鸣的、还有识别出是 Kimi 创始人杨植麟的,一个比一个离谱。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Rb5FGvO7oKsHho8H.jpg) 同时我也让 Opus 5 来识别这张照片,结果它出于肖像权考虑,直接拒绝识别人物。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PJoNu7R53hQqXUC3.jpg) 然后我又把自己的照片丢给 AI,看看它会把我认成谁呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XxUDmn0RQZnZUz5X.jpg) 结果试了几次,这个视觉模型在 DSH 里死活认不出我,放心了放心了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/q9DgxOIL2Xj0UQPo.jpg) 其实早在今年四月底,DeepSeek 网页版就灰度上线了「识图模式」,到六月份全量开放,并且可以免费使用。而这次 V4-Flash-Vision-Exp 模型的上线,则是将视觉能力正式开放到了 API 层面,开发者通过 DSH 等工具就能直接调用了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JAaEzRfTG5PRmuRS.jpg) 我在 DeepSeek 网页的识图模式中又试了一次,特地关闭了联网搜索,结果居然把我认成了王俊凯。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kHpHXCItxiT1GQCA.jpg) 我又让 AI 识别一次,这次我是杀马特教父,不是哥们? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5DqPppNq1lAUjC7o.jpg) 看来人物身份识别这一块的能力算是《梁了》。那就换个对象,来测试一下 AI 能不能认出最近因为抽象而爆火的「牛来」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vFZ4lTMwNPVxdLnh.jpg) 视觉模型一开始只能识别出图片中的基本元素,不过它竟然能看出来这是一张 AI 生成的图,还挺厉害的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7pvbCzaQUJXWN00F.jpg) 我再让 AI 联网搜索相关内容后,它才成功说出了「牛来」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TI6TyDfDxo1zELdj.jpg) Claude Opus 5 模型同样需要联网搜索辅助,才能认出这是「牛来」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/86wTwsKIytQZTT5N.jpg) 既然身份识别对 AI 来说有点吃力,那么我们降低一下难度,来测试一下 DeepSeek 认不认识自己。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4MZCnTGD84OPBY34.jpg) 看来大肥鱼还是认得出自己的,不过回答中的模型型号已经是远古时期的了。 ### 3、iPhone 机型识别挑战 下面我们做一个有意思的识别挑战。 如果你不太了解 iPhone 产品线,看看这些年出的 Pro Max 机型,你会发现,外观不能说极其相似,只能说几乎一模一样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3QYOhh3Yw5UBeQXK.jpg) 于是,我把 iPhone 11 Pro Max 到 16 Pro Max 这几款外观极其相似的机型,再加上比较有辨识度的 iPhone 17 Pro Max 和 iPhone Air,一共 8 款机型放到一张图里,打乱顺序,看看 DeepSeek 视觉模型能不能正确识别出来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MWhphmjpSlMzgJYl.jpg) 结果 DeepSeek 视觉模型的正确率只有 62.5%,猜对了 5 个,猜错了 3 个。错的这三款刚好是外观相似度最高的 14 Pro Max、15 Pro Max 和 16 Pro Max。有意思的是,它明明参考了每一代 iPhone 的经典壁纸来辅助判断,居然还是猜错了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lruwqRSyoYr1ygY4.jpg) 而我使用 DeepSeek 网页版的识图模式,居然全对! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fAo8QthzXleWdVmH.jpg) Claude Opus 5 这边也是不吃压力,一次全对。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HBIjxAJsNrD4Rn0Y.jpg) ### 4、找不同小游戏 小时候我很喜欢玩 QQ 游戏里的《大家来找茬》,我记得是不是还有个《美女来找茬》?反正老爱玩了。 简单来说就是找不同的游戏,来看看 DeepSeek 视觉模型能找出几处不同。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Z9rXk1CISOAFFlGJ.jpg) 花费了将近 4 分钟,DeepSeek 视觉模型把 8 处不同全部都找出来了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/S0SiLummnDIdhbG2.jpg) 跟标准答案一模一样,还是很厉害的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/oxJDvIk5oEU42nPO.jpg) Opus 5 也找出了所有不同,还标记了出来,不过耗时更长,花了 5 分 44 秒。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eWDdHN3tPh4IVyfp.jpg) ### 5、图片转 ASCII 识别和找不同都测完了,接下来让视觉模型做个有意思的小玩意吧。我让 AI 识别图片中的鲸娘,然后转成 ASCII 码形式展示。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KaQ7LENtdOmuhmZ9.jpg) DeepSeek 视觉模型生成出来的效果还算可以,再调整一下细节就完美了,比如深色模式版本下的裙子白色部分不应该是留空,而是填充,防止穿帮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/AqGmPjxPB65MRKkz.jpg) 并且 DeepSeek 视觉模型生成的版本带有「方块字符」选项,方块字符的展示效果更加完美,但也存在深色模式下穿帮的问题。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CNO8NruAbV66CjWz.jpg) 对比一下 Opus 5 生成出来的效果,深色模式也出现了留空穿帮问题,不过 Opus 5 的整体细节会更好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6mooCbtdttDepbZy.jpg) ### 6、报错截图测试 有趣的项目测完了,来看看实际开发中更实用的场景。 我让 AI 生成了一个带有 Bug 的 Vue 项目,然后把报错截图丢给视觉模型,看看能不能一次性解决。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c9Ji5xnLtWUREZuW.jpg) 看起来报错一大堆,但实际上要解决的问题很简单,就是代码漏写了 `import` 语句,加上有个文件缺失,导致项目启动失败,需要改动的地方很少。 DeepSeek 视觉模型只用了 49 秒就解决了报错问题,还顺便发现了项目里的其他 bug。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PtxoeScqiYhAetEX.jpg) Opus 5 更快,只花了 33 秒就搞定了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Hbiyu2SJoQ3CdbJX.jpg) 看来让 AI 改 Bug 这件事真的已经没什么难度了。 ### 7、前端页面复刻测试 根据截图还原网页,应该算是视觉模型最经典的应用场景之一了,也是很多人判断 AI 能不能打的试金石。 我让视觉模型识别并复刻 [面试鸭刷题神器](https://www.mianshiya.com) 的热门面试题库页面。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VSoRhFiMAg8XN7lz.jpg) DeepSeek 视觉模型花了 4 分 30 秒完成任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lmNBJyDSCDZKEwDw.jpg) 效果不算完美,而且识别错了好几处内容。居然把「开刷」识别成了「剑别」??? 旁边的「热门」也识别成了「部门」,右上角搜索框左边还莫名其妙多了个「人工审题 🔥」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jO5zIJ40Rr2TPx0v.jpg) 前面我还刚夸过 DeepSeek 的 OCR 能力,没想到这次翻车了。。 Opus 5 这边只花了 2 分钟就完成了,虽然有些细节不太一样,但好在整体没有夸张的错误。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/i6fIgoCiQZzq966N.jpg) ### 8、硬核逻辑测试 最后来一个硬核测试。我让 GPT Image 出题并生成图片,让 DeepSeek 视觉模型来解题,最后把结果发回 GPT 来判断正误。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1UAg4E0aJEa8FOYS.jpg) GPT 出的题目是一张电商运营数据报表,既考验视觉模型的 OCR 文字识别能力,又考验它对图表中数据关系和业务逻辑的理解。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5G03AYA1FOLCHzoS.jpg) 这么复杂的问题,DeepSeek 视觉模型只用了 2 分 46 秒就完成了回答。 我把 DeepSeek 的回答结果发回 GPT,让它来评价打分。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fqN5z2MfW1YTvVfX.jpg) GPT 给出的评价是「整体很强」,满分 10 分给到了 8 分。扣的两分主要是因为存在推断过头和 OCR 识别失误的问题。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9G4ettbsLS2JVecn.jpg) 而 GPT 对 Opus 5 的评价是「明显更强」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uF0qhZ3EdAaIg3rs.jpg) 我让 GPT 总结了 Opus 5 哪些方面比 DeepSeek 视觉模型更强,大家自己看看吧: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aGzbwI0nFHfBqjKT.jpg) 看来蓝色大肥鱼还需要继续练习呀。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/O8k37DBHS6uDO2JB.jpg) ## 最后哔哔 DeepSeek-V4-Flash-Vision-Exp 目前还只是一个试验性模型。根据官方公布的基准测试数据,这个模型的纯文本能力和 V4 Flash 正式版持平,而在需要视觉理解的 Agent 基准测试上,多模态能力已经接近 Opus 4.8。 整体测试下来,我觉得这款视觉模型还是比较可用的,尤其是性价比非常突出。 以上八轮测试,我都是在价格高峰时段完成的,做下来总共花了大约 6 块钱。而 Opus 5 我估算花了 8 刀左右,差了将近 10 倍! 根据官方文档,DeepSeek 的图片处理成本非常低,一张图最多折算 384 个输入 token,计费价格与 V4 Flash 一致。按高峰时段、缓存未命中的最高价来算,一张图大约只要 0.12 分,远不到 1 分钱,这价格可以说是基本白送了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XZ7N5fgSK6Lw0GJX.jpg) 不过也不得不承认,这款模型在 OCR 识别和逻辑推理上确实还有不足,希望正式版能有所改善。 不管怎么说,这毕竟是 DeepSeek 在多模态方向迈出的重要一步,相信梁哥! OK 就分享到这里,如果你对 AI 编程感兴趣,欢迎阅读我的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/J2WMHk3HHt6RpfMW.jpg) 我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 你们有使用 DeepSeek V4 Flash Vision 么?觉得效果怎么样?评论区聊聊叭

下载 APP