编程导航编程话题讨论

编程

186 参与
分享

快来分享你的内容吧~

点击登录,快来和大家讨论吧~
表情
图片
话题
打卡
综合
交流
文章
问答

DeepSeek 官方竟然偷偷做了 Harness 桌面端,我已经用上了。。

大家好,我是程序员鱼皮。 上个月 DeepSeek 开源了自家的 Harness 工具 DSH,被称为 DeepSeek 的角色专武,核心理念是「一切皆插件」。 发布后才过了一周,GitHub 就冲到了 20 万 Star,可见有多火! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/U4b07QODFNlumEHz.jpg) 不过,官方发布的时候只提供了命令行和 Web 两种使用方式,你得先装好 Node.js 环境,然后在终端里敲命令启动,用浏览器来访问。 对很多小白来说,这个上手门槛就不太友好了。 所以有社区开发者立刻开始做桌面端。Harness 才开源没几天,GitHub 上就冒出了好几个桌面客户端项目。其中最火的当属 dsh-desktop,已经拿了 2 万多个 Star,支持 Windows 和 macOS,双击安装就能用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7s2lO80RSlcWAEvk.jpg) 我以为有了社区的支持,DeepSeek 官方不打算出手做桌面端了。结果今天逛 GitHub 的时候,突然发现官方 deepseek-harness 仓库里多了一个 `apps/desktop` 目录。 点进去一看,好家伙,官方自己搞了一个基于 Electron 的桌面端应用,包名叫 `@deepseek-ai/dsh-desktop`,版本号已经到了 `0.1.5-rc.2`,连打包签名、自动更新的流程都写好了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yNyx52Dxc2tOsD5H.jpg) 最离谱的是,DeepSeek 没有发过任何公告、没有推文、没有博客,就是悄悄地把代码合进了 master 分支。 而且到目前为止,官方也没有放出安装包,想体验只能自己拉代码编译。 很符合 DeepSeek 低调的风格了,闷声干大事啊! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lnoBAH6OD35YWk3w.jpg) ## 吃波螃蟹 既然官方没放安装包,那我就自己动手编译跑一下,替大家吃一波螃蟹。哦不,是鲸鱼~ 整个过程其实不复杂,前提是你的电脑上已经装好了 Node.js(需要 22.19 以上版本)。如果没装过 Node.js,可以去 [Node 官网](https://nodejs.org) 下载最新的 LTS 稳定版本。 准备好之后,打开终端,依次执行下面 3 步。 > 当然,还有更简单的安装方式,就是你直接让 AI 帮你安装和运行。 **1、安装 pnpm 包管理器** DeepSeek Harness 用的是 pnpm 来管理依赖,先输入命令全局安装一下: ```bash npm install -g pnpm@11.7.0 ``` **2、克隆仓库并安装依赖** 把整个 Harness 仓库拉到本地,然后安装依赖。注意这个仓库很大,依赖也很多,安装过程可能会有点儿慢: ```bash git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install ``` **3、启动桌面端开发模式** 输入一行命令搞定: ```bash pnpm run dev:desktop ``` 这一步会先编译整个项目,然后自动下载 Electron,也就是一个专门用来开发跨平台桌面应用的开源框架,很多知名应用比如 VS Code、Discord 都是用它做的。 过一会儿,你就能看到一个 Electron 窗口弹出来了,界面和 Web 端几乎没什么区别。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fOpEUfxz6SlNNwqB.jpg) 模型配置和 Web 端一样,在设置里填好 API Key 就能开始用了。我试了一下,跟 AI 对话、文件操作、工具调用、插件管理这些功能都是正常的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/F4nxEYL4b7prgKRc.jpg) 不过好像有个明显的 Bug,整个应用内无法粘贴内容,DeepSeek 的 API Key 还是我一个字母一个字母手输进去的…… 期待后面改进吧,最好能有一些桌面端特有的功能。 ## 官方版会更好么? 可能有人会问,社区已经有那么多桌面端了,官方下场做这个有什么不一样? 我觉得 **最大的区别在于安全性。** 社区做的那些桌面端,不管是用 Electron 还是 Tauri,基本思路都差不多。它们会在你本地起一个 HTTP 服务,然后用桌面窗口去访问 `localhost` 上的这个服务。简单来说,就是给 Web 页面套了一个桌面壳子。 这种方式虽然简单,但有一个潜在的问题:你的电脑上开了一个端口。 如果你在公司内网或者公共 WiFi 环境下用,理论上同一网络下的其他设备是有可能访问到这个端口的。 而官方的桌面端完全没有开任何端口。它用了一套自定义的 `dsh-app://` 协议来传输数据,Electron 主进程和 DSH 后端之间通过进程管道直接通信,请求和响应走的是分帧字节流,生命周期控制则走 Node IPC。也就是说,从网络层面来看,你的 Harness 对外界是完全不可见的。 ![安全性对比](https://pic.code-nav.cn/post_picture/1601072287388278786/EdFs76k95hJ7LkhG.jpg) **另一个区别是版本绑定。** 官方把 Electron 壳、DSH 后端、Node.js 运行时绑成了一个整体,一起签名、一起发布、一起更新。社区版通常是桌面壳和 DSH 后端分开更新的,偶尔会出现版本不匹配导致的奇怪问题。而且官方自己维护更新通道,后续升级肯定会更及时、也更让人放心。 目前官方版本还处于很早期的阶段,没有预编译的安装包,必须自己从源码构建。日常使用的话,社区的 dsh-desktop 之类的项目体验确实更成熟。不过看官方的架构文档和签名流程,后续大概率会通过 `download.deepseek.com` 正式分发安装包,到时候应该就是双击安装、开箱即用了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6mbBxoLdGyJlb5Ru.jpg) 如果你还不了解 DeepSeek Harness,或者想学习更多 AI 编程工具和经验技巧,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/RHOlkKKMbFMNjIi5.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊,你更喜欢用网页版还是桌面端的 AI 工具呢?

耗时 6 年,我终于拿到 B 站 100 万粉丝奖牌!公布明年的秘密计划(

大家好,我是程序员鱼皮。 从我在 B 站发出第一个视频到现在,整整过去了 6 年。 前几天我终于收到了官方寄来的 100 万粉丝奖牌,真的很久没有那么激动了,仿佛找到了我最开始做视频时粉丝破百的喜悦感。 ![100 万粉丝奖牌](https://pic.code-nav.cn/post_picture/1601072287388278786/4ZvWYHUVxN1sEzl1.jpg) 这块牌子不是我一个人挣来的,是这 6 年里每一个点关注、投币、留评论的朋友一起堆出来的。 真的非常感谢大家! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wRny5tsuHYKLvDxJ.jpg) 以前我发视频基本都在讲教程、聊技术、测模型,从来没有在视频中回过评论。 这次我专门在动态里征集问题,评论区一下涌进来上百条,从 AI 编程工具问到创业经历,从学习路线问到感情八卦,什么都有。 我挑了 40 多条大家问得最多、也最值得聊的问题,一条条录成了视频。 > 视频指路:https://bilibili.com/video/BV1W9YH6HEtz 这篇文章就是那期视频的完整文字版,内容比较长,我按话题分成了 9 个部分,方便大家挑着看。 ## 1、我是怎么走上编程这条路的 #### 第一次做程序是什么时候? 我第一次写程序是在高中,用的是一门估计大家都没听说过的语言,叫 Q 语言,也就是按键精灵的脚本语言。 ![高中用按键精灵写的 Q 语言脚本](https://pic.code-nav.cn/post_picture/1601072287388278786/xgR5cLCVqnfFeaRM.jpg) 学它的目的说出来有点不好意思,我纯粹是为了写自动打怪脚本。 这里还有个小故事,当时我沉迷一款叫 XX 三国的游戏,想氪金但手里没钱,就琢磨出一个思路,与其在游戏里辛苦打工赚游戏币,不如先在现实世界把钱赚到手,再充值到游戏里。 于是我真的跑到线下加入了一个刷单工作室,靠这个赚了点零花钱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IAZx263oLsJp19Rs.jpg) 结果等我真赚到钱之后,反而舍不得往游戏里充了…… 不过写这些脚本的过程让我发现,原来自己挺喜欢编程这件事。那会儿我还是班里的计算机课代表,后来又参加了一个做网站的竞赛,拿了个三等奖,从此就彻底爱上编程了。 #### 鱼皮小时候是什么样的生活环境和经历? 我小时候基本就是一个人待在房间里自娱自乐,左手拿着一个玩具,跟右手的玩具对话。 再大一点,我开始用 A4 纸和手写笔记本设计游戏,自己定规则、画地图、算数值,我管这个叫「纸游」和「本游」。 现在回过头看,那大概就是我最早的产品设计经历了。 #### 鱼皮哥是二次元吗? 给大家看看我当年用过的头像和壁纸,请大家自行评价。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2yFSkLOm48j26GRe.jpg) #### 如果能再选一次,鱼皮会选什么专业? 当年填大学志愿的时候,我 10 个志愿全都填了计算机专业。 再让我选一次,肯定还是计算机,前提是这个专业未来还在。 #### 大学期间印象最深的事是什么? 大学期间让我印象最深的一件事,是在保研和就业之间做选择。 纠结了很久,我最后还是决定直接进腾讯打工,立志把童年充进游戏里的钱赚回来。 一路走到现在,我一直都是自己做选择的,不会让别人替我做决定,我爸妈也从来不干涉我,真的非常感谢他们。 ## 2、我每天在用的 AI 编程工具 聊完过去,再说说现在。这次评论区问工具和实操的人最多,我挨个说一下。 #### 鱼皮最喜欢用的编程工具是哪一个? 这题很危险啊。 以前做 Java 开发的时候,我用得最多的肯定是 IDEA。不过现在都是 AI 编程了嘛,我早就把 IDEA 卸载了。 目前用得最多的是 Cursor,其次是 Codex 和 Claude Code,然后是各种国产工具,没有任何广告成分。 #### 在哪个平台或模型上充值的 Tokens 最多?充了多少? 肯定是 Cursor。 它对接了非常多的模型,我想测试新模型的时候特别方便,不用到处开一堆订阅,也不用担心被封号。 我用 Cursor 差不多有一年半了,整个团队算下来,少说也得花掉十几二十万,单位是元。 给大家看一眼最近一个计费周期的账单,光这一个月就烧掉了三千多刀。 ![Cursor 最近一个计费周期的账单](https://pic.code-nav.cn/post_picture/1601072287388278786/ZKKvrHrEmAiXARpx.jpg) #### 利用 AI 做长期项目时,如何确保随着内容增多,AI 的代码不会越来越乱? 这个问题挺正经的,但回答起来很简单,你把 AI 类比成人类就明白了。 人脑的容量是有限的,所以我们会把重要的事情记下来,写进备忘录或者项目文档里。 让 AI 做项目也是一样的道理,你要让它把项目的关键信息整理成文档沉淀下来,之后每次干活先从文档里获取上下文,它就不容易跑偏。 除了写文档,还有一些别的技巧。比如把代码按功能拆分成多个模块,每次明确告诉 AI 这轮只改哪一个模块,它的改动范围就会收得很紧,不至于牵一发动全身。 #### 如何自己开发 Agent? 打开一个 AI 编程工具,使用 `/grill-me` 拷问技能,然后把你的想法输进去,让 AI 一步步引导你把需求问清楚,剩下的交给它就搞定了。 这个技能来自 Matt 开源的技能库,它会像面试官一样反复追问你的需求细节,比你自己想提示词高效得多。 > 开源指路:https://github.com/mattpocock/skills ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WRNeH1aaXdZOceyW.jpg) ## 3、Vibe Coding 时代,怎么提升编程能力 工具聊完了,接着就是这次评论区最焦虑的一批问题。 大家的担心其实高度一致,就是 AI 把活儿都干了,自己会不会废掉。 #### 现在每天上班开发就是 Vibe Coding,没时间再手动看生成的代码了,以后该如何提高自己的编程能力? 完全不用担心! Vibe Coding 已经是整个行业的趋势,你能指挥 AI 把工作完成,这本身就是一种能力。 真想补基础也不难,在工作之余主动看一点传统的技术教程或者技术科普,面试之前刷一刷面试题就够了。不用因为自己不再逐行手写代码,就觉得能力在退化。 #### 我是计算机专业本科生,应不应该平时完全用 AI 写代码?让 AI 写代码总有种作弊的感觉 你不用,你可能就落后了。 AI 编程是趋势,不是捷径。 腾讯在《2025 腾讯研发大数据报告》里披露过,公司超过 90% 的工程师在用 AI 编程助手 CodeBuddy,全公司 50% 的新增代码由 AI 辅助生成,相当于程序员每写两行代码就有一行是 AI 帮着完成的。 ![2025 腾讯研发大数据报告](https://pic.code-nav.cn/post_picture/1601072287388278786/Z7Z9ZA9PF2i9DMma.jpg) 连大公司都这么干了,先进的工具和技术本来就是要学的,用 AI 写代码怎么能算作弊呢? #### 以后的开发是不是偏向于维护和提问题? 我觉得会更偏向于 **描述需求** 和 **验收成果** 这两件事。 往前一步,你要能把问题跟 AI 说清楚,说不清楚它就交付不出你想要的东西。 往后一步,你要能判断 AI 交出来的结果好不好,好在哪、差在哪、该怎么改。 这两头你都握住了,中间的代码具体由谁敲出来,其实没那么重要。 #### 如何在 Vibe Coding 中学习? 多看 AI 的输出,并且直接利用 AI 来学习。 具体做法特别简单,记住这一句提示词就够了: ```markdown 请用傻子都能懂的方式回答我 ``` 别小看这句话。Claude 的母公司 Anthropic 最近开源了一个技能叫 ELI5,全称是 Explain Like I'm 5,意思是用讲给 5 岁小孩听的方式来解释任何话题。 > 开源指路:https://github.com/anthropics/claude-plugins-community 整个技能的核心就这一句话,跟我这个提示词异曲同工。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rcxzucrHBjkFyKDV.jpg) 如果你想要更系统一点的效果,还可以用国外大神 Matt 开源的 `/teach` 技能。它会把 AI 变成你的私人教师,先摸清你为什么想学这个东西,再按你的节奏一点点搞出教程讲解。 > 开源指路:https://github.com/mattpocock/skills ![Matt 开源的 teach 技能](https://pic.code-nav.cn/post_picture/1601072287388278786/RJR8eFwW2MWkWeu3.jpg) #### 小白如何在 Vibe Coding 的过程中不断学习和进步,增强对 AI 的掌控感? 不用想那么多,多用就是了。 先用 AI 把东西做出来,在练习的过程中慢慢找感觉。提示词不会写完全没关系,只要能说清楚自己的需求和目标就行。用着用着,你自然就知道 AI 什么时候听话、什么时候不听话了。 **掌控感是练出来的,不是学出来的。** 等东西做出来之后,再倒回去了解背后用到的技术。这时候你的学习是带着目标的,效率反而比一开始就死磕基础更高。 #### 研究生应该怎么利用好 AI 工具帮助自己? 很抱歉我没有读过研,不太清楚你们具体的科研场景。 但这个问题我可以用最直接、最不绕弯子的方式回答你:**你把自己的专业和这个问题原封不动发给 AI 就行。** 记得带上前面那句提示词「请用傻子都能懂的方式回答我」,AI 现在真的是最好的私教 #### 自学编程或者教别人学编程的过程中,遇到最难的问题是什么? 好问题,我记得有张图特别能说明这件事。 ![很多人就是不看文档](https://pic.code-nav.cn/post_picture/1601072287388278786/cWuv5tlRNcZ5JLD8.jpg) 很多问题明明教程和文档里都写得清清楚楚,但就是因为没有认真看文档,最后踩了坑。这类问题最难的地方不在技术本身,而在于人不愿意去读。 好在现在有 AI 了,你可以把整份文档丢给它,让它替你读完再回答你的问题,这个坑基本算是被填平了。 ## 4、给学生和求职者的建议 上面那批问题大多来自已经工作的朋友,评论区里还有不少在校生,他们关心的事情又不太一样。 #### 给非 92 的计算机大一学生有什么建议? 无论是不是 92,学习建议其实都是一样的,关键在于做好规划、多动手实践,学校的层次决定不了你四年后的样子。 我很早之前录过一期《我的大学四年规划》,把每一年该干什么讲得比较细,建议新同学去看一下。 > 视频指路:https://codefather.cn/live/1788387889965436929 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9NxnrYHb0oR8XrBj.jpg) 相信我,四年后你会来感谢我的。 #### 对于学人工智能的学生有什么建议吗? 也是一样的,多做东西、多实践,别只跟着学校学。课本里的内容很可能已经和企业里的实际应用脱轨了,你等着老师讲完再动手就太晚了。 最关键的一点是多看鱼皮的视频(哈哈哈哈哈哈哈哈。 #### 如何看待今年秋招大量缩减岗位?还有两年毕业,如果做不了计算机开发,如何提前规划别的职业? 首先我不太清楚你是在哪里看到这个信息的。就我观察到的情况,有不少传统开发岗位其实是转成了 AI 全栈开发,招聘需求并没有消失。 拿字节今年的校招来说,技术和产品岗位的需求占比超过 70%,算法类岗位需求比去年还有增加,而且首次上新了 AI 全栈工程师、AI Agent 开发这些岗位。 ![字节今年的校招信息速览](https://pic.code-nav.cn/post_picture/1601072287388278786/tFknkeUk0bsCDvuB.jpg) AI 发展起来了,时代变了,肯定是要学新东西的,比如 AI 编程,学就好了,不用慌。 岗位不是消失了,只是换了一种形式和名字,而适应变化本身就是程序员最核心的能力。 #### 在 AI 高速发展的今天,开发的学习路线是否发生了变化?如果重回大一,鱼皮你会干什么? 学习路线肯定是有变化的。放在今天,我建议先学 AI 编程,把东西做出来拿到正反馈,再倒回去补传统技术基础,这个顺序和几年前是完全反过来的。 具体的路线比较长,我在 [编程导航](https://www.codefather.cn/) 里完整分享过,包括每个阶段学什么、做什么项目、怎么写进简历。 ![编程导航上的编程学习路线](https://pic.code-nav.cn/post_picture/1601072287388278786/uhT0B5OzdwOPyapE.jpg) 至于如果重回大一,我肯定是做自媒体起号,然后尽快在校园里创业。 大学时候大家还很单纯、有冲劲,试错成本也低,等出来打工几年之后想重燃这份热情,真的很难。 ## 5、编程这条路怎么才能走得久 聊完短期的规划,再聊聊长期的坚持。 #### 鱼皮你是如何坚持下来编程的?编程的乐趣在哪?来点小故事。 我觉得编程本身是没什么乐趣的,有乐趣的是你用编程创造东西。 比如我之前写过一个抢课工具,帮自己抢到了一门特别难抢的课,还做过整人软件,甚至做过表白网站。这些东西技术上都不复杂,但每一个都实实在在解决了我当时的问题,那种爽感是刷题刷不出来的。 ![鱼皮大一写的整人软件](https://pic.code-nav.cn/post_picture/1601072287388278786/0LBKbs2s3PAmOvUR.jpg) 你也可以试着用编程解决自己生活里的一个小麻烦,从这里开始就够了。 #### 鱼皮大学用了很多时间在编程,想问问怎么持之以恒的? 我很久之前就分享过自己大学四年的学习经历,想让自己坚持下来,核心是要有源源不断的输出和成就感。 比如做出一个作品就分享给别人看、组队去参加竞赛、找一份实习赚点钱给自己买设备。 这些事情会不断给你正反馈,有了正反馈,学编程就不再是一个难搞的任务,而变成了你自己想干的事。 #### 普通人想在编程这条路走远,最核心的底层能力是什么? 好家伙,这么深奥的问题?! 我觉得最重要的能力就是能坚持学习新东西、能适应变化,有这一条就够了。 现在 AI 发展成这样,写程序本身已经没有什么门槛了,但你不用、不学,差距就会被慢慢拉开。 #### 工作了两年,同样对比鱼皮工作两年 996,回家只想躺着,对于工作后的额外任务是如何协调的? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ncqjvt26qH9GjNYJ.jpg) 提问的同学说大二就开始看我了,那真的是从小看我到大。 其实我的很多时间都是挤出来的。白天尽快把工作完成,想办法提高效率,下班之后才有精力做一些自己感兴趣的事。 **这个顺序不能反,先把主业的事情干利索了,额外的时间才是真正属于你的。** 如果你回家只想躺着,说明你还没有找到让自己动起来的动力。不妨试试 Vibe Coding,成本很低,说不定就让你感受到创作的乐趣了。 ![鱼皮用 AI 开发游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/jEa5G9D5BAqaxuzA.jpg) #### 平时工作用的哪些顺手的设备,或者说好的工作习惯? 这期没有广告,所以设备我就不推荐了。 工作习惯里我觉得最重要的一条,是把大的工作分解成你觉得很轻松就能完成的小任务。 任务一旦小到你不抗拒,就能利用碎片时间往前推一点,积少成多,最后你会发现那件看起来很大的事已经做完了。 #### 有没有什么好的学习建议能提高技术、找到更好的工作? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/o6vmhj3kJXtHjj3A.jpg) 我觉得 **想得越多,做得越少**,迷茫可能是因为想太多导致的。 其实要做的事情很简单。每天看 3 篇技术文章或者 AI 编程教程保持输入,同时用 AI 编程上线一个属于你自己的王牌项目并且持续打磨它,面试之前再刷一刷 [面试鸭](https://www.mianshiya.com/),升职加薪基本就是时间问题了。 ![面试鸭的热门面试题库](https://pic.code-nav.cn/post_picture/1601072287388278786/yTALzpzQ9ogkHoHf.jpg) ## 6、聊聊创业、公司和副业 这部分是大家问得最多的私事,我绝对坦诚。 #### 鱼皮为什么想要从大厂出来开始自己做? 我 23 年从腾讯离职的那期视频里有提到过,主要原因是在公司已经没有什么成长了,再加上当时 AI 的势头很猛,我就想自己折腾一下试试看。 当然这个决定也离不开关注我的朋友们给我的底气,如果当时没人看我的内容,我大概是不敢走的。 #### 现在 AI 发展那么快,有没有后悔离开鹅厂? 完全不后悔,而且我觉得自己离开的时机恰到好处。 这是我考虑了很久才做的决定,离开的时候,办公室的场地都已经租了好几个月了。 等到真正做出决定的那一刻,什么都不要想,干就完了! 你确实不知道哪个选择是最好的,但你可以努力把自己做的这个决定变成最好的选择。 #### 好奇鱼皮的公司现在经营的怎么样? 确实很久没有聊自己公司的情况了,都怪 AI 时代节奏太快,新模型新教程根本出不完。 坦诚地说,现在公司人数少了,场地大了,也更灵活了。后面我再专门给大家介绍一下新场地吧。 #### 入职贵公司需要准备什么? 这个问题问得很好,正好我们团队最近在招人,而且不卡学历! > 指路:https://yuyuanweb.com/join ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4fWzikn0w7pnzbWt.jpg) 我自己是个很注重细节的人,所以希望候选人做事细心、有责任感。 另外对于创业公司来说,需要候选人有一颗热忱之心,保持积极向上。 #### 如果你没有当程序员,可能会在什么其他行业工作?如果现在转行,什么方向比较适合? 我大概会去开线下店,比如开个桌游店,然后设计自己的桌游。 这不是随口说的,我确实这么干过。25 年我开了一家剧本杀桌游店,后来因为一些妖魔鬼怪倒闭了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zbW8XcBStzC0hLrx.jpg) 虽然结果不太好,但我还是觉得要做自己最感兴趣的方向,起码这个过程中你是快乐的。 #### 现在如果要互联网创业,该做什么方向呢? 我的排序是做自媒体 > 卖课,卖课 > 用 Vibe Coding 做产品,真心话。 前面两件事的确定性更高,你付出的时间基本能换回对应的回报。 做产品的不确定性要大得多,而且很多人低估了推广的难度,东西做出来其实只是个开始。 当然,自媒体和卖课也都不容易,还是需要你有一个明确的方向、并且有东西持续输出的,如果你能把这些精力投入到主业上,结果肯定也不会差。 #### AI 时代程序员如何搞副业呢? 好问题,我自己就是副业变主业的。 AI 时代最大的变化是创造成本被打下来了,有了 AI,一个人就能搞定过去一个团队的活儿,所以机会真的很多,关键是你愿不愿意迈出第一步。 具体怎么迈呢,可以先跟着我免费开源的 AI 编程教程,用 Vibe Coding 做出你的第一个作品,然后发到社交平台上分享出来。 有了第一个作品和第一批反馈,剩下的路是越走越宽的。 > 教程指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/nAXE0Qr92izBUnsE.jpg) #### 讲讲普通人怎么开始做自媒体的?有什么赛道适合普通人呢? 我的建议是 **保持真实接地气**,从你自己的职业和经验出发,分享你最擅长的那件事。别一上来就想做自己不熟的领域,那样撑不了几期。 AI 视频现在虽然很火,但成本也高,而且非常容易同质化,我不太建议普通人从这里切入。 正好我最近在考虑线下带一些朋友做自媒体。 > 啊我随便说的,不要找我咨询。 ## 7、课程、教程和出书的计划 #### 鱼皮有没有开设一门编程课的想法,比如 Agent 开发? 不会还有人不知道吧,我已经做了整整 4 年的课程了! 编程导航、面试鸭、AI 导航都是我的网站。 ![编程导航学习路线大全](https://pic.code-nav.cn/post_picture/1601072287388278786/mfQVdQNGqL4D0fXd.jpg) 毕竟我擅长做课,和卖课。 #### 会做针对零基础的 Java 视频教程吗? 应该有很多同学都是通过 Java 学习路线那期视频认识我的吧。 你别说,我 25 年的时候真的花了整整一个月去写一套 Java 零基础教程。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/17gCefR0p3avrtoQ.jpg) 但后来 AI 发展得太快,我的创作方向也转到了 AI 编程,我觉得现在完全可以直接用 AI 帮你学 Java,没有必要再专门搞一套视频教程了,所以那套教程到现在都没有发出来。 #### AI 兴起了,还会出基础技术视频教程吗? 坦白说,传统技术的视频教程估计是不会再出了。 现在的 AI 已经可以直接生成交互式的教学网站,你想学什么就让它现场给你搭一个,比看录播视频的效率高很多。 大家喜欢的小阿巴系列,估计也只能偶尔限时返场了。 #### 买过鱼皮的书,有没有新书规划? 我确实在 24 年出版过自己的《编程导航,全栈项目实战课》,当时还冲上了某东图书销量总榜第一,签名快把我的手签断了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DP0SUCBuMpY46Lyt.jpg) 但现在 AI 发展太快,书籍太容易过时了,一本书从写完到上架就要好几个月,所以我目前没有出书计划。 ## 8、来点轻松的 正经内容差不多聊完了,剩下这几个问题纯属整活,介意的朋友可以直接跳到下一部分。 #### 鱼皮你谈了没?别告诉我你和小鲸鱼谈的 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HLvCWXdVmXiBPHGN.jpg) 怎么会有人和小鲸鱼谈恋爱啊,我肯定更喜欢大肥鱼! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ooA8R8DEsAphleSr.jpg) #### 讲讲鱼哥的感情史。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/plZYLUuJ0xYlt02d.jpg) 放下过去,珍惜当下,一切都是最好的安排。 #### 读到我说大喊一句「鱼皮是狗」 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MneYY0HRB2XeiwGT.jpg) 鱼皮是狗! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2bPVVMZo7VtnYf5w.jpg) 你小子,AI 检测器是吧。 #### 可以拍拍鱼皮哥一天工作的流程 Vlog 吗? 行,那就给大家看看我一天的真实状态。 早上到公司的时候还是充满希望的,加油加油加油。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XZYAPj9aGJE064S5.jpg) 然后坐下工作…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iFTewfn7B6sXUbPX.jpg) 唉,又是疲惫的一天呐,就是这么枯燥。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/57Eq3rnuGUEDJdkj.jpg) ## 9、关于人生和未来 #### 你觉得人生的意义是什么? 这个问题我想了很久。 ![思考人生的意义](https://pic.code-nav.cn/post_picture/1601072287388278786/4z9yiagESCM2HdUO.jpg) 开心就好,想那么多干什么! #### 以后你打算做什么?之后有什么发展方向? 近两年肯定还是关注和分享 AI 编程,毕竟新东西太多了,我自己都学不完,更分享不完。 不过我真的很希望自己的精力还能跟得上…… 毕竟明年很有可能…… 要生小孩啦。 ## 最后 写到这里,40 多个问题差不多都回答完了。 最后哔哔几句,一个人闷头做内容做 6 年是件挺难坚持的事,能撑到今天靠的就是评论区里那些声音,有催更的、纠错的、说自己靠着某个项目找到工作的,也有一直喊我是狗的。 总之,非常感谢大家这么多年的支持,我会继续输出内容的,干就完了!

刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归

大家好,我是程序员鱼皮。 刚刚,DeepSeek 正式发布了 V4.1 Flash 模型。 它是一个 552B 参数的 MoE 模型,采用了全新的模型结构,**原生支持多模态视觉理解**,而且直接开源了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Vy6OOnVwIPHXViHA.jpg) 这次更新力度很大。DeepSeek 网页版原来的快速、专家、识图 3 个模式直接合并成了一个入口,用户不需要再手动选模式了,AI 会根据任务复杂度自动调度,检测到图片就自动激活视觉能力。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Yix8EVoElmejw58F.jpg) 炸裂的是,DeepSeek 官方称:**V4.1 Flash 在性能、费用、速度、总用时等各项指标上已经全面超越 V4 Pro!** 好家伙,自家的快速模型吊打旗舰模型? 要知道,DeepSeek 的 Flash 模型比 Pro 模型便宜好几倍!效果反而更好? 那之后谁还会用 Pro 模型啊? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8d0GCnl8BcA5eNhs.jpg) 果不其然,官方已经下线了旧的 V4 Flash 和 V4 Flash Vision Exp 模型,而且 9 月 14 日 V4 Pro 也要正式下线,到时候所有发给 V4 Pro 的请求全部自动路由到 V4.1 Flash。 相当于 Flash 彻底把 Pro 干掉了…… 那 Flash 模型真的比 Pro 强么?差距有多少?我打算自己测一测。 于是我准备了 **2 个不同类型的项目**,同时拉上很火的 GLM-5.3-Flash 做横向对比。 这次测试我特意从日常使用场景出发,DeepSeek 的两个模型放在 DeepSeek Harness 里跑,GLM-5.3-Flash 放在智谱自家的 ZCode 里跑。你平时用哪个模型就搭配对应的自家工具,往往能获得更好的效果。 ## 怎么用 V4.1 Flash 如果你用的是 DeepSeek Harness,更新一下版本,V4.1 Flash 就可以直接在模型列表里选了,不需要额外配置。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ktd4vHT58ev1qy3f.jpg) 如果你是通过 API 调用 V4.1 Flash,现在模型名简化成了 `deepseek-flash`,不用修改 base_url。之前的 `deepseek-v4-flash` 和 `deepseek-v4-flash-vision-exp` 也会自动路由到新模型,不用改代码。 ## 项目实战测评 ### 3D 程序化城市生成器 第一个案例对标的是 OpenAI 官方展示馆里那个用 GPT-5.5 做的程序化城市生成器,我之前测 GPT-6 Astra 的时候用过同一段提示词,效果非常惊艳。这次拿同样的提示词让 3 个 Flash 级模型来做,正好能看出差距。 提示词很简单,我让 AI 做一个程序化 3D 城市生成器的网页应用,至少包含重庆、上海、西安、深圳、江南五种城市风格,切换风格之后建筑形态、色调和地形要有明显差异。编辑器布局和参数维度怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。 ![Case 1 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/wZUjSXvEto0cJErQ.jpg) 来看看三个模型各自做出了什么效果。 #### DeepSeek V4.1 Flash V4.1 Flash 拿到任务后,先用 Firecrawl 联网搜索了官方 Showcase 的产品设计,分析完参数维度之后才开始写代码。AI 选的技术栈是 Vite + TypeScript + Three.js,没有多余的框架依赖。 整个过程跑了 250 步,LLM 推理只花了 18 分钟,输出速度达到了每秒 287 tokens。不过工具调用花了 83 分钟,总用时被拉得比较长。 ![DeepSeek Harness 执行记录](https://pic.code-nav.cn/post_picture/1601072287388278786/O18493gENiQHDTOj.jpg) 看看成品效果。第一眼看上去感觉还不错,错综复杂的重庆山城给做出来了,右侧有完整的城市生成器控制面板,城市风格、布局参数、天际线、地块配比全都能自由调整。 ![V4.1 Flash · 重庆 8D 魔幻山城](https://pic.code-nav.cn/post_picture/1601072287388278786/hrAuqT1YPosGexty.jpg) 通过拖拽和滚轮可以自由移动和放大视角,能看到更多细节,比如道路上行驶的车流。 右侧面板里还能自由调整建筑密度、街区尺度、街道形态、商业和居住占比等等。 ![V4.1 Flash · 近景细节](https://pic.code-nav.cn/post_picture/1601072287388278786/b9UFR4JJJfrWpx4p.jpg) 切换到上海,你能认出来中间那几栋最高的建筑么? ![V4.1 Flash · 上海陆家嘴](https://pic.code-nav.cn/post_picture/1601072287388278786/ltxLMYVIKQtV8BIa.jpg) 整体功能虽然完成了,但是精细度还差点儿意思。比如看看西安城市的效果,很难说一眼就能认出来是古都的感觉。 ![V4.1 Flash · 西安](https://pic.code-nav.cn/post_picture/1601072287388278786/thkTkzCzyPQ5xrKZ.jpg) #### DeepSeek V4 Pro V4 Pro 的最大问题是没有视觉能力。AI 写完代码之后没办法自己截图看一眼效果对不对,只能通过调用子 Agent 让其他有视觉能力的模型帮忙验证。 ![V4 Pro 调用子 Agent 做视觉验证](https://pic.code-nav.cn/post_picture/1601072287388278786/V1X7KcUDSJISnQQ6.jpg) 先看看重庆的效果,建模的精细度明显不如 V4.1 Flash,尤其是这个橙色的大桥,有点出戏。 ![V4 Pro · 重庆](https://pic.code-nav.cn/post_picture/1601072287388278786/vrZNKuvaenDdNe6t.jpg) 再切换到上海。 额,这个东方明珠我怎么看怎么像糖葫芦,而且怎么还建在水上了呢? ![V4 Pro · 上海](https://pic.code-nav.cn/post_picture/1601072287388278786/aPJtvZsU1e2DVQkv.jpg) 直接就是一个大失败啊! 还好我替你们测了,不要浪费钱去做这玩意啊! #### GLM-5.3-Flash 再看看 GLM-5.3-Flash 生成的效果,第一眼看上去还不错,建筑上的灯光效果做了出来,这个夕阳的氛围也挺有意境。 ![GLM-5.3-Flash · 重庆](https://pic.code-nav.cn/post_picture/1601072287388278786/ktIoblOdYUWZCtnR.jpg) 不过放大看细节就露馅了,有明显的穿模问题,画面中还有很多飞来飞去的小方块,不知道是什么东西。 ![GLM-5.3-Flash · 穿模细节](https://pic.code-nav.cn/post_picture/1601072287388278786/4ey2t0EIOAADDF5r.jpg) 看看上海的东方明珠,我觉得比前两个略好一点,但也有明显的 Bug,塔尖凭空悬浮了,而且好多大楼直接建到了水上…… ![GLM-5.3-Flash · 上海](https://pic.code-nav.cn/post_picture/1601072287388278786/VdinGmvaItYH8QoB.jpg) 看到这里,我个人认为 V4.1 Flash 的完成度和细节丰富度最高,GLM-5.3-Flash 的氛围感做得不错但细节 Bug 更多,可以说二者半斤八两吧。至于 V4 Pro 的效果,确实是三者之间最拉的。 #### GPT-6 Astra 之前我用同一段提示词测 GPT-6 Astra 的时候,AI 只用了 18 分钟就交卷了,而且每种城市的精细度都非常高。 ![GPT-6 Astra · 重庆](https://pic.code-nav.cn/post_picture/1601072287388278786/zHlIVcZ24sbpkKL5.jpg) 整个的建模正确性也更高,可以说 GPT-6 Astra 完爆这三个 Flash 级模型,差距一眼就能看出来。 ![GPT-6 Astra · 上海](https://pic.code-nav.cn/post_picture/1601072287388278786/cHDkAEq5DBAnIDvp.jpg) 不过这也是理所应当的,毕竟 Astra 是全球顶级模型,价格贵了不知道多少倍,跟 Flash 模型比效果就有点欺负人了…… ### AI 智能绘图工具 第二个项目考的是全栈工程能力。我让 AI 开发一个 AI 智能绘图工具,用户通过自然语言描述,AI 自动生成可编辑的流程图、架构图和思维导图,前端在 draw.io 编辑器的基础上二次开发,加上 AI 对话面板,支持连续对话修改图表。 ![Case 2 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/TkpunnV57FGV8JmI.jpg) #### DeepSeek V4.1 Flash V4.1 Flash 先联网抓了 draw.io 官方的嵌入协议文档和 GitHub 仓库,研究了一遍源码之后找到了零改动嵌入的方案,然后才开始写代码。 打开成品页面,整个界面布局很有科技感,AI 把 draw.io 深度融合到了项目里,连产品名都自己取了一个叫 DrawMind。左侧是 AI 对话面板,右侧是完整的 draw.io 画布编辑器。 ![V4.1 Flash · DrawMind 首页](https://pic.code-nav.cn/post_picture/1601072287388278786/T2evMdV76MlWKTz5.jpg) 我让 AI 画一个微服务电商系统的架构图,能实时看到 AI 的思考过程,而且输出速度非常快,20 秒左右就完成了。 ![V4.1 Flash · 生成中](https://pic.code-nav.cn/post_picture/1601072287388278786/7xE5l4HO84kXk6ql.jpg) 画出来的架构图效果很好,分层清晰、节点整齐、没有错位,这点比之前用 V4 Pro 来画的要好不少。 ![V4.1 Flash · 架构图成品](https://pic.code-nav.cn/post_picture/1601072287388278786/KVa5p9itvjNxIB7m.jpg) 更关键的是连续对话修改的能力。我说「把业务服务层的背景改为红色」,AI 精准定位到了对应的元素并修改样式,右侧画布实时更新,改得又快又准。 ![V4.1 Flash · 连续对话修改](https://pic.code-nav.cn/post_picture/1601072287388278786/vAWkxOF5OJJkNK2e.jpg) 我又试了一些其他类型的图,流程图、思维导图都能正常生成,没有出现生成失败的情况,比较稳定。 ![V4.1 Flash · 流程图](https://pic.code-nav.cn/post_picture/1601072287388278786/jIvuUBCmu0c24TbP.jpg) #### GLM-5.3-Flash 再来看看 GLM-5.3-Flash 在 ZCode 里做出来的版本,花了大约 46 分钟。 界面同样很有科技感,而且也成功把 draw.io 深度融合了进去: ![GLM-5.3-Flash · NexusDraw 首页](https://pic.code-nav.cn/post_picture/1601072287388278786/Sw1I0gESu8RVs84D.jpg) 生成架构图的效果也不错,分层清晰,但是有时候会有些连线错位的问题: ![GLM-5.3-Flash · 架构图](https://pic.code-nav.cn/post_picture/1601072287388278786/U4RWzOVCZ0CFajeT.jpg) 同样支持连续对话修改: ![GLM-5.3-Flash · 连续修改](https://pic.code-nav.cn/post_picture/1601072287388278786/iHnEnLyoUR7wPE9G.jpg) 不过多试几遍就会发现,偶尔会出现生成的 XML 跟 draw.io 不兼容的情况,画布上弹出解析报错,稳定性差了一些。 ![GLM-5.3-Flash · 偶尔报错](https://pic.code-nav.cn/post_picture/1601072287388278786/pfRqKo7cec0pi3sf.jpg) #### DeepSeek V4 Pro V4 Pro 做出来的版本就差了不少。 最明显的问题是 draw.io 被很生硬地嵌入到了页面里,左下角的文字还出现了溢出,右侧画布默认显示的是一大坨空白和加载图标。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/R4BtdtjxoHfOKUdt.jpg) AI 生成图表的功能是可以正常使用的,但是没有 AI 思考过程实时输出的能力,生成速度和准确度也都一般。 ![V4 Pro · 生成结果](https://pic.code-nav.cn/post_picture/1601072287388278786/jQmGCiUC5kLErjZL.jpg) 简单总结一下,显然 V4.1 Flash 的整体完成度最高,draw.io 成功集成、生成速度快、连续对话修改精准,而且只花了 21 分钟。 GLM-5.3-Flash 的前端效果跟 V4.1 Flash 不相上下,但耗时翻倍到 46 分钟,偶尔还会出现 XML 兼容性问题。 V4 Pro 成功垫底,界面生硬、功能粗糙、没有思考过程输出。 ## 测试总结 两个项目跑完,我觉得 V4.1 Flash 确实做到了全面超越 V4 Pro。 首先,原生多模态太方便了! V4 Pro 写完前端之后看不到自己画面长什么样,只能瞎猜或者调用子 Agent 帮忙看一眼,这个体验非常割裂。V4.1 Flash 直接自己截图验证,该修就修,生成的质量明显高了一档。 然后是 **速度**。我额外做了一个对比测试,让两个 DeepSeek 模型用相同的提示词各写一篇一万字的小说。 ![输出速度对比](https://pic.code-nav.cn/post_picture/1601072287388278786/8lMZntf9fmRK07vc.jpg) 结果 V4.1 Flash 的输出速度达到了 160 TOK/s,V4 Pro 只有 50 TOK/s,差了整整 3 倍! 首 token 延迟也差很多,V4.1 Flash 只要 0.3 秒,V4 Pro 要 1.1 秒。日常用的感受就是 V4.1 Flash 秒回,V4 Pro 要稍微等一下。写代码的时候这个差距体感更明显,287 TOK/s 的速度下屏幕上的代码几乎是瞬间刷出来的。 再看看 **花了多少钱**。 V4 Pro 光是做一个 3D 城市生成器就花了大约 16 元,而 V4.1 Flash 开发完两个项目才花了不到 10 元,平均每个项目 5 元左右。 ![消费面板](https://pic.code-nav.cn/post_picture/1601072287388278786/MXrTsi4ay9ce2SSD.jpg) 另外 DeepSeek 今天同步调整了 Flash 系列的定价,空闲时段缓存命中的输入价格降到了 0.02 元 / 百万 token,日常开销低了很多。 看来 DeepSeek 可以重新作为日常 AI 编程和办公的推荐模型了。 我单方面不负责任地宣布:**梁神回归!** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/X1vytdFGuCAqtZgM.jpg) 最后再分享个小故事,关于 V4 Pro 下线这件事,DeepSeek 的本意是给用户免费升级模型,V4 Pro 的请求自动路由到 V4.1 Flash,还按更便宜的 Flash 价格计费。 听着是好事对吧? 结果反而遭到了一堆开发者的吐槽。很多人已经把 V4 Pro 接进了自己的线上产品,提示词、参数、业务逻辑全部是按 V4 Pro 的行为特征调过的,突然换一个模型底座,输出风格和能力边界都会变,线上产品可能直接出问题。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lUpFZLGRjabi2j83.jpg) 还有人担心 V4.1 Flash 虽然跑分超过了 V4 Pro,但在自己的特定场景下不一定更好,「全面超越」和「我的场景也超越」是两回事。 这种情况在 AI 行业已经不是第一次了,几乎每一家厂商做模型升级的时候都遇到过类似的争议…… 你怎么看?

GPT Images 2.5 首发实测,手绘成图、指哪改哪、也太逼真了!

大家好,我是程序员鱼皮。 5 个月前我写过一篇 GPT Image 2 的测评,当时就已经被它的真实感震撼到了,连微信聊天记录都生成的无比真实。 刚刚 OpenAI 又放了个大招,ChatGPT Images 2.5 正式发布! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hrTWgXOk5GQtqR87.jpg) 这次升级不仅提高了生图的质量、提升了多达 50% 的生成速度、提升了多轮编辑的一致性,更关键的是 **改变了整个 AI 生图的创作方式**。 新增了 Sketch 草图参考功能,可以直接在 ChatGPT 里画草稿让 AI 帮你生成完整图片。还支持了在图片上放 Comment 标注来精准修改局部细节。此外,还新增了 Templates 创作模板、Prompt 共享、透明背景生成能力。 ![官方提供的成品图](https://pic.code-nav.cn/post_picture/1601072287388278786/apmfAFTgqBv7x7Ul.jpg) 现在打开 ChatGPT 生图,默认就是 Images 2.5 了,所有用户都已经可以直接体验。 我第一时间把这些新能力全测了一遍,整理出 10 个最有意思的邪修玩法分享给大家,每个都附上了完整提示词和操作流程,傻子可懂。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l2LJEwZXPCNP39AH.jpg) ## 一、Sketch 草图 - 画给 AI 看 Sketch 是这次最让我兴奋的新功能。以前想让 AI 生成特定构图的图片,只能用文字描述"左边放什么、右边放什么",来来回回调半天。现在直接在 ChatGPT 对话框里输入 @Sketch,就能打开一个画板,随手画个草稿当构图参考。 重点是,你完全不需要有任何绘画基础,画得越「灵魂」越有反差效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HiUtcj3axVvlylx5.jpg) ### 1、草图变文章封面 作为一个天天写文章、做视频的博主,封面图是我最头疼的事情之一。以前要么用设计软件自己拼,要么纯靠文字描述让 AI 反复试,构图经常不是我想要的。 现在有了 Sketch,我可以先用草图画出封面的大致布局,比如标题放在哪、文字是什么、人物在什么位置、背景有哪些元素。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qWcl6b6K071gGH72.jpg) 然后把我的真人照片也上传作为参考,AI 就能理解我要的是什么效果。 提示词: ```markdown 制作 16 比 9 的封面图,画面为写实风格,标题醒目,构图和人物参考我提供的图片 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ob9pOuSREhBbbLWG.jpg) 不到一分钟,AI 就生成了封面。整体构图完全按照我画的草图来的,人物位置、标题区域全都对上了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/R1nLXRWmmJGWS7dk.jpg) 这个流程比纯文字描述高效太多了。以前我得花好几轮对话才能让 AI 理解我想要的构图,现在花几十秒画个草稿就搞定了。以后做封面图可以省下不少时间。 ### 2、草图秒变室内设计 Sketch 的另一个实用场景是室内设计。你不需要会用任何 3D 建模软件,只要能画出房间的大致布局,比如沙发在哪、桌子在哪、窗户在哪个方向,AI 就能帮你生成一张像模像样的室内设计效果图。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JoCheduA9AbRRM8x.jpg) 提示词: ```markdown 根据房间布局草图生成现代简约风格的实拍房间图,暖色调灯光,北欧风家具,窗外是城市夜景 ``` 如果你正在装修或者搞出租屋改造,完全可以先用这个功能快速出效果图,看看自己的想法实现出来是什么感觉,满意了再动手。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kCpjZ1LG2DaZzjuC.jpg) ### 3、草图变漫画分镜 这个玩法我觉得特别适合有故事想法,但是不会画画的人。用 Sketch 画出 4 格漫画的分镜草图,每一格只需要画个火柴人和简单的场景轮廓,再用文字描述每格的内容和对话,AI 就能生成一张完整的漫画页面。 来感受一下我的大作,你能看出来我画的是什么故事么? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xWU8oICHPBAYn25J.jpg) 然后我把自己 cosplay「老头程序员」的照片也上传了上去,让 AI 参考我的形象来画主角。 提示词: ```markdown 根据四格漫画分镜草图,生成一页完整的彩色漫画。风格是日系轻松搞笑风,主角是一个程序员,参考我上传的照片中的人物形象。 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/S36DYcUejEfM5uWc.jpg) 来看下成品效果,不错吧! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mDLrPlmvLBlZaZs6.jpg) 以前想做个漫画要么自己学画画,要么请人画,成本都不低。现在有了 Sketch 加持,别说做个草图了,可发布的成品大作都能给你搞定。 ## 二、Comment 评论编辑 - 改图之王 Comment 是这次另一个很实用的新功能。 生成图片后,你可以直接在图上点击某个位置放一条评论,写上修改指令。操作逻辑和 Figma 里给设计稿打标注差不多,AI 会按你标注的位置精准修改,其他地方保持不动。 在图片编辑工具栏里,除了 Comment,还有 Markup 标记、Remove BG 去背景、Erase 擦除、Resize 调整尺寸等工具,编辑能力比 2.0 丰富了很多。 ### 4、Comment 标注精修 我先让 AI 给自己的编程导航生成了一张宣传海报,提示词如下: ```markdown 生成一张编程导航(codefather.cn)的宣传海报:深蓝色科技感背景,中央大标题「编程导航」,副标题「从学编程到做项目到找工作,一站搞定」,下方展示三个核心卖点图标(学习路线、实战项目、面试刷题),底部放网址 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0hPoG581AbSYOyy0.jpg) 生成之后,点击图片进入编辑模式,点击上方工具栏上的「评论」按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xvQKrZHr7XGt65f7.jpg) 我在图上添加了 3 个 Comment: 1. 标题上标注「加大字号,换成渐变金色」 2. 副标题标注「改为:近 30 套项目教程 + 万道面试真题」 3. 背景标注「加一些代码粒子飘落的视觉效果」 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tK6S2gO4bYPnQ9zj.jpg) 标注完成后,点击发送评论,可以看到所有的改动都精准生效了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Fxcokr2PnGUpFaXO.jpg) 以前只能跟 AI 对话,通过文字描述要修改的内容,AI 经常搞错位置。现在直接点击图片的某个位置添加具体的改动,准确率高了太多。 ### 5、修改微小细节 既然 Comment 编辑主打精准,那我就来测测它的极限。 这次我选了个高难度任务,先让 AI 生成一张火影忍者中宇智波佐助的半身像,默认是万花筒写轮眼,然后用 Comment 只修改眼睛这一个微小细节。 先生成图片,提示词如下: ```markdown 生成一张宇智波佐助的动漫风格半身像,黑色头发,穿着经典的鹰小队白色开襟上衣,双眼为永恒万花筒写轮眼(六芒星图案,红色瞳孔),表情冷峻,背景为暗色调 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yb9jwYxqpKk8kDA8.jpg) 生成之后,我在佐助的左眼上精准添加了一个 Comment 标注「把左眼的万花筒写轮眼改为轮回眼」。 来看下效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ztbKOTavmqws7xtU.jpg) 卧槽,真牛啊! 眼睛在整张图里就那么一小块区域,AI 做到了只修改瞳孔图案和颜色,佐助的发型、表情、衣服、背景全都纹丝不动,这个精准度真的能用在实际创作中了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1HfNeSKDoO7TOAVZ.jpg) 再见 PS,真的可以卸载了! ## 三、Templates 模板 - 快速复刻 Templates 是给不想写提示词的人准备的功能。ChatGPT 内置了一批高频创作模板,比如 Poster 海报、Merch 周边、Product Photo 商品图、Logo 等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lJA0QFJVvttnOMGX.jpg) 选一个模板,按提示填写信息和风格偏好,就能生成对应的图片,省去了从零构思提示词的过程。 ### 6、一键电商大片 试试 Templates 的 Product Photo 商品图模板。随便拿一个日常物品,看看模板能不能帮它拍出带有「高级感」的电商产品图。 选择 Product Photo 模板,然后上传一张图片(比如鱼皮的光头小企鹅盆栽),点击发送: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VApnQSizXxo5rpJl.jpg) AI 会询问你一些问题,比如产品照的用途、摄影风格、背景和灯光等等: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hhkfITOr1Q9C5pRm.jpg) 看看效果,还不错吧,很有生活气息。感觉哪天我的头像可以更新一波了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bf0L7g3Sk2KGyMcf.jpg) 对于做电商、做小红书带货的朋友来说,这个功能太实用了。以前拍一张像样的产品图要么请摄影师,要么自己搭灯光布景折腾半天。现在手机随手拍一张,选个模板就能出一张可以直接上架的商品图。 ## 四、多轮编辑 + 精准局部编辑 ChatGPT Images 2.5 的多轮编辑一致性是一个重要升级。以前用 Images 2.0 连续编辑几轮之后,画面质量会越来越差,人物五官也会慢慢跑偏。 这次官方说多轮编辑时,之前的修改结果会更稳定地保留下来,每一轮新编辑都是在上一轮的基础上叠加,而不是重新生成。 精准局部编辑也有提升,AI 在修改指定区域的时候,能更好地保持其他区域的构图、光线和细节不变。 ### 7、同一人物七十二变 上传一张照片,连续 5 轮让 AI 把同一个人变成不同的风格,看看到最后一轮人物还像不像本人。 提示词如下: ```markdown 上传一张人物照片。 第 1 轮:把这张照片转换成日系动漫风格,保持人物五官特征 第 2 轮:在上一张的基础上,换成文艺复兴油画风格 第 3 轮:换成赛博朋克风格,加上霓虹灯光效 第 4 轮:换成中国水墨画风格 第 5 轮:换成乐高积木风格 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BffbqhYqyz0BmzMs.jpg) 等 AI 生成完所有图片后,我再让 AI 把原图和生成的所有图片按顺序拼接成一张图,便于我对比效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sk1GlVgnfiAHwxAV.jpg) 显然 5 轮下来,人物是始终保持一致的,多轮一致性做得很好!(第二张图我打算拿来做头像了哈哈) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NL3SfRvHB2BHJbkE.jpg) 另外我还测了个搞笑版本。同一条狗的照片,每一轮都让 AI 把主体的头发再减少一点: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BWVSqpgydocgbNPK.jpg) 几轮下来,除了发量在肉眼可见地减少之外,人物的五官、表情和动作始终保持一致,说明 Images 2.5 的多轮一致性能力确实靠谱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xd0f4pfiJSxwY8p1.jpg) TNND,仿佛看到了自己从前和以后的样子…… 但哪怕时光流逝,年少不再,也要始终保持自信的微笑呀! ### 8、上海迪士尼四季轮转 上传一张上海迪士尼城堡的照片,只通过文字描述,让 AI 连续变化春夏秋冬四个版本。 ```markdown 第 1 轮(春):春天,城堡前的花坛换成盛开的粉色樱花,草地嫩绿,天空晴朗 第 2 轮(夏):夏天,在上一张的基础上,植被变成深绿色,加强阳光感,天空湛蓝配几朵白云 第 3 轮(秋):秋天,树叶变成金黄和橙红色,地面铺满落叶,天空变成暖色调黄昏 第 4 轮(冬):冬天,树木变成光秃秃的枝干,城堡屋顶和地面覆盖一层雪,天空变成灰白色 ``` 注意,我甚至不需要在提示词中告诉 AI「要和原图保持一致」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gUSWnPKomIDx9iil.jpg) 这个测试的关键是看城堡的造型、尖塔的位置、前方广场的布局这些元素,在四轮编辑中是不是始终保持一致。 来,感受一下 GPT Images 2.5 可怕的局部编辑能力和一致性! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ewJfKtmwTOl69hUz.webp) ## 五、透明背景 - 直接生成可用素材 透明背景是 Images 2.5 新增支持的能力。以前想要一张透明背景的素材,得先生成完整图片,再用第三方工具抠图,经常抠得不干净。现在可以直接在提示词里要求输出透明背景的 PNG 图片,生成出来就能直接贴到其他设计里用。 ### 9、DeepSeek 鲸鱼娘表情包 DeepSeek 的鲸鱼娘形象大家应该都很熟悉了,蓝色渐变长发、鲸鱼鳍耳朵、女仆装,性格设定是爱吃白饭、嘴硬心软、理直气壮偷懒,活脱脱一条「蓝色大肥鱼」。 这次我提供鲸鱼娘的标准素材作为参考,让 AI 生成一套透明背景的表情包贴纸,每张表情都融入鲸鱼娘的经典梗。 ```markdown 参考上传的 DeepSeek 鲸鱼娘素材图片(蓝色渐变长发、鲸鱼鳍耳朵、鲸鱼尾巴、女仆装),生成一套 9 张透明背景的表情包贴纸。角色形象必须和参考素材保持一致,卡通 Q 版风格,表情夸张可爱,必须输出透明通道背景 PNG。9 个表情分别是: ①开心大笑,手举「开源大法好!」小牌子 ②无语翻白眼,旁边飘着「又在深度求索了...」文字 ③加油打气,握拳冲刺姿势,配文字「低成本冲冲冲!」 ④哭泣委屈,抱着空碗,配文字「白饭吃完了...」 ⑤比心,配文字「满血版上线!」 ⑥疑惑挠头,头上冒出「思考中...」气泡 ⑦生气鼓腮,配文字「谁说我在摸鱼!」 ⑧困了打哈欠,趴在键盘上,配文字「推理好累...」 ⑨竖大拇指,配文字「大肥鱼认证 👍」 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6bdf4CUyAEAMj7i2.jpg) 虽然过程有点曲折,但最终 GPT Images 2.5 一口气生成了 9 张高清无背景的大图! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/p8tYktZ5ailQcqwf.jpg) 每张鲸鱼娘的风格都是一致的,背景也是干净透明的,以后做品牌 IP 的周边素材就方便多了,不用再手动抠图了。 好了,我现在可以到黄色大咸鱼上开个店了,有没有人需要代做表情包的? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sgNN5sjm2kBjA6pC.jpg) ## 六、Prompt 共享 - 创意接力 Prompt 共享是一个偏社交属性的功能。当你生成了一张满意的图片,分享的时候可以选择把提示词也一起发出去。 别人看到你的图片后,可以直接用同一个提示词模板,上传自己的照片和细节,生成属于自己的版本。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/E6K0iIsspmweeDOQ.jpg) 在 ChatGPT 的图片页面可以浏览当前热门的共享 Prompt 和 Templates 模板,看看大家都在玩什么花样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5hJdgXvDgU1kcF7z.jpg) ### 10、80 年代复古照 GPT 官方提到,目前有一个 80 年代复古照的共享 Prompt 正在全网刷屏。 那我干脆就用这个 Prompt,来体验一下这个共享功能。 点击「80s flashback」这个热门 Prompt,上传一张自己的照片,提交任务就好: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/49eMNYChWWXbRwYz.jpg) 看看效果,真不戳,鱼皮成功穿越了! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yTDfeSB8cjBJaAPE.jpg) 其实之前我给自己的 AI 导航网站也做过类似的图片提示词大全功能,现在官方下场了,AI 生图的生态将被无限放大。 以后热门的创意 Prompt 可以像表情包一样在社交平台上传播,每个人都能用同一个模板生成自己的版本,还挺有意思的。 ## 写在最后 这次测完 Images 2.5,我用几十秒画的草稿变成了一张能直接用的文章封面,随手画的房间布局变成了精美的室内设计图,甚至还做出了一套完整的鲸鱼娘表情包。 要知道,我是完全没有任何美术技能的。 以前这些事情,要么得找专业设计师,要么得自己折腾 PS。 现在画给 AI 看、指给 AI 看、随随便便就能生成图片大作。感谢 AI,创作这件事的门槛,真的已经低到了前所未有的程度。 **人人都是艺术家的时代,真的到来了。** 除了 GPT 官方提供模板之外,我的 [鱼皮 AI 导航](https://ai.codefather.cn) 也提供了「AI 绘图提示词」模块,包含提示词模板大全、提示词生成器、图转提示词三大能力,完全免费,可以快速帮你复刻想要的图片。 > 指路:https://ai.codefather.cn/painting ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SvKj22EeFCfYGaQB.jpg) 你最想用 Images 2.5 的哪个新功能?欢迎在评论区分享你的作品和玩法~

刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!

TNND!DeepSeek V4 Pro 才发布了多久啊,新东西又来了…… 刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OQPKyMO5Cq67GL1D.jpg) 使用方法很简单,无论你使用什么 AI 工具,先像之前一样接入 DeepSeek,然后只需要把模型名称改为 `deepseek-v4.1-flash-expires-on-0910` 就可以了。 举个例子,比如我使用 DeepSeek 的角色专武 —— DeepSeek Harness 来内测新模型,还不会用的朋友可以看看我之前写的[《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ)。 启动 DeepSeek Harness 后,在网页左下角点击设置,编辑内置的 DeepSeek 模型配置: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YS2lTiLOVJbzLsUd.jpg) 在 DeepSeek 模型配置中,点击「添加模型」,输入完整的模型名称 `deepseek-v4.1-flash-expires-on-0910` 并保存: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XSTy4GpKrG7dYTro.jpg) 然后就可以愉快使用了,输出速度嘎嘎快! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IlTzPUiQxAbXkgse.jpg) 但有个问题,明明 DeepSeek V4.1 Flash 模型是原生多模态的,却在 DeepSeek Harness 中显示「不支持图片」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OREbfhMskv7cO1jZ.jpg) 没关系,咱们换个其他的 AI 工具试试,我这里随便用个国产的 AI 工具,比如智谱的 ZCode。 进入模型设置,添加一个 DeepSeek 的供应商,根据 [DeepSeek 官方的 API 文档](https://api-docs.deepseek.com/zh-cn/) 来填写信息就好: ![image-20260908182944707](https://pic.code-nav.cn/post_picture/1601072287388278786/7h3nIqdAt90zwOye.jpg) 点击添加模型,模型 ID 填写 `deepseek-v4.1-flash-expires-on-0910`,并且输入类型一定要把「图片」勾选上: ![image-20260908182917035](https://pic.code-nav.cn/post_picture/1601072287388278786/FBqFSCJySvyonaFw.jpg) 保存之后,就能愉快使用 DeepSeek V4.1 Flash 了,能够正常识图! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yWhDsBhyifT65MO3.jpg) 有趣,DeepSeek 官方的工具反而不适配自家最新的模型吗? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3Uqg4TUP6f4W1PsU.jpg) 简单测试下来,我发现 DeepSeek V4.1 Flash 的速度真心非常快,大概是新模型还没多少人知道的原因吧,也算是带大家吃一波螃蟹了。 目前 DeepSeek V4.1 Flash 的计费和 DeepSeek V4 Flash 完全相同,不过看官方的意思,估计 V4.1 Flash 发布后会降价? 我不知道,我猜的,我希望如此。 --- 往期更多模型评测和 AI 编程教程可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/V37OvgR0ovjdYSTV.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

我终于能用 GPT-6 了!实测一波,Codex 要杀疯了?

大家好,我是程序员鱼皮。 前几天 OpenAI 发布了 GPT-6 Astra,号称全世界最智能的模型,主打像人一样操作电脑和自主完成编程任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/C4DFE5ZjxYXMIq5o.jpg) 我看了一圈官方展示的案例,3D 城市生成、3D 卡丁车赛车游戏等等,效果确实震撼。 ![官方展示的 3D 卡丁车游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/wvlG6UT1ozsjExD2.jpg) 当时我就想第一时间跑轮实测,结果打开 Codex 一看,没有 Astra 的选项。 我以为是自己账号的问题,又专门买了个新账号,结果还是没有! 唉,只能「望模兴叹」了…… 现在,我的 Codex 终于有 GPT-6 Astra 的权限了,赶紧搞几个实战项目测测看。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aFF4DHxlllFoGV87.jpg) 这次我选择了 4 个案例,由浅入深: 1. 3D 程序化城市生成器(对标官方 Showcase,纯前端) 2. 3D 奥德赛战争视频动画(前端 + 后端,专业运镜) 3. 全栈 AI 编程工具(复杂长程全栈任务,跟 Fable 5.1 横评对比) 4. 操作 KiCad 完成电路板布线(Computer Use) 点个收藏,咱们开始~ ## 1、3D 程序化城市生成器 OpenAI 官方的开发者展示馆里有一个用 GPT-5.5 做的程序化城市生成器,编辑器风格的界面加上实时 3D 渲染。我想看看 Astra 能不能做到更好的水平。 ![官方的城市生成器](https://pic.code-nav.cn/post_picture/1601072287388278786/1nkf1dWG8ax7mE95.jpg) 提示词里我就强调了一件事,至少包含重庆、上海、西安、深圳、江南五种城市风格,要让用户一眼就能认出是哪座城市。 之所以选重庆当主打风格,是因为层叠立交的复杂地形在国内辨识度极高,最容易看出 AI 到底有没有理解城市特色。此外,参数维度和编辑器布局怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。 ![Case 1 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/Jts3ZJiuEzBrVGvX.jpg) AI 拿到任务后,先用 Firecrawl 搜索了官方 Showcase 的产品设计,又查了 Three.js 的文档,然后一口气把整个项目写完了。 过了大约 18 分钟,7 项自动化测试全部通过,前端项目构建成功。 来看看成品,第一眼就被惊艳到了…… ![重庆 · 8D 魔幻山城](https://pic.code-nav.cn/post_picture/1601072287388278786/Vf6A8UGYQHxBIkBH.jpg) 网站右侧是完整的城市生成器控制面板,城市风格、城市形态、建筑密度、平均高度、地形与交通、光照氛围全都能调。你随便拖动一个滑块,3D 场景就会实时重新生成。底部是五种城市风格的预览卡片,一目了然。 重庆的 3D 场景确实做出了高差感,建筑群层叠在地形的起伏上,标注了立交层数和轨道交通的位置。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CoYVgMCkdB2GnomK.jpg) 再看看切换其他城市风格的效果。上海版是滨江平地加超高层密集,色调完全变了,标注了东方明珠和上海中心。 ![上海 · 陆家嘴天际线](https://pic.code-nav.cn/post_picture/1601072287388278786/eZrY4Z203cvWWjRU.jpg) 西安版的特色也很鲜明,城墙围合结构、中式屋顶、低矮建筑群,整个色调偏暖土色,标注了大雁塔和钟楼中轴。 ![西安 · 千年长安城](https://pic.code-nav.cn/post_picture/1601072287388278786/IRAVQTnufyzDf6yT.jpg) 深圳版切换到了暗色调,超高密度的玻璃幕墙建筑群,标注了深圳湾,赛博感十足。还能看到道路上的小车,很细节。 ![深圳 · 赛博未来都市](https://pic.code-nav.cn/post_picture/1601072287388278786/3p7u48ugJxED6TOH.jpg) 江南版的画风跟前四个完全不同,白墙黛瓦、小桥流水、低层建筑,水系穿城而过。 ![江南 · 枕水人家](https://pic.code-nav.cn/post_picture/1601072287388278786/gZiE6ifLn2uQWW5l.jpg) 这五种风格切出来视觉差异非常明显,不是简单换个颜色,建筑形态、地形高差、地标标注全都跟着变了。 这个完成度已经超出我的预期了。只用一段提示词,AI 运行 18 分钟就完成了开发和校验。之前用 Claude Fable 5.1 做同等复杂度的项目基本上要半小时起步,Astra 快了不少。 ## 2、3D 奥德赛战争视频动画 第二个案例难度拉高。我让 AI 做一个 3D 史诗级战争场面的视频动画,主题是古希腊奥德赛的特洛伊战争,而且这是一个前端 + 后端的全栈项目。 这个案例最核心的考点是运镜。我要求整段动画要体现专业的运镜手法,不同段落用不同类型的镜头,镜头之间的转场要自然,战场上要有大规模的士兵群体。具体怎么实现、后端承担什么职责,全部交给 AI 自己设计。 ![Case 2 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/VwLgHlpaGI333V4T.jpg) AI 先搜了特洛伊战争的经典场面和电影运镜手法,然后自己设计了一套前后端架构。前端用 Three.js 做 3D 场景渲染和镜头动画,后端用 Node.js 提供两个接口,一个根据场景配置生成分镜脚本,另一个调用 ffmpeg 把前端渲染的帧序列编码成 MP4 视频。 大约 19 分钟后,AI 交卷了: ![特洛伊之围 · 开场](https://pic.code-nav.cn/post_picture/1601072287388278786/ZUXMN8XBPUYqke6r.jpg) 打开网页,一整片黄昏色调的战场直接扑面而来,大规模的士兵方阵、城墙城门、远处的战舰群都在。底部有完整的时间轴播放器,可以拖拽进度、调倍速、全屏播放,右上角还有「导出影片」按钮,对接的就是后端的 ffmpeg 导出接口。 ![特洛伊之围 · 战争推进](https://pic.code-nav.cn/post_picture/1601072287388278786/sCpUVswiwKYrVHCy.jpg) 动画播放过程中,镜头确实在持续运动,从远景推向近景,能看到摄像机角度在截图之间有明显变化。 ![特洛伊之围 · 镜头推进](https://pic.code-nav.cn/post_picture/1601072287388278786/GGor5qaLR8LoxfHk.jpg) 整段动画分成了六个章节,72 秒完整叙事,从风暴将至的全景一步步推到近距离搏杀,最后拉远收束。镜头轨迹的加速度都做了连续性处理,章节字幕是渐隐渐现的。 ![特洛伊之围 · 六个章节](https://pic.code-nav.cn/post_picture/1601072287388278786/qgWsJCYBYAWsgOEe.jpg) 过程中,AI 在自验证阶段发现了远景雾气太重、角色脚底悬空等几个问题,自己修了两轮,最后跑了 9 项测试全部通过。 不过也有明显的瑕疵,有几处角色穿模,士兵的武器偶尔会穿过身体,这种问题让 AI 再跑一轮修复大概率能搞定。 ![特洛伊之围 · 穿模问题](https://pic.code-nav.cn/post_picture/1601072287388278786/TPXyYGrnsmp3g5Af.jpg) 整体来看,这个项目从产品设计到技术实现都很完整。虽然 3D 模型本身是低多边形风格的,不是很精细的建模,但考虑到这是一段提示词从零做出来的全栈项目,已经很强了。 ## 3、全栈 AI 编程工具 - 复刻 Cursor 这是我经常用的一个测试案例,让 AI 复刻一个像 Cursor 那样的 AI 编程工具。提示词跟之前测 Claude Fable 5.1、Kimi K3、DeepSeek V4 Pro 时用的 **完全一样**,好跟这些模型横向对比。 简单来说,我要求 AI 先克隆 VS Code 的开源代码,然后在此基础上做一个支持 Editor Window 和 Agents Window 双窗口切换的 Web AI 编程工具。Editor Window 负责代码编辑,Agents Window 负责 AI 对话和自主开发,技术栈让 AI 自由发挥。 ![Case 3 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/iImCknBmQB99iyu6.jpg) AI 拿到任务后同时做了两件事,一边用 Firecrawl 搜索 Cursor 3 的产品设计,一边通过 Git 命令克隆 VS Code 仓库。 然后花了大约 23 分钟,完成了第一轮开发。 有意思的是,AI 没有直接把产品叫做「Cursor 复刻版」,而是自己取了个产品名叫「orbit」,顶部中间就是 Editor / Agents 双窗口切换按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5lan0PHbPfYan1HB.jpg) 先来看看 Editor Window 编辑器模式的效果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xqK1CYm6PVcyWrOP.jpg) 整体布局参考了 VS Code,比如左侧文件树、中间 Monaco 编辑器、上方多标签页和面包屑导航、下方终端面板、右侧 Agent 对话面板。但又跟 VS Code 不完全一样,比如暗色主题配色、活动栏图标、状态栏信息这些细节都做了自己的设计,更像是一个独立产品而不是简单的换皮。 切换到 Agents Window,这就是我们熟悉的 AI 对话界面了: ![Agents Window](https://pic.code-nav.cn/post_picture/1601072287388278786/HGgXknfYuTVLNEJs.jpg) Agents 面板有完整的任务管理能力,中间是对话输入区,下方已经配好了 `deepseek-v4-pro` 模型选择和 Agent 模式。 AI 能够正常完成简单的开发任务,核心功能都能跑通: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SbkT9gb45e5YuujJ.jpg) 跟之前我测试过的几个模型横向对比一下。 Kimi K3 那次花了半个多小时,核心功能跑通了,但是界面比较简陋。 ![Kimi K3 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/tj989YnqALguPqxO.jpg) 再来看看 Claude Opus 5 用同样的提示词做出来的版本,代码高亮、小地图、管理面板都在,还原度很高,但说实话跟 VS Code 太像了,少了点自己的想法。 ![Claude Opus 5 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/OLY2vO1hwz9FTjQ5.jpg) Claude Fable 5.1 的完成度最高,有完整终端、Agent 执行流程和文件审阅机制,还能逐文件接受或拒绝 AI 改动。 ![Claude Fable 5.1 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/LIWlMJYHK8hHacFL.jpg) GPT-6 Astra 这次最让我惊喜的是它有自己的产品想法。没有完全照着 Cursor 去抄,而是自己设计了 orbit 这个品牌、自己加了任务分类管理和三个快捷入口、自己定义了暗色主题的配色体系。在 Editor Window 的视觉还原度上也做到了几个模型里最好的。 不过整个编辑器的功能丰富度还差 Fable 5.1 一截,像逐文件审阅改动这种功能 Astra 是没有做出来的。 ## 4、操作 KiCad 完成电路板布线 前面三个案例测的都是 AI 写代码的能力,但 GPT-6 Astra 这次主打的其实是「操作电脑」。官方称它是全世界最强的电脑操作模型,ScreenSpot-Pro 的屏幕理解准确率从上一代的 76.9% 直接拉到了 92.7%。 官方的案例展示中,让 Astra 打开 KiCad 电路设计软件,把一张电子原理图变成可以直接拿去生产的 PCB 布线图,元器件怎么摆、铜线怎么走全部由 AI 自己完成。 ![官方演示:Astra 在 KiCad 里完成电路板布线](https://pic.code-nav.cn/post_picture/1601072287388278786/e8rjAq2InDT1zWvF.jpg) 要知道,以前这玩意是硬件工程师一点一点手工拖出来的,是整个电子设计流程里最费时间的环节之一。 我想仿照这个案例自己试一试,于是在本机装了 KiCad 10,看看 Astra 能不能自己操作 KiCad 完成从原理图到 PCB 布线的全过程。 ![Case 4 提示词](https://pic.code-nav.cn/post_picture/1601072287388278786/tRgOaX7vYEOlVTZ9.jpg) 这个案例跟前 3 个完全不同,AI 没有写代码,而是像人一样看屏幕、点按钮、拖拽元器件。 过了大约 13 分钟,AI 完成了任务。 它确实成功操控了 KiCad 的界面,打开项目、进入 PCB 编辑器、从原理图导入网表,这些流程操作都做对了。原理图一致性检查也通过了,说明 AI 看懂了原理图和 PCB 之间的对应关系。最后它还自己跑了一次 DRC 设计规则检查。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QOapRjefxc9eg2Vc.jpg) 但是没能完成正确的布局和布线。我发现 AI 在画布上点击和框选元器件的时候,坐标经常对不准,没法可靠地把元器件拖到指定位置,更别说一根根地画铜线了。最终 DRC 报了 12 项违规和 20 处未连接。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l569FT2I2oz6UL85.jpg) 这个结果让我挺失望的,因为我看了很多博主分享 Astra 操作 Blender 创造各种 3D 大作,成品都很惊艳,怎么到我这就翻车了呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6vYhHLwzyNXyZ6cG.jpg) 从我自己的测试结果来看,Astra 在「看懂专业软件界面」和「找到正确的菜单按钮」这两件事上做得不错,但是却卡在了精细的画布交互上。这也侧面解释了为什么官方的 ScreenSpot-Pro 跑分能到 92.7%(看懂屏幕没问题),但 OSWorld 的任务完成率只有 72.6%(真正把活儿干完就难多了)。 ## 我的感受 跑完这几个项目,我最直观的感受是:**Astra 的前端审美和产品设计能力比 GPT 5 系列提升太多了!** 以前大家测试 GPT 系列的模型,前端效果经常是被吐槽的点,而且 GPT 特别爱偷懒,功能能省就省,以快速完成为主。 比如之前我用 GPT-5.6 Sol 做出来的足球游戏界面是这样的: ![GPT-5.6 Sol 的足球游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/e1wie1kWp5CDklsq.jpg) 是的,那一坨黑色方块就是球门…… 这次 GPT-6 Astra 的使用体感有明显变化,比如 3D 城市生成器那个项目不光功能做全了,连每座城市的地标标注都自己设计了一套,这种用心程度在以前的 GPT 身上是看不到的。 奥德赛战争那个项目也是,完整的 72 秒六章叙事、后端分镜脚本引擎加 ffmpeg 导出、连镜头轨迹的加速度连续性都做了处理。而且速度真的很快,几个项目 20 分钟左右就交卷了,比其他同级别模型快了将近三分之一。 但是我实测下来,感觉 Astra 消耗的 Codex 额度明显更快了,价格比之前贵了不少。基础的 Plus 账号跑 2 ~ 3 个项目就能把 5 小时额度耗光了,Computer Use 消耗更大,想长期用至少得开 Pro。 **所以 Astra 到底值不值得用呢?** 如果你做的是视觉要求高的前端项目,或者需要一次性交付的全栈产品,Astra 目前确实是第一梯队。 对于日常大多数的办公任务,没必要用这么贵的模型,国产的 Kimi、GLM 或者 DeepSeek 够用了。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/jVK9OvPFNdLVU4r2.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你用 GPT-6 Astra 了么?觉得它是目前最强的模型吗?

刚刚 GPT-6 Astra 发布,全球最强,AGI 时代到来!

大家好,我是程序员鱼皮。 时间过得真快啊,距离 GPT-5 发布竟然已经过去一年多了。 昨天凌晨 3 点多,OpenAI 终于把 GPT-6 Astra 放出来了! 官方把它叫做「全世界最智能、也最对齐的模型」。而 OpenAI 总裁 Greg Brockman 在发布前的媒体闭门会上,最后说了这么一句话。 **现在觉得我们已经进入 AGI 时代,并不算什么不合理的想法,欢迎来到 AGI 时代。** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8277A3KX0uR75rPR.jpg) 我本来是想第一时间跑一轮实测的,案例都准备好了。结果打开 ChatGPT 翻了一圈模型列表,没有;去看 API,也没有…… 去官方博客看了一下,目前 Astra 只开放给一小批安全厂商,普通订阅用户是用不了的,接下来几天才会陆续开给 ChatGPT 的 Plus、Pro、Business 和 Enterprise 用户。 吊大家的胃口嘛这不是? OpenAI 自己也知道这件事说不过去,于是负责 ChatGPT 的 Tibo 发了一条推特,说会给每一个订阅了付费计划但还没拿到 Astra 权限的用户,按天补偿额度重置,一天没用上就补一次。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZlAcH4SlNXiiJLQE.jpg) 行行行,原谅你了(正好周五我可以摸鱼了~ ## GPT-6 Astra 强在哪 这次,OpenAI 官方推文并没有吹 GPT-6 的编程能力,而是操作电脑能力。 他们把 GPT-6 Astra 称为「全世界最强的电脑操作模型」,AI 可以像人一样看屏幕、点按钮、填表单、刷应用,无所不能。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OLR6WLaJ7N4rH2n2.jpg) 先看看跑分,有个叫 ScreenSpot-Pro 的测试专门考模型能不能看懂屏幕、并且精准点到该点的位置,上一代 GPT-5.6 Sol 是 76.9%,Astra 直接干到了 92.7%。 ![ScreenSpot-Pro 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/ChflZokbLfdqWykV.jpg) 还有一个更接近真实工作的测试叫 OSWorld,就是把 AI 扔进一台真电脑里让它自己干活。Astra 的完成率是 72.6%,比 Sol 的 65.7% 高了不少。更关键的是完成同样的任务,Sol 平均要 75 分钟,Astra 只要 40 分钟! ![OSWorld 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/EYYDEywr8WXVLc8h.jpg) 我觉得主攻「屏幕理解」是个正确的方向。现实里绝大多数软件根本没有 API,很多公司的内部系统还是二十年前写的,文档都不知道在哪。但所有软件都有界面,那界面本身就是最通用的 API,AI 不用等谁来适配,自己看屏幕操作就完了。 GPT-6 Astra 的编程能力也有大幅提升。Terminal-Bench 4.0 考的是在终端里完成软件开发、系统配置和数据分析这类复杂任务,Astra 拿到 57.9%,Sol 只有 37.3%,Claude Fable 5.1 是 55.8%。 ![Terminal-Bench 4.0 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/AYnLRZJdBBD3iqrg.jpg) 不过这次最让我意外的跑分是 ARC-AGI-3。 这个测试难在不给 AI 说明书、不给规则、甚至都不告诉 AI 目标是什么,模型进去只能自己乱按,慢慢摸清怎么才算赢,再把摸出来的规律用到更难的关卡上。 它考查的不是 AI 的知识,是悟性。 今年 3 月这个测试刚发布的时候,最强的 AI 只有 0.51 分,人类平均 48 分,GPT-5.6 Sol 是 7.8 分。 而 Astra 做到了 99.9 分! ![ARC-AGI-3 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/ASV7VCdK3xhONqfx.jpg) 把这称作 AI 的开悟时刻,不过分吧? 再看看 GPT-6 的数学能力,FrontierMath Tier 4 这套题 Astra 拿到 97.6%,基本上算是打穿了。 ![FrontierMath Tier 4 跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/1UsrMsdmVdAuuJNr.jpg) 最后说说大家关心的价格。API 里的模型 ID 是 `gpt-6-astra`,每百万输入 token 10 美元、输出 50 美元,跟 Claude Fable 5.1 一模一样,是自家上一代 GPT-5.6 Sol 的 2.5 倍,涨得还是挺狠的。 但是考虑到大多数用户都是在 Codex(ChatGPT)中使用套餐,再加上官方老是赠送重置额度,实际开销没有那么大。 ## 实战案例 跑分看着很爽,但我更关心 GPT-6 做出来的东西是什么效果。 官方这次放了不少实际案例,我挑几个有意思的说说。 先看一个最能体现「操作电脑」能力的。官方让 Astra 打开 KiCad 这个电路设计软件,把一张电子原理图变成可以直接拿去生产的电路板布线图,元器件怎么摆、铜线怎么走全都是它自己完成的。 ![Astra 在 KiCad 里完成电路板布线](https://pic.code-nav.cn/post_picture/1601072287388278786/vQVI9yuSU1m6wduM.jpg) 这活儿平时是硬件工程师一点一点手工拖出来的,也是整个电子设计流程里最费时间的环节之一。 然后是 3D 建模能力,官方展示了让 Astra 直接建出一整座城市场景,楼体、道路、绿化带、斑马线、路上的车,一个都不少。 ![Astra 建出来的 3D 城市场景](https://pic.code-nav.cn/post_picture/1601072287388278786/T1P6XBu2XIDWVKuZ.jpg) 不光是建静态模型。官方还演示了先在 Blender 里把一栋房子建出来,再导进 Unreal Engine 5 变成可以自由走动的场景,让设计师和客户在开工之前就能提前逛一遍。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Sz7psxB25TakWJHW.jpg) 再看看游戏开发能力,官方直接在发布页面里嵌了两个能玩的网页项目,鼠标点进去就能上手。 第一个是卡丁车竞速游戏,这是完全用 AI 程序化生成的 Three.js 卡丁车赛车,赛道和场景不是靠网上的素材堆出来的,是靠代码算出来的。 ![Tidal Rush 卡丁车游戏的实际画面](https://pic.code-nav.cn/post_picture/1601072287388278786/UDUB6QYNpwIAFr1I.jpg) 我自己上手跑了两圈,速度表、漂移条、小地图、名次和圈数都在,手感也不飘。沙滩的高光、水面的透光、椰子树的剪影、彩旗的排布,这水准我觉得已经超过不少外包团队交的活儿了。 第二个案例更酷炫,是个宇宙飞船船厂。每换一个随机种子就能生成 1000 艘不重复但可复现的飞船,全部由 177 个模块化零件拼出来,每一艘还带尺寸、载货量、推力、装配模块数这些参数。 ![飞船船厂里 1000 艘飞船的图鉴](https://pic.code-nav.cn/post_picture/1601072287388278786/jwwszai6x6wM74VB.jpg) 左边是舰队列表,中间是整页图鉴,右边是选中那艘船的详细规格,还能导出成一张拼版图。 除了官方,一批提前拿到内测权限的人也在 Twitter 上晒了自己的测试,有几个我觉得比官方演示还带劲儿。 Matt Shumer 让 Astra 在 Unreal Engine 里造一个世界,往里面填满由 Astra 驱动的角色,要求他们必须互相合作才能活下去。第二天他在卧室里听见客厅有人说话,以为家里进人了,走出去还有点害怕,结果是那些 AI 角色自己开始互相聊天了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/A57K0hBeI7nv5aMi.jpg) 一位研究 T 细胞三十五年的免疫学教授,只给了 AI 一句「做一个 5 分钟讲 T 细胞的教学视频」,Astra 自己挑了视频框架、调文生图做画面、还主动建议用 AI 配音,最后一次性把讲什么、怎么讲、配什么画面全组装好了。 教授说:凭他三十五年的经验,他自己也讲不了比这更好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TgvAcViw61yeWzVB.jpg) 看完案例你可能会想:官方是拿什么样的提示词做出这些东西的? 这个问题其实有答案。OpenAI 有一个 [开发者展示馆](https://developers.openai.com/showcase),里面收录了五十多个用 Codex 做出来的项目,而且 **每个案例的详情页都把当时用的提示词原文一字不改地贴出来了,后面还列了每一轮迭代都改了什么**。 ![OpenAI 官方开发者展示馆](https://pic.code-nav.cn/post_picture/1601072287388278786/LAbfIpvkOJtkpLWF.jpg) 虽然这个展示馆不是这次跟 Astra 一起发的,里面的案例大多是用 GPT-5.5 和 5.6 做的,但我觉得值得给大家分享一下,看官方的提示词能收获不少 AI 编程的启发。 随便分享 2 个,第一个启发是 **要逼 AI 自己验收**。 比如玻璃塔堆叠游戏的提示词,最后一句是这么写的: ``` Run build and lint, then play several runs in the browser to verify collisions, scoring, failure, and restart with no console errors. ``` 意思是先跑构建和代码检查,然后让 AI 在浏览器里玩几局,把碰撞、计分、失败和重开都验一遍,控制台不许有报错。 ![Glass Towers 玻璃塔游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/bsrmi9Zuf2QU7iEr.jpg) 这就是我一直在讲的 Loop Engineering,让 AI 写完自己验,验证不通过就自己修复。官方把它写成了提示词里的硬要求。 第二个启发是 **先画图再写代码**。 小镇模拟游戏的提示词最后一段,是让模型先用文生图工具画几张玩法概念图,把视觉方向定下来,再开始写代码。 ![MiniTown 小镇模拟游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/FXxDxfWSqJf4rnHU.jpg) 如果你平时让 AI 做前端总觉得出来的东西土,这一招直接助你羽化登仙。 剩下的案例我就不逐个讲了,放一张成品感受一下水平。 ![Terrain Mixer 程序化地形生成器](https://pic.code-nav.cn/post_picture/1601072287388278786/L7eQENNQP6hm4v7m.jpg) ## AGI 时代真的来了么 虽然官方把 GPT-6 Astra 吹得狂拽炫酷吊炸天,我看了官方展示的案例也觉得很牛呗,但是网上有很多不同的声音。 第三方评测机构 Artificial Analysis 在发布当天就出了独立评测,结论跟官方不太一样。在他们的综合智能指数里,Astra 是 61 分,跟上一代 GPT-5.6 Sol 一模一样,比 Claude Fable 5.1 还低了 5 分。 ![Artificial Analysis 的独立评测](https://pic.code-nav.cn/post_picture/1601072287388278786/U7P4IDCcwv6w4QSo.jpg) 图里右边那一栏是单个任务的成本,Astra 1.67 美元,GPT-5.6 Sol 0.94 美元。**智能指数一分没涨,成本快翻倍了!** 所以「全球最强」这个说法,在 OpenAI 自己挑的那批测试上成立,一换成第三方的综合指数就未必成立了。 而且根据历史情况,我们可以大胆假设,GPT-6 Astra 大概会像其他模型一样,第一周用起来像是在跟神说话,一周后厂商为了省算力搞一波降级,再用起来就像是在跟三岁小孩说话,两周后被用户投诉多了,就再把智力调回来一点,几周之后再发布 GPT-6.1,然后循环…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uC3UBzuXbdkswKBx.jpg) 就分享到这里吧,等我拿到 GPT-6 Astra 的使用权限,再跑几个 AI 编程实战项目测测看。 本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/66qzga081WA3bBBB.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区有没有已经用上 GPT-6 Astra 的朋友,聊聊你们的使用感受?

刚刚 Gemini 3.8 Flash 模型发布,遭全网狂嘲。。谷歌这波拉完了?

大半夜的,Google 发布了 Gemini 3.8 Flash 新模型。 这已经是他们六周之内发的第三个 Flash 模型了,从 3.6 到 3.7 再到现在的 3.8,差不多每三周就来一版,我真的已经写不过来了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ljF4S444S69FWJsu.jpg) 每次新模型发布,大家最关心的无非就是两件事,**能力怎么样** 和 **价格贵不贵**。 先看价格。Gemini 3.8 Flash 的单价一分钱没涨,还是每百万 token 输入 0.75 刀、输出 3.75 刀。 这是什么概念呢? Claude Opus 5 是输入 5 刀、输出 25 刀,也就是说 3.8 Flash 的单价只有 Opus 5 的七分之一左右。 再看看能力。最能说明问题的是 DeepSWE v1.1 这一项,它专门考查模型能不能自己端到端做完一整套长周期的软件工程任务。 3.8 Flash 拿了 73.7%,上一代 3.7 Flash 只有 65.3%,而贵了七倍的 Claude Opus 5 是 74.0%,两者只差 0.3 个百分点! ![DeepSWE 长周期软件工程跑分](https://pic.code-nav.cn/post_picture/1601072287388278786/sQq4mppYsNt7lBqY.jpg) 考察 Agent 终端编码能力的 Terminal-bench 2.1 测评上,它拿了 89.4%,是全场第一,超过了 Opus 5 的 89.1%! ![官方总跑分表](https://pic.code-nav.cn/post_picture/1601072287388278786/UT7vdiFTXoGLqSDX.jpg) 单价只有七分之一,跑分却跟顶级旗舰模型不分上下,光看这些数字,我对这个模型还是有点期待的。 但这次发布最有趣的地方,恰恰藏在单价的背后。 Google 一直在强调 3.8 Flash 跟上一代 **同价同速**,可第三方评测机构 Artificial Analysis 拿真实任务测下来,单任务消耗的 token 从 3.7 万涨到了 4.8 万,涨了将近 30%,单任务的实际成本也从 0.40 刀涨到了 0.58 刀,整整贵了 40%。 更要命的是首字延迟,它吐出第一个字平均要等 13.3 秒,而同类模型的中位数只要 2.99 秒。 所以有网友制作了这样一张梗图: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ya5XoVoiShm2Esad.jpg) 官方自己在博客里交代了原因,说 3.8 Flash 会「works harder」,遇到复杂任务会在背后反复推理、多次调用工具、自己纠错。 那 Gemini 3.8 Flash 模型到底怎么样呢? 老规矩,好不好用还是得自己试了才知道。 接下来我会在 Cursor 里使用 Gemini 3.8 Flash 模型,通过 **3 个全新设计的项目** 来测试它的实际编程能力: 1. 3D 动画短片《一个 HTTP 请求的一生》 2. 3D 烟花仿真燃放系统 3. Markdown 写作图床工作台 测试方法很简单,我在 Cursor 里同时起了 3 个子 Agent,每个 Agent 负责一个独立项目、一个独立目录,全程不需要人工干预,让 AI 自己跑到底。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/u0VXU2MNYNNuvzya.jpg) 大家可以猜猜看,跑完这 3 个项目要花多少钱?答案在结尾揭晓。 ## 项目实战测评 ### 1、3D 动画短片 平时我们天天跟 HTTP 打交道,但在浏览器地址栏敲下回车之后、页面显示出来之前,中间那一串过程大多数人只在架构图上见过,从来没见过它动起来。 第一个项目我就让它做一支能在浏览器里全屏播放、还能导出成视频文件的 3D 动画短片《一个 HTTP 请求的一生》,把这个过程讲明白。 提示词里我把片长卡在 40 到 60 秒、分成四段,其余的全部放开,不指定任何技术栈,只要求它用 Context7 查所用 3D 库的最新文档,而且片子里所有的模型和场景必须用代码生成,不许用任何外部的图片或者模型文件,其他的全部留给 AI 自己编排。 ![CASE 1 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/jZE2fTtxhbpVfWUt.jpg) 拿到任务之后,AI 先用 Context7 查了 Three.js 里三维样条曲线和管道几何体的最新用法,然后花了大约 14 分钟做完。 整个过程它不光用 Canvas 2D 纯代码画出了发光芯片和机房指示灯的贴图,还自己写了个自动化脚本逐帧抓取渲染画面,再转码成视频。 来看看成品效果。 短片开场是一台发光的显示器,模拟用户在地址栏敲入网址然后按下回车的瞬间。 ![输入网址敲下回车](https://pic.code-nav.cn/post_picture/1601072287388278786/IxGg90Nx4uAUex4X.jpg) 回车按下去,镜头立刻拉进微观电路,第一幕 DNS 递归查询开始,发光的数据包沿着光纤在根域和顶级域名服务器之间穿梭。 ![DNS 递归查询](https://pic.code-nav.cn/post_picture/1601072287388278786/pTQGcJJnCNWzReRn.jpg) 镜头再推近权威域名服务器,芯片亮起并返回解析出来的 IP 地址,第一幕的动画流畅度还不错。 ![权威 DNS 返回 IP](https://pic.code-nav.cn/post_picture/1601072287388278786/ylxxwT4kkAU2AfBA.jpg) 第二幕切换到 TCP 三次握手,数据包变成金色脉冲在客户端和服务端之间往返,先是发起 SYN 报文。 ![TCP SYN 握手](https://pic.code-nav.cn/post_picture/1601072287388278786/ZU2Y9afWesfuv04z.jpg) 服务端收到之后回复了 SYN+ACK,画面上两端的节点跟着闪烁确认。 ![TCP SYN+ACK 握手](https://pic.code-nav.cn/post_picture/1601072287388278786/UjYkxbReItpZzvU1.jpg) 客户端再回传 ACK,三维世界里立刻贯通出一条双向的数据光纤隧道,这个连通感做得挺到位。 ![TCP 建立双向通道](https://pic.code-nav.cn/post_picture/1601072287388278786/KnjxHIeI2BQY4p6x.jpg) 其他镜头我就不挨个儿介绍了,最终完整的网页呈现在屏幕中央,天上还放起了烟花。 ![网页渲染完成的结尾特效](https://pic.code-nav.cn/post_picture/1601072287388278786/dZD7wWXuJ25Y3bLo.jpg) 通过这个任务,我发现确实如 Google 官方所说,AI 主动做了不少事情。 比如网页 Canvas 导出视频的时候,默认只会录到三维画布,外面所有的 HTML 字幕都会丢掉。它自己搭了一套双层复合录制管线,把底部字幕和协议标签直接压进了视频帧里,导出来的 MP4 可以直接发到视频平台。 **不足之处也很明显了,整套前端效果真的不好看!!!** 我印象中前端设计能力一直是 Google 系列模型引以为豪的亮点,怎么这次这么拉了,无论是配色还是字体都透露着浓浓的 AI 味儿,甚至有些字体根本看不清…… ### 2、3D 烟花仿真燃放系统 第一个项目考察 AI 对镜头和叙事的编排,接下来这个就纯粹看图形算法、物理建模和性能优化能力了。 我让 AI 做一个 3D 烟花燃放的仿真网页,做球形、牡丹、柳条三种形态,升空和炸开都要按真实的重力和空气阻力来算,不许用预先做好的动画糊弄,爆炸的时候还要有声音。技术栈依然完全放开,让 AI 自己想办法。 ![CASE 2 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/g4CYVm3X6tuXgegY.jpg) AI 这次花了大约 11 分钟,用 Context7 插件查了 Three.js 动态缓冲顶点属性的用法,然后自己写了一套着色器。 先看初始场景,夜幕下是城市天际线的剪影,下方水面还有微光在荡。 ![夜空天际线初始场景](https://pic.code-nav.cn/post_picture/1601072287388278786/oTqGHDGuL4jREKp2.jpg) 第一种是经典的金色球形烟花,它用斐波那契球面算法算初速度,炸开之后是一个非常规整对称的球壳。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YiZe0FV0jgB51Sp0.jpg) 第二种是牡丹,它做成了双层结构,外层是主花瓣、内层是星蕊,炸开的一瞬间花团锦簇。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dTAloi4x7r5u6se7.jpg) 第三种柳条烟花最考验 AI 的物理建模能力,火星受重力和空气阻力双重作用往下垂,燃烧时间长达 3.5 秒以上,拖出一挂金色的瀑布。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lBx5QCkK2oGo19kn.jpg) 接下来是这道题的重头戏,验帧率。我要求的是上万颗粒子维持 60 帧,AI 在压测模式里直接把同屏活跃粒子拉到了 40000 颗,是我要求的 4 倍,画面依然稳稳跑在 120 帧上。 ![4 万粒子 120 帧极限压测](https://pic.code-nav.cn/post_picture/1601072287388278786/R2jAZpMfe2mrYS1l.jpg) 总体来说,AI 完成的还是不错的,但还是老问题,整个前端 AI 味儿太足了,用了很多 Emoji 图标,没有什么让人惊喜的地方。 ### 3、Markdown 写作图床 前面两个项目都在看 AI 的图形表现力,接下来试试它的全栈能力。 我写文章的时候经常要配图,截完图要压缩、转格式、上传、再手动复制链接,比较麻烦。 所以我打算让 AI 做一个自用的图床,截图拖进去或者直接粘贴进去,它自动把图片转成 WebP 格式压缩,然后返回一条能直接贴进 Markdown 的链接。 ![CASE 3 提示词原文](https://pic.code-nav.cn/post_picture/1601072287388278786/XoZcGrTfMfdXTYYc.jpg) 大约 5 分钟,AI 就完成开发并且跑通测试了。它选的是 Express 配 Sharp 做图像处理,数据库用了轻量的 better-sqlite3 并开了 WAL 模式。 来看看成品效果。 界面是暗色玻璃拟态的风格,顶部是已存图片、节省体积和压缩比率三个统计,中间是拖拽上传区。 ![图床大盘与图片墙](https://pic.code-nav.cn/post_picture/1601072287388278786/MC5hLXCAKjtPUgPC.jpg) 传一张图上去,它自动转成了 WebP,体积从 87.87 KB 压到了 12.13 KB,压缩了 86.2%,同时给出了可以直接复制的 Markdown 代码。 ![上传图片与 WebP 压缩率](https://pic.code-nav.cn/post_picture/1601072287388278786/8V4v6hmip7MNsT78.jpg) 把同一张图再传一遍,它立刻通过 SHA-256 认了出来,弹出黄色提示,并且直接把上次的链接还给我,没有额外占用磁盘空间。 ![智能秒传去重识别提示](https://pic.code-nav.cn/post_picture/1601072287388278786/JT0x9jvg6QsVHCQt.jpg) 点击图片卡片,可以打开大图详情弹窗,能看到原图和 WebP 的体积对比、分辨率,还能一键复制不同格式的链接。 ![大图详情与尺寸对比](https://pic.code-nav.cn/post_picture/1601072287388278786/PtcA1LuiPs2ZEqWo.jpg) 支持按照文件名称实时搜索图片,也能按照时间和体积正反序排列。 ![搜索过滤与排序](https://pic.code-nav.cn/post_picture/1601072287388278786/Adb25P4ot8ZazLDl.jpg) 勾选卡片左上角的复选框就进入批量管理模式,支持全选,删除前还有二次确认。 ![多选与批量删除模式](https://pic.code-nav.cn/post_picture/1601072287388278786/mnYXL5cKgicQpB47.jpg) 整个系统的功能还是很完整的,美中不足的是,如果我传一张特别长的代码截图进去,图片墙在算瀑布流高度的时候卡片底部偶尔会错位。 ## 我的感受 3 个项目全部跑完了,我个人对 Gemini 3.8 Flash 还是有点失望的。 虽然能够顺利完成全栈开发任务,但这已经是现在新模型的门槛了,关键是新模型在前端的表现上有点拉,尤其是我昨天刚测试完 Claude Fable 5.1,跟顶级模型的差距非常明显。 而且测试中,我也发现了 Gemini 3.8 Flash 模型首字延迟的问题,起步速度略慢于 Grok 4.6、DeepSeek V4 Flash 等模型,不知道你们有没有遇到? 最后揭晓开头的谜底,这 3 个项目花了多少钱。 答案是 30 块钱左右,如果直接用官方的 API 可能会更便宜一些,你觉得这个价格怎么样? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OKSwlCsxhZCKor9R.jpg) 虽然肯定比 Claude Opus 5 这种顶级模型便宜,但是跟 GLM、Kimi 等国产模型相比,基本上没有什么价格优势。而且同样的任务,交给 GLM-5.3、Kimi K3 来做,效果可能更好。 **所以测完这次之后,我应该不会再用 Gemini 3.8 Flash 这个模型了。** 怎么回事,谷歌那么强大的公司,怎么在大模型领域被其他公司按在地板上反复摩擦呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nziu3do0pVurxtIB.jpg) OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/pK9Tg24YWwLeUADq.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你觉得 Gemini 3.8 Flash 怎么样?

刚刚 Claude 最强模型 Fable 5.1 发布,最高降价 75%!系统提示词还被人扒出来了?

大家好,我是程序员鱼皮。 大半夜的,Anthropic 发布了 Claude Fable 5.1,这是目前 Claude 家族里最强的模型,专门为长程 Agent 编程和复杂知识工作打造的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iSSMhxKPpfgjVxCd.jpg) 这次 Fable 5.1 加入了反蒸馏机制,新的 API 账户没办法在多轮对话中篡改 Claude 之前的上下文来偷取思考过程了,防止其他厂商大规模蒸馏 Claude 的能力。 不过这个跟咱们用户关系不大,每次发布新模型,大家最关心的无非就是两件事:**能力怎么样** 和 **价格贵不贵**。 先看下能力。Fable 5.1 在 Agent 科学研究和 Agent 编程这两个方向上提升最猛。Terminal-Bench-Science 拿了 52.6%,Fable 5 只有 24.7%,直接翻倍了!Agent 编程的 Terminal-Bench 4.0 拿了 55.8%,也远超 Fable 5 的 42.0% 和 GPT-5.6 Sol 的 37.3%。在 Cursor 场景下的 CursorBench 也拿了 73.4%,是目前跑过这个基准得分最高的模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nQIzyZ0CBer9fH0G.jpg) 再看价格,Fable 5.1 的输入输出价格跟 Fable 5 一样,还是每百万 token 输入 $10、输出 $50。但是 Anthropic 把缓存读取的价格砍了 75%!从 $1 降到了 $0.25。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XTJ5zI9Emc4aJ83f.jpg) 别小看这个改动。Agent 编程场景下,模型会反复读取之前的上下文,缓存读取占了大头成本。官方实测下来,普通任务便宜了约 25%,重度 Agent 任务最高能省 45%! 当然,以上只是官方信息,模型好不好用,还得拿真实项目来检验。 接下来我会在 Cursor 里使用 Fable 5.1 模型,通过 **3 个不同类型的项目** 来测试它的实际编程能力: 1. 3D 网页动作游戏《黑神话 - 牛来》 2. 全栈 AI 编程工具(复刻 Cursor,横评对比) 3. AI 智能视频剪辑工具 测试方法很简单,我在 Cursor 里同时起了多个子 Agent,每个 Agent 负责一个独立项目、一个独立目录,全程不需要人工干预,让 AI 自己跑到底。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/K4eXMiO3dYKJVQuV.jpg) 激动的心,颤抖的手,点个收藏,咱们开始~ ## 项目实战测评 ### 1、3D 网页游戏《黑神话 - 牛来》 第一个项目,致敬《黑神话:悟空》和国产动画电影《牛来》,做一个 3D 网页动作冒险游戏,复刻黑神话悟空的核心玩法和战斗机制。 提示词很简单,我只给了核心定位和方向,让 AI 自己用 Loop Engineering 循环工程的方式迭代推进,具体怎么实现完全交给 AI 自己发挥: ``` 开发一个致敬国产动画电影《牛来》和《黑神话:悟空》的 3D 网页动作冒险游戏,名为《黑神话 - 牛来》。主角是牛来,在奇幻大陆上闯关战斗,复刻黑神话悟空的核心玩法和机制。 必须先用 Firecrawl 联网搜索《黑神话:悟空》的战斗系统和游戏机制资料,以及《牛来》电影的视觉风格和角色设计资料。开发时用 Context7 查询所用 3D 库的最新文档。 开发过程中通过 Loop Engineering 方式推进:每完成一个功能模块就自己在浏览器中验证效果,发现问题立刻修复,确保最终交付时所有功能正常运行、没有报错。 ``` 开发过程中,每完成一个模块,AI 都会自己打开浏览器验证效果,发现问题就立刻修复,不需要我做任何干预。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ud1GlkwBLVa70Rbb.jpg) 来看看成品效果。 先看主页,这段开场描述写得还挺有味道的,还提供了详细的游戏说明,不过也是浓浓的 AI 味儿。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fpwkQteQDm6CEm8l.jpg) 进入游戏,第三人称跟随摄像机,可以自由旋转视角,确实有黑神话那个味儿了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9XzTyICYieeIJPq1.jpg) 场景里有小怪和 BOSS,你需要清除区域内的妖怪才能解开结界,进入下一个区域。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/F0rGpMrrcKiBjHtu.jpg) 最让我惊喜的是战斗系统。牛来的攻击方式非常丰富,除了轻棍、重棍、闪避这些基操之外,重点还原了黑神话悟空中的棍势机制,支持四段连招、蓄力重击等多种连招玩法。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/awG561GWR6E6msVA.jpg) 还复刻了黑神话中的经典技能,比如定身术,可以直接定住一名敌人,然后一顿输出,跟原版游戏的体验很接近。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NlDcIsL102K4xpGf.jpg) 还有分身技能,会召唤出多只小牛来一起攻击,BOSS 战的时候特别好用,来感受下这个技能的还原度: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ir4Ybk0bW0ElBvHk.jpg) 还有狂牛变身,怒气攒满之后可以变身为狂牛形态,攻击力提升 1.8 倍,而且所有招式不消耗体力,广智助我! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mqzXsw9vGl30xz4J.jpg) 可惜,游戏的不足之处也很明显。整个游戏没有声音,部分场景会出现穿模的情况,牛来偶尔会卡在地形里面。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eScLmYGqUEoCkw9Q.jpg) 综合来看,只用一段提示词就能让 AI 做出一个拥有完整战斗系统、多种技能和 BOSS 战的 3D 动作游戏,我觉得已经非常厉害了。 之前我让 GLM-5.3 做过《牛来》跑酷游戏,也就是个简单的躲避障碍物。但 Fable 5.1 直接一把梭出了有攻击连招、法术技能、BOSS 多阶段的动作游戏,完全不是一个量级。 ### 2、全栈 AI 编程工具(复刻 Cursor) 经常看我文章的朋友应该对这个项目不陌生了。 之前我在测评 Kimi K3 和 Claude Opus 5 的时候,都用了同一段提示词让模型复刻一个 Cursor 风格的 Web AI 编程工具,正好拿来横向对比。 这次我用和之前完全一致的提示词,让 Fable 5.1 基于 VS Code 的开源代码,开发一个支持 Editor Window 和 Agents Window 双模式的 Web AI 编程工具: ``` 克隆 VS Code 的开源代码 https://github.com/microsoft/vscode,在此基础上开发一个复刻 Cursor 核心体验的 Web AI 编程工具。 请先用 Firecrawl 联网搜索 Cursor 3 的 Agents Window 和 Editor Window 的产品设计和交互方式,了解需要复刻的核心体验。开发时用 Context7 查询 VS Code 扩展 API 和所用框架的最新文档。 支持两种窗口模式:Editor Window(传统代码编辑器界面,包含文件树、多标签页、语法高亮,用于浏览和手动编辑代码)和 Agents Window(Agent 优先的工作台,可以启动 AI Agent 任务,Agent 自主读取文件、编辑代码、执行终端命令来完成开发任务,支持并行运行多个 Agent)。两种窗口可以切换使用。 AI 后端调用兼容 OpenAI 协议的大模型接口,base_url 为 https://api.deepseek.com/v1,API Key 为 sk-xxx,模型 id 为 deepseek-v4-pro。 这是一个复杂的长程任务,用 Loop Engineering 方式推进:先搭出 Editor Window 的基础骨架(文件树 + 编辑器),确认能跑;然后搭 Agents Window 的 UI 并接入 AI 接口实现基本的 Agent 对话;再实现 Agent 读取和修改文件的核心能力;最后打通两个窗口的切换。每完成一步都要自己验证能否正常工作,通过截图查看界面渲染效果,判断布局和交互是否符合预期,发现问题就自主修复。 ``` 先看看成品效果。Editor Window 界面复刻得非常到位,代码高亮、代码小地图、文件树、多标签页都有了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GlWGYjAM6nDVLShY.jpg) 比之前 Opus 5 做出来的成品更精致了,这次甚至连终端都完整地做出来了,可以自由输入命令、浏览文件目录。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3hAzvBwiKEB3TY2U.jpg) 切换到 Agents 面板,让 AI 执行一个任务,可以清晰地看到完整的执行过程,包括思考过程、工具调用、代码编辑等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/je2ADJ3l50io5OFe.jpg) 我再让 AI 开发一个贪吃蛇游戏,它可以自主完成开发,而且界面上支持灵活地接受或拒绝 AI 改动的每个文件,跟真正的 Cursor 交互体验很像了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6OLEheyTevHylnej.jpg) 还支持多轮对话,而且默认设置了 AI 单次执行步骤不超过 20 步的保护机制,避免 AI 无限制地跑下去浪费资源,非常贴心了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aJY0hGQLiToVQL14.jpg) 复刻出来的贪吃蛇游戏也是完全可玩的,你觉得这个效果怎么样? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dFb2d7DHGEa4tcn8.jpg) 对比一下之前几个模型在同样任务上的表现。 当时我让 Kimi K3 做这个项目的时候,Editor Window 的基本骨架是有了,但界面比较简陋,文件树和编辑器之间的联动也不太顺畅。 ![Kimi K3 的 Editor Window](https://pic.code-nav.cn/post_picture/1601072287388278786/mhfe6n8geu6CdKLw.jpg) Agent 执行任务时虽然能看到工具调用,但整体完成度跟成熟产品还有很大差距。 ![Kimi K3 的 Agent 执行](https://pic.code-nav.cn/post_picture/1601072287388278786/4x2Y7j2Ai9lroWHA.jpg) 后来我用 Claude Opus 5 跑同样的提示词,效果好了很多,保留了 VSCode 的代码高亮、管理面板等核心功能: ![Opus 5 的编辑器界面](https://pic.code-nav.cn/post_picture/1601072287388278786/1szI0D28tBi9Odna.jpg) Opus 5 的 Agent 也能调用终端自主测试开发出的代码,而且你可以清晰地看到 AI 的思考信息和工具调用过程。 ![Opus 5 的 AI 执行](https://pic.code-nav.cn/post_picture/1601072287388278786/FTELiev6wQppFX4b.jpg) 而这次 Fable 5.1 做出来的效果又上了一个台阶。对比下来,Fable 5.1 的版本在编辑器完整度、终端交互、Agent 执行流程、文件审阅机制这几个方面都做到了最好。同样一段提示词,你能明显感受到模型真的是一代比一代强。 ### 3、AI 智能视频剪辑工具 最后一个项目是全栈 AI 应用,让 Fable 5.1 开发一个 AI 智能视频剪辑工具,支持 AI 生成字幕、识别精彩片段、一键去水词等功能。 提示词同样很精简,我只给方向,让 AI 自己调研和发挥具体的技术实现: ``` 开发一个 AI 智能视频剪辑工具,用户上传视频后,AI 自动分析内容并提供智能剪辑功能,包括 AI 自动生成字幕、识别精彩片段、一键去口水话等。同时支持专业的时间轴手动编辑和视频导出。 必须先用 Firecrawl 联网搜索主流视频剪辑工具(如剪映、CapCut、Descript)的核心功能和 AI 剪辑特性,了解行业标准的产品设计。开发时用 Context7 查询 FFmpeg.wasm、WaveSurfer.js 等所用库的最新文档。 界面参考 CapCut / Premiere 的布局风格:上方预览区、下方时间轴、左侧素材面板。UI 设计要专业美观,暗色主题。 AI 大模型使用兼容 OpenAI 协议的接口,base_url 为 https://api.deepseek.com/v1,API Key 为 sk-xxx(请替换为你的实际 Key),模型 id 为 deepseek-chat。 开发过程中通过 Loop Engineering 方式推进:搭建完基础框架后先跑通一个最小闭环(视频上传 + 预览 + 基础时间轴),然后逐步补齐 AI 功能和手动编辑功能,每步都自己验证前后端联通性,发现报错立刻修复。 ``` 来看成品效果。 整个界面布局相当专业,左侧素材库、中间是视频预览和时间轴、右侧是属性和设置面板,还做了暗色主题,第一眼看上去确实像个成熟的剪辑软件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6fhpufVUubGApeLg.jpg) 导入一个视频试试。跟正常的剪辑软件一样,可以在时间轴上浏览视频、分割片段、撤销重做,音频波形也能正常显示。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L4FhgPv4gJYnfc2Q.jpg) AI 生成字幕功能也做出来了,不过由于我本地没有部署语音识别服务(ASR),AI 是用模拟数据生成的字幕,内容跟视频是对不上的。如果接入一个真实的语音识别服务,这个功能应该就能正常工作了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/atBmbiOWUROvQO7z.jpg) AI 识别精彩片段功能也一样,能看到界面上标记了高光时刻,支持预览和直接添加为片段,但由于缺少语音识别服务,识别出来的内容并不准确。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6RK8lCoHwmaCqFFP.jpg) 口水话检测功能做得很用心,可以自动识别各类语气词,列出来之后支持一键删除选中的部分。这个功能的前端交互是完全没问题的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZG1iy8JV8A30m5sV.jpg) 剪辑完的视频也可以正常导出,支持服务端 FFmpeg 和浏览器端 FFmpeg.wasm 两种导出方式,甚至还支持软字幕。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/cX3wp8a3IcvwEquw.jpg) 虽然 AI 字幕和精彩片段这些功能因为缺少语音识别服务没法真正跑通,但整个产品的前端界面布局和后端核心业务流程都是完整的。 只要接入一个语音识别 API,再让 AI 调试一轮,这些功能应该就都能用了。作为一轮提示词做出来的 demo,这个完成度我是很满意的。 ## 我的感受 3 个项目全部跑完了,聊聊我的真实感受。 Fable 5.1 给我最大的感觉是 **又强又稳**。我测试的三个项目涵盖了 3D 游戏、全栈 Web IDE、多媒体处理三个完全不同的方向,每个都一次跑通、直接能用,没有遇到启动报错或者核心功能跑不通的情况。 而且 Fable 5.1 特别擅长自己给自己加活儿。3D 游戏那个项目我只说了「复刻黑神话悟空的核心玩法」,它自己搜索了游戏机制资料之后,搞出了四段连招、蓄力棍势、定身术、身外身、狂牛变身这一整套技能系统。Cursor 复刻那个项目,我也没提过要做 20 步限制保护,它自己加上去的。 **你能感觉到 Fable 5.1 没有应付作业,而是在努力做出一个可以交付的成品。** 从 Kimi K3 到 Opus 5 再到 Fable 5.1,同一个 Cursor 复刻任务的效果一路在提升,能明显感受到模型能力的进步。 不过,贵也是真的贵…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eOGb1SD63cGdz5K5.jpg) 这 3 个项目的 Fable 5.1 消耗加起来大约 $63,算上调度用到的 Opus 零碎开销,总共花了约 $66,折合人民币将近 470 块。平均每个项目 150 多块,跑完这轮测评,把我一个月的鸡腿钱都干没了。 还记得么,之前我用 Claude Opus 5 跑 7 个项目花了 900 多块,这次 3 个项目就快 500 了。虽然官方说缓存便宜了 75%,但 Fable 5.1 本身太能想、太能写了,token 消耗量摆在那里,省下的缓存钱又被额外的 token 给填回去了。 所以我的建议是,如果你做复杂任务时想追求更好的效果,用 Claude Opus 5 就足够了,价格只有 Fable 5.1 的一半,效果也很能打。只有当你需要处理真正复杂的长程任务时,比如大型项目重构、跨多个服务的架构调整、搭建和优化完整的工作流,才使用 Fable 5.1。千万别拿它来写个简单的增删改查,那是纯烧钱。 抛去这些顶级国外模型,其实大多数的日常任务,使用国产的 Kimi K3 和 GLM-5.3、或者 DeepSeek 就足够了,编程能力在线、成本只有 Claude 的几分之一。 ## Fable 5.1 提示词泄露 最后再提个有趣的事情,Claude Fable 5.1 发布才几个小时,系统提示词就被越狱大神 Pliny the Liberator 扒出来了。 足足超过 27.5 万字符,包含了全部 46 个工具的 JSON 架构和各种内部行为规则,感兴趣的同学可以去 GitHub 仓库围观。 > 开源指路:https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/Claude-Fable-5.1.md ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UeiNsm81o0tpYTfe.jpg) OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/yloxVqEt7qYniHFr.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你觉得 Claude Fable 5.1 怎么样?你现在主力用的是哪个模型?

又一个 AI 新项目完结,用 DeepSeek 搞了个 PPT 生成器!

大家好,我是程序员鱼皮。 又经过了一段时间的爆肝,我在编程导航的保姆级新项目教程《AI 智能 PPT 生成器》,完结啦! 这是一套以 **AI 工程化 + 工作流 + 异步任务编排** 为核心的全栈项目教程,基于 Python FastAPI + LangChain + LangGraph + React 开发。用户只需要输入一句主题、粘贴一段长文本,或者上传一份文档,就能先得到一份可修改的 PPT 大纲,然后并发生成完整页面,最终导出原生可编辑的 PPTX 文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hqBDPTxXmVH0BvkE.jpg) 每一期文字教程都详细讲解了设计决策和实现细节,让你不只会做,还知道为什么这么做。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/G06LawjINLdA8JGv.jpg) 这还不够,每个项目我都写了详细的简历写法和面试题解,做完项目直接写到简历上、突击面试,一条龙服务! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iQAORGZyr0SXRlox.jpg) 真心换真心,我做项目教程的付出也得到了大家的认可,也帮很多同学拿到了大厂 offer~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Milbv9Cg18M3PO8Q.jpg) 接下来鱼皮给大家快速介绍这个项目,希望让更多需要它的同学看到,把它变成自己的项目。 秋招正处于黄金时段,简历上写满前沿技术,不仅求职有底气,做项目的能力也会大幅提升! 而且为了让更多同学参与学习,我直接把所有代码 **完整开源**!能力强的同学可以自学,点个 star 就算对鱼皮的支持啦~ > 开源仓库:[https://github.com/yuyuanweb/ai-ppt-generator](https://github.com/yuyuanweb/ai-ppt-generator) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8xHURD9LeIFZtF8M.jpg) ## 项目介绍 项目有 4 大核心能力。 1)多种输入方式,自动生成大纲 项目支持从主题、长文本和文档三种入口创建 PPT,用户可以自由控制页数、排版模式、文字量、语气和目标受众。系统不会跳过用户直接生成最终页面,而是先生成一份结构化的大纲,包括每页的标题、页面目标和核心要点,你可以随意修改内容、增删页面、调整顺序,确认满意后再开始生成。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hPrfcyQLLW0UQNDT.jpg) 2)异步并发生成,实时推送进度 一份 10 页的 PPT 如果串行调用模型,很容易让用户等上一分钟以上。项目把每一页拆成独立的任务,通过 ARQ Worker 并发执行,用 Redis 保存任务状态并传递事件,前端通过 SSE 实时接收生成进度。 生成过程中,已经完成的页面可以立即预览,失败的页面可以单独重试,用户也可以随时软取消剩余任务,不需要整份重来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Xs1Arthgzs2j2KBa.jpg) 3)功能完善的在线编辑器 生成完成后进入在线编辑器,左侧是页面缩略图,中间是 16:9 的画布区域,右侧提供 AI 修改、主题切换、版式选择和图片管理四个面板。 文字内容支持直接编辑,灵活排版的页面可以拖动分隔线调整内容块尺寸,也支持跨容器移动和更换排布方式。切换主题后,Web 预览和 PPTX 导出会读取同一份主题数据,保证效果完全一致。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OdjU86oxVuJgifbv.jpg) 4)原生可编辑的 PPTX 导出 AI 输出的文字长度不可预测,直接导出很容易出现文字溢出、缺页或整页被渲染成图片的问题。项目在导出前会自动检查结构、文字占用、数字来源和页面边界,将问题分成 error 和 warning 两个级别,error 会阻断导出,warning 则提醒用户核对但允许继续。 通过检查后,后端用 python-pptx 逐块构造文本框、表格、图表和图片,再回读生成的文件进行验证。最终得到的 PPTX 不是一张铺满全页的截图,而是每个元素都能继续修改的原生对象。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IFFXL8gw1bIiHa5B.jpg) 学会这个项目后,你不仅能做出一个 AI 智能 PPT 工具,还能完整解释它为什么这样设计、哪里容易失败,以及怎样把一个模型 Demo 做成可持续运行的工程项目。这些经验可以复用到任何 AI 全栈项目中,绝对让你收获满满! ## 项目收获 本项目选题新颖,紧跟 AI 工程化时代,以 **实用工具 + 完整工程** 为导向。区别于增删改查的烂大街项目,这套教程讲解的是一个经过市场验证的完整项目,重点不是带你照着代码从零敲一遍,而是把每个关键决策背后的动机、替代方案和踩坑讲清楚,快速给你的简历和求职大幅增加竞争力! 项目内容精炼,**不到一周就能学完**,帮你成为 AI 时代企业的香饽饽,给你的简历和求职大幅增加竞争力! Python 后端 + LangChain + LangGraph + React + 企业级 AI 应用开发,技术丰富,学完后在 AI 工程化、异步编排、文档渲染、前端编辑器、工程质量 5 个方向都能获得完整实践。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c7bbDVcfc3Kt5Bhe.jpg) 鱼皮给大家讲的是 **完整的 AI 工程化实践和从模型调用到产品交付的全流程**,从这个项目中你可以学到: + 如何基于 LangChain 实现 AI 结构化输出,保证模型输出始终可用? + 如何基于 LangGraph 构建自纠环工作流,系统性提升单页生成质量? + 如何设计 AI 工具调用机制,让模型快速修改页面? + 如何使用 ARQ 实现页级并发生成,控制模型调用频率? + 如何通过 Redis + SSE 实现实时进度推送和断线重连恢复? + 如何设计内容、布局、主题三分离的数据模型,让 Web 和 PPTX 同源渲染? + 如何构造原生可编辑的 PPTX,处理中文字体和 emoji? + 如何实现结构化编辑器,保证光标稳定? + 如何通过乐观锁 + 按页串行保存队列处理编辑冲突? + 如何实现字形级文字溢出检测和分级门禁? + 如何快速生成前端 TypeScript 类型,消灭前后端接口不一致? + 如何实现 PPT 灵活排版,并保证前后端求解器双端一致? 此外,还能学会很多 AI 工程化、系统架构设计、技术方案对比的方法,提升排查问题、自主解决 Bug 的能力。每一期还附带了项目的扩展方向,有能力的同学可以进一步拉开和别人的区分度,无限进步! 满满的项目正反馈: ![编程导航 26 年报喜](https://pic.code-nav.cn/post_picture/1601072287388278786/iVW731qBweZCyMqs.jpg) 除视频教程外,鱼皮编程导航的项目还提供: | 教程资料 | 求职助力 | | ---------------------------- | ------------------------------ | | 详细的文字教程 / 直播笔记 | ⭐️ 现成的简历写法,直接写满简历 | | 完整的项目源码 | ⭐️ 项目相关面试题解和真实面经 | | 1 对 1 答疑解惑 + 专属交流群 | ⭐️ 项目扩展思路,拉开区分度 | | 前端 + Java 后端万用项目模板 | ⭐️ 从学项目到拿 Offer 一条龙 | ![](https://pic.code-nav.cn/post_picture/1601072287388278786/EsluyvVZl7wcUS8Q.jpg) 下面是更多关于本项目的介绍。 ## 更多介绍 该项目功能完整,涵盖用户项目管理、输入解析、大纲生成、页面生成、在线编辑、主题布局、图片管线、导出质量检查 8 大模块。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ErR8GGp5fh2dkCg5.jpg) 本项目采用前后端分离 + 异步 Worker 架构。前端是 React + TypeScript SPA,后端是 FastAPI + ARQ Worker 服务,通过 REST API + SSE 通信。 后端内部按照 API 层、领域层、工作流层、渲染层分层,耗时的 AI 任务通过 ARQ 异步队列和 Redis pub/sub 来管理。内容、布局、主题三种数据通过 `shared/` 目录下的 JSON 文件前后端物理共享。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mVh3XuzP46odR5yw.jpg) 项目的核心业务流程非常清晰,能够帮你理清 AI 工程化项目的开发思路。整个流程从注册登录开始,经过创建项目、输入主题或材料、生成并确认大纲、并发生成页面、在线编辑、质量检查,最终导出 PPTX 文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xjoiZ3GkmXDlQJhg.jpg) 不得不说,做项目真的给了很多同学坚持学习的目标、也有了更多拿 Offer 的机会,大家的动力也更足了! 学起来,冲冲冲!

下载 APP