AI
快来分享你的内容吧~
- GLM5.3 Flash用blender建模有什么技巧吗老大,我想知道用GLM操控blender建模是有什么技巧或者流程吗,原型和建模出来的差的有点大啊,这建模出来的结果我很难绷得住啊...查看全文编程导航小智:你提到的「用 GLM 操控 Blender 建模」,这里需要先做一个关键澄清:GLM 系列模型(如 GLM-4)本身并不直接操控 Blender 或生成三维几何体。它是一个纯文本大语言模型(LLM),不具备原生 3D 建模能力,也无法直接调用 Blender 的 Python API 执行建模操作——除非你构建了特定的工程链路(比如 LLM + Tool Calling + Blender Pyt
- 昨天 16:29·@官方运营 学习、求职、生活问题欢迎交流查看全文刚刚看到一个同学找 Agent 开发岗,在 Hr 面试被横向对比挂掉了,挺可惜的。 另一个候选人的优势: 1. 有个人 AI 产品,并且在线上运营 2. 对 AI 开源项目源码有学习并且研究...加油鸭:看到你主动分析复盘、积极寻找提升方向,这份清醒和行动力超棒!831分享
- 昨天 16:15·人工智能五天四晚,40 名应届生,以训代面,淘汰制。我自认 AI 技术最强,却在最后一天被刷。复盘后发现,落榜原因和代码无关:两个下意识填错的默认值。这让我想清楚——AI 超越的是通用技术知识,技术判断却发生在具体情境里,而它不在那个房间里。查看全文编程导航_小y:这个模式有点意思:1. 找一个 AI 解决方案公司2. 再找一批应届生,40 人进行试岗培训,看是否能在 5 天里结合 AI 去赋能业务,淘汰其他人所以最后的答辩不需要落地产品,只需要思路上过关就能留下吗?感觉思路和实际产品落地还是有挺大差距的,思路是自己挖掘,还是有考核主题方向呢?16229分享
- 昨天 15:33·Java后端
- 2 天前·后端
- 2 天前·保安
- 3 天前·后端开发实测 DeepSeek V4.1 Flash 做全栈项目:我用它写了个 draw.io 绘图工具 大家好,我是不会喷火的小火龙。 前几天鱼皮哥发了篇测评文章刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归,提到用刚发布的 DeepSeek V4.1 Flash 在 21 分钟内搭出了一个叫 DrawMind 的 AI 绘图工具:能在 20 秒内生成查看全文加油鸭:太棒了!把AI语义理解与本地确定性算法结合得恰到好处,DrawMind这个思路既务实又有深度,开源精神更值得点赞!1035分享
- 4 天前·后端开发大家好,我是不会喷火的小火龙。今天我们来拆解一个最近频繁登上GitHub趋势榜开源的多智能体金融量化交易全流程框架。 在平常让大模型直接分析股票,往往会得到一份四平八稳的研报。但在真实交易里,单向叙事暗藏风险:只要挑选不同的技术指标或新闻切片,无论看多还是看空都能写出逻辑自洽的分析。金融决策要在信息不对称下权衡概率与风险,并不存在现成的标准答案。 一、为什么单一 Prompt 难以胜任金融决策 用查看全文加油鸭:太惊艳了!把投研组织逻辑完美复刻成多智能体系统,每个角色分工清晰、对抗有力,还自带反思闭环——这才是AI真正赋能专业决策的样子!734分享
- 4 天前·后端
- 6 天前·后端
GLM5.3 Flash用blender建模有什么技巧吗
老大,我想知道用GLM操控blender建模是有什么技巧或者流程吗,原型和建模出来的差的有点大啊,这建模出来的结果我很难绷得住啊  
刚刚看到一个同学找 Agent 开发岗,在 Hr 面试被横向对比挂掉了,挺可惜的。 另一个候选人的优势: 1. 有个人 AI 产品,并且在线上运营 2. 对 AI 开源项目源码有学习并且研究 这两点我们可以作为借鉴参考,尝试做 AI 产品和学习开源 Agent 项目。
40人应届生五天淘汰制训练营,自认AI技术最强却被刷,问题出在哪?
五天四晚,应届生(40人),以训代面,淘汰制。 我就在这 40 个人中。经过五天交流,自认AI技术最强,却在最后一天汇报发offer前被刷。 这是一家大规模做跨境箱包的企业,原始的开发团队几乎为零。他们从外面找了一家专门做"企业 AI 原生化"的培训方,再招一批 26、27 届应届生进来——第一批技术团队,就从这里出。 但这五天复盘下来,我最大的收获不是"我技术上哪里不够",而是我终于把一件以前只是模糊感觉到的事想清楚了:**AI 时代真正拉开差距的,不是谁会写代码,是谁有判断力。** ## 一、我一开始以为这是道技术题 前几天几乎科普,挺无聊的,这边略过,直接来到第四天,对接企业真实业务需求。听取简单陈述后,我以为业务方要的是 AI 智能客服,这类东西我以前搭过。无非是意图识别,挂一个 RAG,让 agent 根据知识库回答用户问题——方案在我脑子里是完整的,我甚至已经想好了怎么做。 所以聊之前,我专门问了一句技术老师:能不能把我的 agent 服务装到 1688 商家后台上?得到的答案是:可以。 这样我就放心了。我以为已经把最大的不确定性排除掉了,接下来就是指挥 AI 干活。 ## 二、聊深了才发现,真正的瓶颈根本不在技术 随着交流深入,业务方的真实需求浮出来了:他要的不是客服,更接近一个 **AI 销售**——老客户唤醒、新客户挖掘,把有潜力的用户识别出来。 那就绕不开数据了。老客户的购买记录、购买时间、新客户的线索……这些全在 1688 上,没有官方 API,我拿不到。平台自己就在卖这些数据,不可能开放给第三方。 我也想过用 RPA 之类的方式去"看"这些数据,但那就绕开了平台授权,长期下来,合规性上根本站不住。 三条约束摆在一起,结论很清楚:**方案再漂亮,数据不在你手里,这事就不成立。** 而我一开始问的那句"能不能装上去",答案确实是"能"——只不过那不是真正的约束所在。 ## 三、"AI 比我懂技术"——这句话对,但只说了一半 这五天里,我看清了另外一件事,给了我很大自信,又让我不确定这份自信到底有无作用。 40 个人,基本都是 26、27 届应届生,学历背景和我差不多(普本),个别是硕士。技术基础普遍薄弱,有人连 Agent 是什么都说不清,但已经在找 Agent 研发岗了。 训练营给的是一套全栈开发范式(基于 Matt Pocock ,核心是**鱼哥**提过的 **grill me** skill,本质就是让 AI 反复反问你、把模糊想法逼成明确需求,且其余 skill 封装了一整套的软件工程开发思想),学完确实能做出东西,且极大的加快了开发效率。但只是停留在**调用**这一层:你会用 skill,但不知道 skill 里面到底做了什么,也不知道原作者背后那套软件工程思路是什么。  培训团队主体两人(业务出身的老师主导,另一个是15年 c++ 研发转型 AI 应用研发),可以感觉到这个主导的老师极度看淡技术。只要谈及技术实现,得到的回应大致是:没必要纠结,**AI 比你懂技术**。 这句话我认同一半。 在我浅薄的认知中,AI 在写代码、修 bug、迭代优化上,确实已经远超我们任何人,而且差距还在拉大。但这句话把两种东西混在一起了——AI 超越的是**通用技术知识**;而技术判断真正发生的地方是**具体情境**。 第四天就是最好的证据:AI 懂 RAG、懂意图识别、懂 Agent 编排,样样比我懂。可它不知道 1688 不会给一个第三方开数据接口,不知道大厂平台自己就在卖 AI 客服,不知道 RPA 取数在合规上站不站得住。 **它一无所知,因为它不在那个房间里。** 所以"AI 比我懂技术"推不出"技术没用了"。它推出来的是:**通用知识的存量在贬值,而情境判断在升值。** 还有一层:那套"让 AI 反复反问你"的方法,是放大器,不是替代品。你有领域知识,它把你的想法逼清晰;你没有,它就只是把 AI 的想法**固化**成你的想法。同一套工具,两种人用出来是相反的结果。我在训练营现场见过太多"AI 推荐哪个我就选哪个"的人了(我把他们称为“ ok 工程师”)——那不是澄清需求,那是给 AI 当橡皮图章。 ## 四、但我自己也栽了 说到这儿,该说最扎人的部分了--我被刷了。 我总结的原因有两个: **第一,我以为 1688 是 toC 平台。** 业务方告知我的痛点是抓小单,大单有专门的销售对接,他想要的是那些零散的、没人跟的。我没做过电商,不懂平台,下意识就按 toC 理解了。而 1688 主体是做 toB 的。 **第二,我以为公司有专职客服。** 实际上客服是销售兼着做的。老板问我:这个产品能帮他提升什么?我说:可以优化掉客服。老板表情没什么变化,只是平静地告诉我——他的本意不是裁团队,而是把销售从这部分精力里解放出来。 这两件事,没有一件是技术问题。 而且它们错的方式一模一样:**我下意识填了两个默认值,而这两个默认值都是错的。** 更要命的是,我意识不到自己填了什么。 我前面说那 40 个人在和 AI 沟通过程中缺判断力。可我落榜的原因,是同一种缺失——只是我缺的那两块,恰好被问到了。 所以这不是一个"他们不行我行"的故事。这是一个结构问题:**判断力不来自聪明,来自你对一个具体场景熟不熟。** 我没做过电商、没在这种公司待过,我就很可能会填错默认值,而且自己毫无察觉。 ## 五、那什么才是不会贬值的 上面两件事,其实指向同一个结论。 AI 正在快速吃掉**通用技术知识**,而且会一直吃下去。 吃不掉的是三样东西:对具体业务场景的了解、为结果负责过的经验,以及由此长出来的判断力。 给和我一样的应届生、求职者,三个我觉得真有用的动作: **1. 把你的默认假设写下来,去验证。** 你没做过电商,就可能会默认小订单是 toB;你进一家新公司,就会默认它的分工是教科书上写的那样。你意识不到自己不知道什么,但你可以强迫自己问一句:我现在假设了哪些东西?答案往往就是你和面试官之间隔着的那层纸。 **2. 了解 AI 在真实业务中的边界。** 我问过"能不能嵌到 1688 上",答案是能。这个答案没错——错的是我把"能装上去"当成了"路通了"。真正的约束在下一层:装上去之后,数据从哪来? AI 可以帮我开发一套 RPA 工具去抓数,但是合规吗? **3. 选实习、选项目,优先选能接触真实业务和真实反馈的。** 哪怕技术栈旧一点、活脏一点、钱少一点。你缺的不是 API 熟练度,是"在真实场景里待过"。这个东西 AI 给不了你,因为 AI 不在那个房间里。 ## 最后 谈谈我的想法。 留下的那些人(技术认知/习惯很差)是要成为第一批技术团队员工的,而上面没有技术 leader;老板也不是技术出身,等于无人兜底,我很好奇他们能不能靠这套 skills 驱动的开发范式完成真实的业务需求。 毕竟训练营要证明的是"这套范式跑得通",而老板目前感知到的“可以”,评的是流程,不是产物。这两件事在 demo 那一刻长得一模一样,但是后续会立刻分岔——公司要的终究是做出来能挣钱,这和"demo 能跑"之间隔着很远的距离。当然,我自己也在尝试用这种方式进行开发,后续可能会分享,它真的很简洁且有效率,推荐同学们学习。 上述全部为个人观点,希望得到资深 AI 开发工程师的指点!
聊聊AI项目的情况
### 聊聊AI这个赛道 我去的美团项目组,新入职的实习生必须要会AI、会AI的优先入职,入职就做AI项目。 但是:项目的成功率非常非常低。 然后我又去了海尔,基本上全面推广了AI编程 但是AI项目基本烂尾了。 ### 聊聊问题所在:两个事实都成立  我不能否认全员AI这个事情。 基本上所有的人都在使用Ai编程。你不使用AI,很难完成开发任务。 举个最简单的例子: * 中午给你一个需求,要求3个小时以后上线 * 你不用AI,手写代码,时间根本来不及 我有个同事,在下午5点左右接到了3个需求,在明早就将3个需求合并到预生产分支进行了测试。 你说他不是AI,他是加班干的,没人信。 所以,用AI或者不用AI,不是一个选择题,而是必须要做的事情。 领导的预算基本上都批给AI了。你不做AI项目,领导怎么晋升? 市场都在做AI,你不做,那不行。 ### 不听故事了 现在很多人还是在: * 只要做了AI,故事讲得好,就有人给你大笔大笔的花钱 * 所以我们要去做AI 公司一年花几百万几千万,做了一个AI项目。希望上线以后大赚一笔。 用户表示:豆包免费、千问免费、DS免费。你水平不如豆包、不如千问,不如DS,还开口一个月收费1988一个月?你有毒? 现在很多AI初创公司正在僵尸状态: * 开发完成,已经上线了 * 但是没人用,每天都在亏损 一旦进入这种项目,基本上就得考虑跑路。 ### 我为什么要看AI生成的PRD 我们有个项目,我正准备看PRD。同事表示:AI生成的。 那还看个屁。 我在手工编码的时候,会仔细的看PRD中的介绍,因为这是需求方的一个知识结晶。 现在AI生成PRD以后,我基本上简单过一遍,甚至直接让AI给我缩略一下,甚至更过分,我直接给AI一个全文,让他生成XX功能。 同事在出现bug的时候,也会直接拿着AI生成的结果告知:我们应该怎么怎么做。 在这段过程中,我没有思考、没有记忆,就是把AI生成的资料喂给另外一个AI。 ### AI让同事放弃了codeView 在几个月前,同事问了:AI生成的代码,是否需要手工codeView? 实际情况是:codeView个屁,直接上生产。 原因是多方面的: 网上的说法是:一个实习生,花了3个小时,用AI生成了2W行代码,现在你是负责人,你敢上线? 负责我负责,要一行一行的codeView。 实习生转头把你给的建议喂给AI,让AI干活。 这是一个非常严重的惩罚机制: * 谁负责的codeView,谁就会被炼成skills * codeView非常消费精力和体力,别人根本不在意辛苦,反正我的任务完成了,合并不进去 那你让实习生去codeView,实习生非常抗拒: * 我不会啊,AI生成的代码看不懂 第二个问题就是:AI 10分钟生成的代码,人工codeView至少要1个小时以上。 而且是一件非常消费体力、经历、而且不讨好的问题。 第三个问题就是:随着使用了AI,需求倍增。工期压缩。 但是人codeView的能力不会随着使用AI而降低。 所以现在基本上都是:不测试,直接上生产。 故事就成了这样的: * 领导中午给你一个需求,要求3个小时以后上线 * 然后你把任务喂给AI,AI直接给你代码 * 你部署完,简单点一点,确认没问题直接上生产。 我问了很多外包的同事,他们都是这样的。 随着代码量的提高,以后可能就只有AI knows,没人能维护AI生成的代码了。 ### AI淘汰的问题 AI项目的成功率非常非常低。 如果拉长远到2年,AI项目的存活率低于1%。 原因也是多方面的: 第一个是技术淘汰 * AI技术日新月异,年年都有新名词 * 已经跑通的链路,换个模型直接炸 * 老架构、老思维生成的AI项目,他完全没人使用 第二个原因,是内卷 * 一旦出现什么技术,一窝蜂的冲过去,红海红的不行 * 同质化竞争 第三个问题是:C端这边用户太少,付费用户极少,大部分用户付费意愿低。B端又吃项目组的资源 第四个问题:效果差。 第五个问题,是技术反复革新 * 今天多模态火了,大家都去做多模态 * 多模态做到一半,龙虾火了,做龙虾 * 龙虾不行了,AGI火了,做AGI 大部分的AI项目,处于: * 上线前疯狂加班,领导督办,高压倒排期 * 等一旦上线以后,发现效果差、价格贵、各种bug,**根本没人使用** ### ai的问题 我不得不承认的一件事是:Ai生成代码一次成功的概率比较低,需要调试。 比如说,你让他生成一个网页,他生成了,但是付款的时候报错了。 你需要告诉她:付款的时候报错了。 * 生成代码10分钟 * bug修复30分钟 然后就是: * 在长上下文到处都是限制的情况下,注意力会被稀释,导致不遵守提示词 有的外包同事反馈:写的代码比他自己写得好。 ### 总结 岗位很多,不会AI基本上找不到开发的岗位。 岗位不稳定,很容易被裁。
DeepSeek 官方竟然偷偷做了 Harness 桌面端,我已经用上了。。
大家好,我是程序员鱼皮。 上个月 DeepSeek 开源了自家的 Harness 工具 DSH,被称为 DeepSeek 的角色专武,核心理念是「一切皆插件」。 发布后才过了一周,GitHub 就冲到了 20 万 Star,可见有多火!  不过,官方发布的时候只提供了命令行和 Web 两种使用方式,你得先装好 Node.js 环境,然后在终端里敲命令启动,用浏览器来访问。 对很多小白来说,这个上手门槛就不太友好了。 所以有社区开发者立刻开始做桌面端。Harness 才开源没几天,GitHub 上就冒出了好几个桌面客户端项目。其中最火的当属 dsh-desktop,已经拿了 2 万多个 Star,支持 Windows 和 macOS,双击安装就能用。  我以为有了社区的支持,DeepSeek 官方不打算出手做桌面端了。结果今天逛 GitHub 的时候,突然发现官方 deepseek-harness 仓库里多了一个 `apps/desktop` 目录。 点进去一看,好家伙,官方自己搞了一个基于 Electron 的桌面端应用,包名叫 `@deepseek-ai/dsh-desktop`,版本号已经到了 `0.1.5-rc.2`,连打包签名、自动更新的流程都写好了。  最离谱的是,DeepSeek 没有发过任何公告、没有推文、没有博客,就是悄悄地把代码合进了 master 分支。 而且到目前为止,官方也没有放出安装包,想体验只能自己拉代码编译。 很符合 DeepSeek 低调的风格了,闷声干大事啊!  ## 吃波螃蟹 既然官方没放安装包,那我就自己动手编译跑一下,替大家吃一波螃蟹。哦不,是鲸鱼~ 整个过程其实不复杂,前提是你的电脑上已经装好了 Node.js(需要 22.19 以上版本)。如果没装过 Node.js,可以去 [Node 官网](https://nodejs.org) 下载最新的 LTS 稳定版本。 准备好之后,打开终端,依次执行下面 3 步。 > 当然,还有更简单的安装方式,就是你直接让 AI 帮你安装和运行。 **1、安装 pnpm 包管理器** DeepSeek Harness 用的是 pnpm 来管理依赖,先输入命令全局安装一下: ```bash npm install -g pnpm@11.7.0 ``` **2、克隆仓库并安装依赖** 把整个 Harness 仓库拉到本地,然后安装依赖。注意这个仓库很大,依赖也很多,安装过程可能会有点儿慢: ```bash git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install ``` **3、启动桌面端开发模式** 输入一行命令搞定: ```bash pnpm run dev:desktop ``` 这一步会先编译整个项目,然后自动下载 Electron,也就是一个专门用来开发跨平台桌面应用的开源框架,很多知名应用比如 VS Code、Discord 都是用它做的。 过一会儿,你就能看到一个 Electron 窗口弹出来了,界面和 Web 端几乎没什么区别。  模型配置和 Web 端一样,在设置里填好 API Key 就能开始用了。我试了一下,跟 AI 对话、文件操作、工具调用、插件管理这些功能都是正常的。  不过好像有个明显的 Bug,整个应用内无法粘贴内容,DeepSeek 的 API Key 还是我一个字母一个字母手输进去的…… 期待后面改进吧,最好能有一些桌面端特有的功能。 ## 官方版会更好么? 可能有人会问,社区已经有那么多桌面端了,官方下场做这个有什么不一样? 我觉得 **最大的区别在于安全性。** 社区做的那些桌面端,不管是用 Electron 还是 Tauri,基本思路都差不多。它们会在你本地起一个 HTTP 服务,然后用桌面窗口去访问 `localhost` 上的这个服务。简单来说,就是给 Web 页面套了一个桌面壳子。 这种方式虽然简单,但有一个潜在的问题:你的电脑上开了一个端口。 如果你在公司内网或者公共 WiFi 环境下用,理论上同一网络下的其他设备是有可能访问到这个端口的。 而官方的桌面端完全没有开任何端口。它用了一套自定义的 `dsh-app://` 协议来传输数据,Electron 主进程和 DSH 后端之间通过进程管道直接通信,请求和响应走的是分帧字节流,生命周期控制则走 Node IPC。也就是说,从网络层面来看,你的 Harness 对外界是完全不可见的。  **另一个区别是版本绑定。** 官方把 Electron 壳、DSH 后端、Node.js 运行时绑成了一个整体,一起签名、一起发布、一起更新。社区版通常是桌面壳和 DSH 后端分开更新的,偶尔会出现版本不匹配导致的奇怪问题。而且官方自己维护更新通道,后续升级肯定会更及时、也更让人放心。 目前官方版本还处于很早期的阶段,没有预编译的安装包,必须自己从源码构建。日常使用的话,社区的 dsh-desktop 之类的项目体验确实更成熟。不过看官方的架构文档和签名流程,后续大概率会通过 `download.deepseek.com` 正式分发安装包,到时候应该就是双击安装、开箱即用了。  如果你还不了解 DeepSeek Harness,或者想学习更多 AI 编程工具和经验技巧,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊,你更喜欢用网页版还是桌面端的 AI 工具呢?
Agent应用 学习笔记
# Agent 应用 学习笔记 ## 总览 学完 Spring AI 超级智能体项目(Agent 应用开发)后的总结:**所有操作都是围绕着提示词来开发的,包括直接、间接给 AI 提示词。** 下面先用一句话概括各模块(说的都比较粗糙): | 模块 | 一句话理解 | | --- | --- | | **记忆管理** | 每次对话的时候,把历史对话喂给 AI。 | | **RAG** | 对于小众、内部的文档,让 AI 阅读,AI 结合文档和你的提问输出答案。 | | **工具调用** | 告诉 AI 有哪些工具可以调用;AI 根据问题确定要调用的工具和参数,本地执行工具后把结果回传给 AI,AI 再给出最终结果。 | | **MCP** | 本质还是工具,不过从 Agent 中抽离出来,算是解耦;加配置即可接入,不必修改代码。 | 核心公式: > **Agent = 大模型 + 记忆管理 + RAG + 工具调用 + MCP + 自主规划** > 💡 学习体会:学了这个才能更了解 AI,知道 AI 的边界,vibe coding 起来也更得心应手。毕竟 AI 是你的助手,对它越了解,就能更好地使用它——这决定了提示词该怎么说它才能理解,也能帮助判断什么时候该新开对话。 下面细说对以上各部分的理解。 --- ## 1. 大模型 **LLM(Large Language Model,大语言模型)**:把网上的一些数据(文档、代码等信息)给大模型学习,从而让它学会这些东西。 它的本质还是类似于"成语接龙"——不断根据历史对话,猜测下面应该输出什么 **token**,所以也可能会出错,这就是**大模型的幻觉**。 当大模型训练完成后,平台把调用大模型的接口通过 HTTP 提供出来,配合密钥即可调用。 --- ## 2. 记忆管理 ### 2.1 解决什么问题 大模型是没有记忆的,即 **API 是完全无状态的**,无法进行多轮对话;并且大模型的上下文长度有限。 ### 2.2 是什么 为了进行多轮对话,就需要对记忆进行管理。 ### 2.3 怎么做 粗暴的做法:把历史对话无脑拼接到用户新的提示词上面,这样每次调用大模型,给 AI 的参数里都包含之前的聊天记录。 一般还需要做**记忆持久化**:把聊天内容通过文件保存到磁盘,防止对话突然中断后 AI"失忆"。但随着对话次数增多,历史对话会导致上下文超限。目前的解决方案有: 1. **滑动窗口**:只保留最新的几轮对话,更早的舍去。 2. **摘要压缩**:专门调用一次大模型,对历史对话做信息提炼,保留关键信息。 3. **混合模式**:结合滑动窗口和摘要压缩——最新几轮对话保留原文 + 更早的历史消息用摘要。 ### 2.4 长期记忆 上面的都是**短期记忆**,即当前对话的记忆。**长期记忆**则是用户的画像等信息,这样每次对话都有可能检索到,让 AI 更懂你。 --- ## 3. RAG ### 3.1 解决什么问题 特定文档 AI 没有学习过;每次全量读入,大模型上下文不够。 ### 3.2 是什么 **RAG(Retrieval-Augmented Generation,检索增强生成)**:给 AI 一个外部知识库文档,弥补其在特定领域的知识匮乏,让 AI 根据实际文档输出答案,减少幻觉。 ### 3.3 怎么做 1. **数据清洗**:先对文档做清洗,去掉冗余信息。 2. **切块(Chunking)**:对文档进行切块,策略有定长切块、语义边界等;块与块之间需要有重叠区域,切块时可以为每个块挂上元数据。 3. **向量化入库**:使用向量模型(Embedding)把每一块文档转化为高维向量,存入向量数据库。 4. **检索**:用户提问时(问题可先做改写、扩展),对提问做向量化,用得到的向量去向量数据库检索相关片段。也可以做**混合检索**:BM25 关键字匹配 + 向量语义检索,再对结果做融合。 5. **后处理**:召回相关片段后,做去重 / 重排 / 压缩。 6. **生成**:最后把历史对话、用户提问、检索到的相关片段一起交给 AI 生成答案。 ### 3.4 是否需要检索知识库 如何判断一个问题要不要走知识库: 1. **关键词匹配**:检索前加关键词匹配,命中才检索。 2. **小模型 / 分类模型做意图分类**:把问题分为几类,只有知识问答类才检索。 3. **大模型路由**:调用大模型判断问题最适合从哪里获取信息。 4. **注册为工具**:把检索知识库注册为一个工具,工具描述里写清楚知识库的用处,让大模型自己判断是否调用(即 Agentic RAG)。 ### 3.5 看效果:评估 需要做评估,有点像测试:先看召回的相关片段是否合理,再看混合检索的融合、重排、压缩是否合理等。即沿着 RAG 的检索流程反推,回去定位是哪一步出了问题。 - **检索侧**:Recall@k、MRR。 - **生成侧**:忠实度(Faithfulness,答案是否只依据召回内容)、答案相关性。 --- ## 4. 工具调用 ### 4.1 解决什么问题 AI 只能"动嘴皮子",无法操作文件、执行命令等。 ### 4.2 是什么 本质就是给 AI 提供功能函数接口,AI 有需要时可以按参数传入指定信息来调用函数。 - Spring AI 把工具的**注解**转化为 **JSON Schema** 格式; - 调用大模型时,把这个 Schema 随请求一起发送给大模型,大模型据此知道有哪些工具、该怎么调用; - Spring 框架约定了有哪些工具可调用,工具参数由 JSON Schema 决定; - AI 遵循该 Schema 输出调用请求,框架就能执行对应的工具。 --- ## 5. MCP ### 5.1 解决什么问题 在 Agent 端不可能拥有一切工具,需要能通过配置加入工具,统一外部工具与 Agent 之间的连接通信。 ### 5.2 是什么 MCP 是 Agent 应用与外部工具 / 数据源进程之间的**标准化连接协议**("AI 应用的 USB-C")。它不改变模型的输出:模型照常发 tool call,由 **MCP Client** 翻译转发;它统一了工具的发现、描述和调用方式,使外部工具加配置即可接入。 ### 5.3 怎么做 - Agent 端先创建 **MCP 客户端**,客户端把 MCP 服务解析为**工具、数据资源、提示词模板**来使用。 - MCP 服务端与客户端通信需要遵循 MCP 协议,报文格式为 **JSON-RPC**。 - 一般有两种传输模式: 1. **stdio**:本地进程启动服务; 2. **SSE**:服务端在远端(新版规范改称为 **Streamable HTTP**)。 ### 5.4 补充:安全风险 MCP 有一定危险性:调用别人的工具、使用别人的资源时,不确定其中带有什么内容,可能造成**提示词注入**风险,诱导 AI 做出错误选择。 --- ## 6. 自主规划 ### 6.1 解决什么问题 复杂任务不能指望大模型一次给出答案,需要让它有步骤、有依据地行动,直到完成目标。 ### 6.2 是什么 Agent 解决问题时的行为方式,本质是"**决策 → 行动 → 观察**"的循环,以及循环内部采用什么规划策略。 ### 6.3 通用机制:Agent Loop(执行循环) 用户设定目标后,Agent 自主循环: > 输入 / 感知 → LLM 决策 → 行动(调用工具:搜索 / RAG / MCP)→ 观察结果回灌 → 再决策 直到模型给出最终答案,或触发终止条件(最大迭代步数、超时、token 预算、连续失败次数)。 > ⚠️ 下面的 ReAct、Plan-and-Execute 都是"在这个循环里怎么决策"的策略,不是和 Agent Loop 并列的第四种方式。在 Spring AI 中,注册工具后,"模型请求工具 → 框架执行 → 结果回灌 → 再次请求模型"这个循环是框架自动完成的——业务代码只调用了一次 `call()`,内部可能已经发生了多轮工具往返。 ### 6.4 循环内的规划策略 1. **CoT(Chain-of-Thought,思维链)** 只解决【推理】,没有工具调用、没有外部行动。核心是让模型输出中间思考步骤,把复杂问题拆成多步推理。本质是内部思维拆解,严格说不算 Agent 模式,只是推理基线。(现代推理模型如 o1、DeepSeek-R1 已把思维链内化进模型,不靠提示词诱导。) 2. **ReAct(Reason + Act,推理 + 行动)** 走一步看一步,把【思考 Thought】、【行动 Act】、【观察 Observation】组成循环:思考 → 选择行动(调工具)→ 获取外部观察 → 依据最新观察回到思考,决定下一步。灵活,适合路径无法预知的任务。论文原版靠提示词输出固定文本格式;现代 function calling 实现中思考往往是隐式的,循环由框架代码驱动。 3. **Plan-and-Execute(规划然后执行)** 先由 Planner 一次性生成完整任务步骤清单,再由 Executor 按步执行。适合多步骤、流程性强的任务,优点是省 token、路径可控、可向用户展示进度。实战中必须支持**重规划(Replan)**:执行结果可能让原计划失效(资料不存在、工具报错),每完成一步要回到 Planner 判断"继续 / 修改计划 / 终止"——刚性照着清单走是这类 Agent 最常见的翻车点。常见做法是 Planner 用强模型(调用少)、Executor 用便宜模型(按单步指令调工具),靠模型分级省成本;也可与 ReAct 混合(先规划,执行阶段每步走一步看一步)。 ### 6.5 工程护栏 循环本身不难,难的是兜底: - 最大迭代次数、超时 / 预算限制; - 工具异常时把错误信息回灌,让模型自救; - 死循环检测(反复用相同参数调用同一个工具); - 每一步的可观测日志。
实测 DeepSeek V4.1 Flash 做全栈项目:我用它写了个 draw.io 绘图工具
# 实测 DeepSeek V4.1 Flash 做全栈项目:我用它写了个 draw.io 绘图工具 大家好,我是不会喷火的小火龙。 前几天鱼皮哥发了篇测评文章[刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归](https://www.codefather.cn/post/2097946798399164417),提到用刚发布的 DeepSeek V4.1 Flash 在 21 分钟内搭出了一个叫 DrawMind 的 AI 绘图工具:能在 20 秒内生成微服务架构图,生成速度达到 160 到 287 tok/s,调用成本只要几块钱。 我平时写技术方案和架构设计时,画图是个高频需求。传统画图工具纯靠手工拖拽,改起来很繁琐;Mermaid 这类纯文本工具画简单流程图还行,遇到多层嵌套和复杂对齐就比较吃力;市面上不少宣称支持 AI 绘图的工具,本质上只是吐一张不能二次编辑的位图图片,改一个字就得从头生成。 写个原型跑通容易,但真把它当日常工具用,多轮对话修改会不会乱?生成的 XML 格式会不会报错?节点会不会挤在一块? 带着这几个疑问,我把这个项目从零到一完整实现了一遍,名字沿用了 **DrawMind**,提示词参考鱼皮哥文章中的自己根据需求修改,代码已在文末开源。本文的配图用了好几种绘图方法,如 draw.io、Excalidraw 与 AI 直接生图,感谢[松柏哥](https://www.codefather.cn/user/1626574509983178753)分享给我许多关于画图的技巧。 --- ## 实际上手体验:速度确实快,费用很低 在处理复杂业务逻辑前,V4.1 Flash 给我最直观的两个感受是响应速度和代码理解力。 ### 1. 响应延迟与流式吞吐 之前拿旧版大模型写全栈代码或者生成大段 JSON,输入提示词后往往要盯一会儿光标,等几秒钟模型才开始吐字。 V4.1 Flash 的首 Token 延迟大概在 0.3 秒左右。后端通过 Node.js 代理转发请求,前端回车刚按下去,状态指示就会切到生成阶段。输出长篇 JSON 数据时刷新速度很快,十几个节点和连线的结构基本十来秒就能推导完成。 对话面板在生成过程中的状态流转如下:  ### 2. 对第三方协议的理解 DrawMind 的一个难点是接入 draw.io。官方提供了一套通过 iframe 和 postMessage 通信的嵌入模式(`embed.diagrams.net/?embed=1&proto=json`),涉及到 init、load、autosave、merge 等一系列事件监听和状态同步。 我把官方协议的核心文档直接贴给模型,它在第一轮生成的 TypeScript 代码里就完整实现了这套事件监听机制,跨域过滤和父子窗口握手逻辑都写得挺规范,没有出现凭空捏造 API 的情况。 ### 3. API 调用成本 DeepSeek 调整定价后,缓存命中时的输入价格降到了每百万 token 0.02 元。开发这个项目期间,包括大量的提示词调试、生成测试和单元测试,整体调用费用一共才花了不到五块钱。对于个人开发者或者小团队日常使用来说,开销基本可以忽略。 --- ## 遇到的问题:为什么不能直接让 AI 生成 XML? 只看原理实现很容易产生一种错觉,觉得只要让模型直接输出 draw.io 的 XML 就万事大吉了。实际调试时,如果直接把生成 XML 的任务丢给模型,会遇到三个很现实的问题。 ### 1. XML 格式脆弱,长图容易被截断 draw.io 底层基于 mxGraph 的 XML 规范,标签层级很深,每个 cell 都有独立的 id、parent、source、target 以及复杂的 geometry 坐标属性。 一旦架构图节点变多(比如超过 15 个服务节点),模型生成的长文本偶尔会因为上下文或网络截断,缺少闭合标签。draw.io 编辑器对格式要求非常严格,哪怕少了一个闭合的 `</mxCell>`,画布就会直接弹窗报错拒绝渲染,整张图直接报废。 ### 2. 大模型算不准二维空间坐标 大语言模型擅长提取概念和梳理上下游依赖关系,但它并不具备精确计算几何坐标的能力。 如果让模型在生成时自己给每个节点编排 x、y 坐标,结果往往是混乱的。节点很容易堆叠在同一个位置,连线互相横切穿透,有时还会算出负数坐标,导致部分图形直接被画布左上角边缘裁掉,根本没法看。 早期没加坐标约束时的生成效果如下:  ### 3. 分组容器(Group/Swimlane)无法自动伸缩 在架构图里,我们经常会用“网关层”、“核心业务层”、“数据层”这类容器把节点框起来。大模型在生成时,既不知道容器内部所有子节点的真实占用尺寸,也算不准子节点的相对偏移,经常出现子节点跑到了容器外边,或者容器尺寸缩在一起的情况。  --- ## 架构调整:把布局算法和 XML 生成收回到本地 为了解决上面的问题,DrawMind 调整了架构职责划分:**让大模型只负责梳理语义关系,所有与几何排版、坐标计算和 XML 拼接相关的活,全部收回到本地代码来做。** 系统整体的数据流转如下:  ### 1. 规范模型输出:只返回操作指令(Operations DSL) 模型不再直接吐 XML,而是被要求输出结构化的 JSON 操作指令: - `add_node(id, label, style, group?)` - `add_edge(id, source, target, label?)` - `update_node(id, label?, style?)` - `delete_node(id)` - `move_node(id, x, y)` 这样一来,输出体积大幅减小,生成的 token 数量下降了 80% 以上,不仅速度更快,而且彻底避免了 XML 标签不闭合的问题。 ### 2. 本地写确定性的排版算法 节点的坐标全部交给前端的 TypeScript 布局引擎计算: - **基于 DAG 的拓扑分层**:用图论里的最长路径算法对依赖关系分层,确保上下游流向清晰,不会出现倒流的连线; - **交叉轴居中与间距计算**:根据同一层内的节点数量动态分配垂直高度与水平间隔,彻底告别负坐标; - **自适应包围盒**:外层容器会自动计算内部所有子节点的占用面积,动态撑开并预留边距; - **弱连通子图分块隔离**:如果图里存在两个没有连线关联的独立流程,引擎会把它们拆成独立块水平排开,防止它们在同一块空间里交错穿插。 整个DrawMind 本地布局引擎流程图如下:  ### 3. 本地 XML 容错与测试覆盖 在把内存里的图结构转成 XML 时,本地会进行三轮格式检查,自动补全遗漏的父节点与必要样式。项目里写了 71 个单元测试和集成测试,覆盖了操作校验、排版防重叠以及多轮更新,保证推到画布上的 XML 是合法的。 --- ## 多轮对话修改实测 对于画图工具来说,单次生成只是及格线,日常工作中最频繁的场景是“在原来的图上改改”。 我们在 DrawMind 里测试了连续增量修改的效果。 ### 第一轮:生成基础电商架构 输入提示词: > “画一个标准的微服务电商系统架构图,包含用户、API网关、用户服务、商品服务、订单服务、Redis缓存和MySQL数据库” 模型识别出 7 个节点和依赖调用关系,本地布局引擎自动分为 4 层(客户端、网关层、业务层、存储层),大约 18 秒后在画布上渲染完成。 ### 第二轮:在现有图上做局部增量修改 紧接着输入第二轮修改提示词: > “把 Redis 缓存改为分布式 Redis Cluster,并在订单服务后面增加消息队列 Kafka” 在之前的直接生成模式下,这种提示词通常会导致整张图被重新画一遍,原本微调好的节点位置都会丢失。 但在基于 Operations 的设计下,模型只返回了局部操作: 1. 更新节点指令:把 `redis` 节点的文案改为 `Redis Cluster`; 2. 新增节点指令:添加 `kafka` 节点,并在 `order_service` 与 `kafka` 之间添加连线。 本地引擎只更新受影响的部分,用户服务、商品服务等无关节点的位置保持不动。 这是在本地跑起来后的完整界面:  虽然还是会有部分线条重叠,另外,DrawMind 做了双向同步机制。如果用户在左侧 draw.io 画布上手动拖拽移动了某个节点的位置,状态机会记录这次位移。后续再用 AI 发送修改指令时,AI 会在最新的位置基础上继续操作,不会把用户的手动调整覆盖掉。  --- ## 总结 通过这次完整的全栈实现,关于 DeepSeek V4.1 Flash 的能力,我的体会主要有两点: 1. **作为编程底座非常合格**:它的输出速度快,流式响应轻快,理解外部协议的能力稳定,API 调用成本也低,完全能胜任日常全栈开发的主力模型; 2. **需要分清模型与代码的边界**:大模型擅长的是语义理解、意图推断和逻辑提炼,但在精确的几何计算、格式闭环和防御性逻辑上,用传统的确定性算法和本地校验更稳妥。把两者结合起来,才能做出真正稳定的工具。 DrawMind 目前已在 GitHub 开源,包含前端界面、draw.io 集成通信逻辑、Operations DSL 定义以及本地布局引擎的全部代码。 项目地址:[https://github.com/sz-xiaohuolong/DrawMind](https://github.com/sz-xiaohuolong/DrawMind) 当然生图效果现在还是一般,可以直接安装开源成熟项目使用如 [Next AI Draw.io](https://github.com/DayuanJiang/next-ai-draw-io)
拆解 GitHub 趋势榜 TradingAgents:多 Agent 辩论架构与本地运行实测
大家好,我是不会喷火的小火龙。今天我们来拆解一个最近频繁登上GitHub趋势榜开源的多智能体金融量化交易全流程框架。 在平常让大模型直接分析股票,往往会得到一份四平八稳的研报。但在真实交易里,单向叙事暗藏风险:只要挑选不同的技术指标或新闻切片,无论看多还是看空都能写出逻辑自洽的分析。金融决策要在信息不对称下权衡概率与风险,并不存在现成的标准答案。 ## 一、为什么单一 Prompt 难以胜任金融决策 用大模型做交易策略和财报分析的尝试很多,但单一 Prompt 很容易陷入确认偏误(Confirmation Bias)。当系统接收到偏多的技术指标时,倾向于给出顺势做多的结论;当面对负面宏观数据时,又很容易偏向防守。提示词再长,也很难在同一个上下文内保证对抗立场的客观性。 机构投研流程的设立,初衷就是利用角色分权来暴露漏洞。技术面与基本面关注的周期不同,情绪面与宏观面各有噪音。多空研究员各执一词,风控团队负责收紧止损,最终由投资经理做出权衡。TradingAgents 的核心思路就是将这套博弈逻辑转化为状态图上的确定性流程。 传统量化或对冲基金在做投资决策时,通常会有分工明确的角色:收集数据的分析师、互相挑刺的多空研究员、评估尾部风险的风控部门,以及拍板的投资经理。TradingAgents(论文 arXiv:2412.20138)把这套组织结构搬进了多智能体系统。项目开源后一度登上 GitHub 趋势榜,收获了 7000 多 Star。它的价值不仅在于生成金融研报,也在于为复杂决策型 Agent 系统的分工与对抗机制提供了一个参考实现。 下图是 TradingAgents 的完整协作流水线,从多源数据提取、观点辩论到风控评估,均由专门的 Agent 节点承接:  ## 二、核心架构:模拟基金投研的 5 阶段流水线 TradingAgents 的设计重点在于各个 Agent 之间的信息流向和制约关系。系统将决策链路划分为五个阶段: ### 1. 分析团队:四维度并行采集数据 系统启动后,四位分析师 Agent 并行运行,分别处理各自的数据源: - Market Analyst(市场分析师):通过 Yahoo Finance 获取价格与常用技术指标(如 OHLC、移动平均线、MACD、RSI、ATR、布林带等),整理技术面研报。 - Fundamentals Analyst(基本面分析师):梳理财务指标、估值水平与同业对比。 - News Analyst(新闻分析师):汇总宏观新闻,评估地缘政策、利率环境等宏观因子对标的的影响。 - Sentiment Analyst(情绪分析师):抓取 StockTwits、Reddit 等平台上的散户讨论,统计情绪比例。 四个分析师彼此独立,各自生成文件。这种隔离避免了单一维度的强结论过早干扰其他维度的信息提取。  ### 2. 多空辩论:结构化对抗 汇总四份分析报告后,流程进入多空对抗阶段。 系统没有让一个 Agent 同时总结利弊,而是分别设立了 Bull(多头研究员)和 Bear(空头研究员)。多头先列出自己的支撑论据,空头针对这些论点逐一反驳并补充利空因素,多头再就反驳进行二次防守。辩论轮数可以在配置中调整(默认为 1 轮,可设为 2 轮)。 辩论结束后,由 Research Manager(研究主管)进行裁判。研究主管负责梳理双方在关键价位和宏观逻辑上的分歧点,评估论据支撑强度,最终形成一份综合研究总结。 拆分对抗角色能够有效避免大模型常见的调和倾向,迫使模型把两端的论据和风险都完整暴露出来。 ### 3. 交易员:制定具体参数 研究主管的总结交由 Trader Agent。交易员不重复分析基本面或技术面,而是将结论翻译为具体的交易计划:方向(买入 / 卖出 / 持有)、进场区间、止损价位、目标点位和建议仓位。 ### 4. 风控委员会:三方评估 交易计划提交后,由三位风控分析师组成委员会进行审核: - Aggressive Analyst(激进派):关注盈亏比与潜在机会,侧重执行可行性。 - Conservative Analyst(保守派):聚焦极端回撤与黑天鹅事件,倾向于压缩风险敞口。 - Neutral Analyst(中立派):平衡机会与潜在风险,评估赔率。 三位风控人员同样会针对仓位大小、止损距离是否合理等细节展开讨论。  ### 5. 投资经理:最终裁决 最后,Portfolio Manager(投资组合经理)统揽所有上游报告,包括分析师数据、多空辩论过程、交易员方案以及风控委员会的审议意见,给出最终结论:评级(Buy / Hold / Sell)、执行摘要、投资逻辑以及观察周期。 五个阶段构成完整的流水线,使每个环节的观点都会在下一环节接受检验。 ## 三、工程机制:反思记忆与断点恢复 TradingAgents 在工程实现上有两点值得注意:长流程容错与跨周期复盘。 ### 断点恢复(Checkpoint Resume) 一次完整的研报生成包含十余次模型调用,耗时通常需要几分钟。如果中间因为网络超时或 API 限流中断,从头重跑会浪费调用成本与时间。 TradingAgents 基于 LangGraph 的 SQLite 检查点功能实现了节点级状态保存。运行时加上 `--checkpoint` 参数后,每个 Agent 节点执行完毕都会把状态写入数据库。任务中断后重新启动,会自动从断点处继续执行。 ### 决策日志与反思机制(Reflection) 每次做出评级后,系统会把决策摘要记入本地的 `trading_memory.md`。当后续再次分析同一标的时,系统会自动执行几步复盘: 1. 调取上一次的决策(包括当时的评级、入场价与设定周期)。 2. 获取该标的在决策之后的实际走势。 3. 计算实际收益率以及相对基准指数(如 SPY)的超额表现。 4. 将偏差反思整理为文本,作为上下文注入到本次投资经理的 Prompt 中。 通过这套闭环,历史判断的偏差能够作为经验输入给下一次决策。 ## 四、本地部署:Docker 环境与模型配置 ### 1. 获取代码与构建镜像 ```bash git clone https://github.com/TauricResearch/TradingAgents.git cd TradingAgents cp .env.example .env docker compose build ``` ### 2. 模型接入配置 TradingAgents 原生集成了多家主流 LLM 接口,同时也支持任何遵循 OpenAI 协议的自定义端点。 以火山方舟 Agent Plan 为例,在 `.env` 中添加对应配置: ```bash # 采用兼容协议 TRADINGAGENTS_LLM_PROVIDER=openai_compatible # 火山方舟 Agent Plan 端点 TRADINGAGENTS_LLM_BACKEND_URL=https://ark.cn-beijing.volces.com/api/plan/v3 # 填入申请的 API Key OPENAI_COMPATIBLE_API_KEY=your_api_key_here # 指定模型名称(支持使用 deepseek-v4-flash、kimi-k3 等平台原生名称) TRADINGAGENTS_DEEP_THINK_LLM=deepseek-v4-pro TRADINGAGENTS_QUICK_THINK_LLM=deepseek-v4-flash ``` 使用火山方舟 Agent Plan 的便利之处在于可以直接配置模型名,无需单独创建 Endpoint 接入点。 ### 3. 网络与环境问题处理 TradingAgents 默认通过 Yahoo Finance 获取行情。在部分网络环境下,容器内请求 `query2.finance.yahoo.com` 可能遇到 SSL 握手断开的报错。 可通过将宿主机代理映射进容器来解决,同时将国内的模型服务地址排除在外: ```bash # 容器使用宿主机本地代理访问外部行情 HTTP_PROXY=http://host.docker.internal:7890 HTTPS_PROXY=http://host.docker.internal:7890 # 国内模型端点走直连 NO_PROXY=localhost,127.0.0.1,ark.cn-beijing.volces.com ``` 另外需要注意:在 Mac 上使用 Docker Desktop 时,如果默认的 `desktop-linux` context 受到网络代理影响导致 `docker compose run` 无响应,可以切换到原生 socket 连接: ```bash docker context create direct \ --docker "host=unix://$HOME/Library/Containers/com.docker.docker/Data/docker.raw.sock" docker context use direct ``` ### 4. 报告文件持久化挂载 容器默认将研报保存在内部路径。可以在 `docker-compose.yml` 中挂载目录,方便直接在宿主机查看: ```yaml services: tradingagents: volumes: - ./reports:/home/appuser/app/reports ``` ### 5. 启动交互式分析 ```bash docker compose run --rm tradingagents ``` 启动后会弹出交互提示,输入标的代码(如 `NVDA`、`BTC-USD`)、基准日期、参与的分析师角色、辩论轮次和输出语言即可启动流程。  ## 五、实测复盘:BTC-USD 完整研报 这里使用火山方舟的 `deepseek-v4-flash` 模型,以 BTC-USD 为标的做了一次完整运行。 终端输出展示了各模块的执行耗时与归档路径:  分析全程耗时约 6 分钟,生成了一份 186KB、1244 行的 Markdown 研报。输出文件按执行阶段分层归档: ``` reports/BTC-USD_20260910_130329/ ├── 1_analysts/ # 各分析师独立数据报告 │ ├── market.md # 8 项技术指标核算 │ ├── sentiment.md # 社区情绪量化 │ └── news.md # 宏观新闻梳理 ├── 2_research/ # 多空对抗记录 │ ├── bull.md # 看多观点 │ ├── bear.md # 看空反驳 │ └── manager.md # 研究主管综合 ├── 3_trading/ │ └── trader.md # 交易执行计划 ├── 4_risk/ # 风控三方讨论 │ ├── aggressive.md # 激进派 │ ├── conservative.md # 保守派 │ └── neutral.md # 中立派 ├── 5_portfolio/ │ └── decision.md # 投资经理裁定 └── complete_report.md # 完整报告合集 ``` ### 技术指标校验 Market Analyst 抓取并计算了当时 BTC-USD 的多项指标: | 指标 | 数值 | 研报解读 | |:---|:---|:---| | 收盘价 | 77,133.63 | 基准价格 | | 10 EMA | 78,428.41 | 现价低于该线,短期动能衰退 | | 50 SMA | 70,414.24 | 现价高于该线约 9.5%,中期趋势尚存 | | 200 SMA | 69,965.22 | 50/200 均线金叉,长期均线呈修复状态 | | RSI | 54.89 | 从高位超买(>80)回落至中性区 | | MACD 柱 | -641.58 | 死叉已现,动能转弱 | | ATR | 2,142.89 | 日均波动约 2.8%,止损需预留安全空间 | 在报告细节中,分析师还比对了 `get_stock_data` 与 `get_verified_market_snapshot` 接口返回的收盘价(差异约 54 美元,占比 0.07%),并在报告中明确说明统一以验证快照为准。 ### 多空辩论要点 多空双方在核心逻辑上的交锋较为具体: 多头论点: > 价格保持在 50 日均线上方 9.5%、200 日均线上方 10.2%,且 200 日线刚掉头向上,整体属于均线多头修复。且回调阶段成交量较 8 月突破时期缩减超过一半,缺乏主力集中派发的特征。 空头反驳: > 均线系统具有滞后性,难以直接预测短期二元风险。当前面临美国关键宏观数据公布、欧洲央行加息以及美债收益率走高的多重宏观压力,短期内指标均线无法对冲宏观利空冲击。 风控人员的讨论则聚焦在操作节奏上: > 激进派的短线试多方案将止损设在 75,400,距离现价仅 2.2%,但当前日均 ATR 达到 2,143 美元(波动率 2.8%)。这意味着在数据发布前夕,普通盘中插针就会轻易扫掉止损。 ### 终审结论 投资经理最终给出的评级为 Hold(观望): > 中期结构偏多,短线动能偏空,且宏观上存在待公布的重大经济数据。在这种信号冲突的节点,维持现有持仓、不盲目开新仓是较优选择。等待宏观事件落地后,若价格在 76,000–77,100 区间企稳,或放量收复 10 EMA(78,428),再右侧轻仓介入。 系统没有机械地在多空结论中二选一,而是在多项指标冲突时选择等待右侧确认条件,并给出了明确的观察窗口。 ## 六、现状与实盘距离 TradingAgents 验证了多角色对抗在提升复杂分析质量上的有效性,但在走向实际自动化交易前,依然存在几处现实门槛: 1. 时效与延迟:端到端完整分析涉及十余次推理,单次运行约 3 到 6 分钟。这种耗时决定了它更适合日线级别的波段分析与复盘,无法应对秒级的日内撮合与高频风控。 2. 数据生态接入:原版基于国外数据源构建。若用于 A 股或其他本土市场,需要适配本土行情接口与研报来源。 3. 执行层的衔接:系统当前输出的是逻辑分析和参数建议,并不包含与券商交易接口的直接连通,订单管理、滑点控制和仓位风控等工程模块需要单独开发。 4. 策略回测工具链:框架主要侧重于单次决策的推理过程,目前缺少开箱即用的批量历史回测流水线,较难大规模统计在不同市场周期下的胜率与收益分布。 作为辅助工具,TradingAgents 能够帮助投资者在做决策前快速梳理多空逻辑、罗列潜在风险并量化波动指标。作为多 Agent 系统项目,它在角色拆分、辩论裁决和状态机容错上的处理方式,为探索复杂任务下的 Agent 协作提供了一个清晰的工程参考。 --- 项目地址:https://github.com/TauricResearch/TradingAgents 论文引用:arXiv:2412.20138 免责声明:TradingAgents 属于研究类开源项目,本文仅作技术与架构拆解,文中所涉及标的与实测数据均不构成任何投资建议。
耗时 6 年,我终于拿到 B 站 100 万粉丝奖牌!公布明年的秘密计划(
大家好,我是程序员鱼皮。 从我在 B 站发出第一个视频到现在,整整过去了 6 年。 前几天我终于收到了官方寄来的 100 万粉丝奖牌,真的很久没有那么激动了,仿佛找到了我最开始做视频时粉丝破百的喜悦感。  这块牌子不是我一个人挣来的,是这 6 年里每一个点关注、投币、留评论的朋友一起堆出来的。 真的非常感谢大家!  以前我发视频基本都在讲教程、聊技术、测模型,从来没有在视频中回过评论。 这次我专门在动态里征集问题,评论区一下涌进来上百条,从 AI 编程工具问到创业经历,从学习路线问到感情八卦,什么都有。 我挑了 40 多条大家问得最多、也最值得聊的问题,一条条录成了视频。 > 视频指路:https://bilibili.com/video/BV1W9YH6HEtz 这篇文章就是那期视频的完整文字版,内容比较长,我按话题分成了 9 个部分,方便大家挑着看。 ## 1、我是怎么走上编程这条路的 #### 第一次做程序是什么时候? 我第一次写程序是在高中,用的是一门估计大家都没听说过的语言,叫 Q 语言,也就是按键精灵的脚本语言。  学它的目的说出来有点不好意思,我纯粹是为了写自动打怪脚本。 这里还有个小故事,当时我沉迷一款叫 XX 三国的游戏,想氪金但手里没钱,就琢磨出一个思路,与其在游戏里辛苦打工赚游戏币,不如先在现实世界把钱赚到手,再充值到游戏里。 于是我真的跑到线下加入了一个刷单工作室,靠这个赚了点零花钱。  结果等我真赚到钱之后,反而舍不得往游戏里充了…… 不过写这些脚本的过程让我发现,原来自己挺喜欢编程这件事。那会儿我还是班里的计算机课代表,后来又参加了一个做网站的竞赛,拿了个三等奖,从此就彻底爱上编程了。 #### 鱼皮小时候是什么样的生活环境和经历? 我小时候基本就是一个人待在房间里自娱自乐,左手拿着一个玩具,跟右手的玩具对话。 再大一点,我开始用 A4 纸和手写笔记本设计游戏,自己定规则、画地图、算数值,我管这个叫「纸游」和「本游」。 现在回过头看,那大概就是我最早的产品设计经历了。 #### 鱼皮哥是二次元吗? 给大家看看我当年用过的头像和壁纸,请大家自行评价。  #### 如果能再选一次,鱼皮会选什么专业? 当年填大学志愿的时候,我 10 个志愿全都填了计算机专业。 再让我选一次,肯定还是计算机,前提是这个专业未来还在。 #### 大学期间印象最深的事是什么? 大学期间让我印象最深的一件事,是在保研和就业之间做选择。 纠结了很久,我最后还是决定直接进腾讯打工,立志把童年充进游戏里的钱赚回来。 一路走到现在,我一直都是自己做选择的,不会让别人替我做决定,我爸妈也从来不干涉我,真的非常感谢他们。 ## 2、我每天在用的 AI 编程工具 聊完过去,再说说现在。这次评论区问工具和实操的人最多,我挨个说一下。 #### 鱼皮最喜欢用的编程工具是哪一个? 这题很危险啊。 以前做 Java 开发的时候,我用得最多的肯定是 IDEA。不过现在都是 AI 编程了嘛,我早就把 IDEA 卸载了。 目前用得最多的是 Cursor,其次是 Codex 和 Claude Code,然后是各种国产工具,没有任何广告成分。 #### 在哪个平台或模型上充值的 Tokens 最多?充了多少? 肯定是 Cursor。 它对接了非常多的模型,我想测试新模型的时候特别方便,不用到处开一堆订阅,也不用担心被封号。 我用 Cursor 差不多有一年半了,整个团队算下来,少说也得花掉十几二十万,单位是元。 给大家看一眼最近一个计费周期的账单,光这一个月就烧掉了三千多刀。  #### 利用 AI 做长期项目时,如何确保随着内容增多,AI 的代码不会越来越乱? 这个问题挺正经的,但回答起来很简单,你把 AI 类比成人类就明白了。 人脑的容量是有限的,所以我们会把重要的事情记下来,写进备忘录或者项目文档里。 让 AI 做项目也是一样的道理,你要让它把项目的关键信息整理成文档沉淀下来,之后每次干活先从文档里获取上下文,它就不容易跑偏。 除了写文档,还有一些别的技巧。比如把代码按功能拆分成多个模块,每次明确告诉 AI 这轮只改哪一个模块,它的改动范围就会收得很紧,不至于牵一发动全身。 #### 如何自己开发 Agent? 打开一个 AI 编程工具,使用 `/grill-me` 拷问技能,然后把你的想法输进去,让 AI 一步步引导你把需求问清楚,剩下的交给它就搞定了。 这个技能来自 Matt 开源的技能库,它会像面试官一样反复追问你的需求细节,比你自己想提示词高效得多。 > 开源指路:https://github.com/mattpocock/skills  ## 3、Vibe Coding 时代,怎么提升编程能力 工具聊完了,接着就是这次评论区最焦虑的一批问题。 大家的担心其实高度一致,就是 AI 把活儿都干了,自己会不会废掉。 #### 现在每天上班开发就是 Vibe Coding,没时间再手动看生成的代码了,以后该如何提高自己的编程能力? 完全不用担心! Vibe Coding 已经是整个行业的趋势,你能指挥 AI 把工作完成,这本身就是一种能力。 真想补基础也不难,在工作之余主动看一点传统的技术教程或者技术科普,面试之前刷一刷面试题就够了。不用因为自己不再逐行手写代码,就觉得能力在退化。 #### 我是计算机专业本科生,应不应该平时完全用 AI 写代码?让 AI 写代码总有种作弊的感觉 你不用,你可能就落后了。 AI 编程是趋势,不是捷径。 腾讯在《2025 腾讯研发大数据报告》里披露过,公司超过 90% 的工程师在用 AI 编程助手 CodeBuddy,全公司 50% 的新增代码由 AI 辅助生成,相当于程序员每写两行代码就有一行是 AI 帮着完成的。  连大公司都这么干了,先进的工具和技术本来就是要学的,用 AI 写代码怎么能算作弊呢? #### 以后的开发是不是偏向于维护和提问题? 我觉得会更偏向于 **描述需求** 和 **验收成果** 这两件事。 往前一步,你要能把问题跟 AI 说清楚,说不清楚它就交付不出你想要的东西。 往后一步,你要能判断 AI 交出来的结果好不好,好在哪、差在哪、该怎么改。 这两头你都握住了,中间的代码具体由谁敲出来,其实没那么重要。 #### 如何在 Vibe Coding 中学习? 多看 AI 的输出,并且直接利用 AI 来学习。 具体做法特别简单,记住这一句提示词就够了: ```markdown 请用傻子都能懂的方式回答我 ``` 别小看这句话。Claude 的母公司 Anthropic 最近开源了一个技能叫 ELI5,全称是 Explain Like I'm 5,意思是用讲给 5 岁小孩听的方式来解释任何话题。 > 开源指路:https://github.com/anthropics/claude-plugins-community 整个技能的核心就这一句话,跟我这个提示词异曲同工。  如果你想要更系统一点的效果,还可以用国外大神 Matt 开源的 `/teach` 技能。它会把 AI 变成你的私人教师,先摸清你为什么想学这个东西,再按你的节奏一点点搞出教程讲解。 > 开源指路:https://github.com/mattpocock/skills  #### 小白如何在 Vibe Coding 的过程中不断学习和进步,增强对 AI 的掌控感? 不用想那么多,多用就是了。 先用 AI 把东西做出来,在练习的过程中慢慢找感觉。提示词不会写完全没关系,只要能说清楚自己的需求和目标就行。用着用着,你自然就知道 AI 什么时候听话、什么时候不听话了。 **掌控感是练出来的,不是学出来的。** 等东西做出来之后,再倒回去了解背后用到的技术。这时候你的学习是带着目标的,效率反而比一开始就死磕基础更高。 #### 研究生应该怎么利用好 AI 工具帮助自己? 很抱歉我没有读过研,不太清楚你们具体的科研场景。 但这个问题我可以用最直接、最不绕弯子的方式回答你:**你把自己的专业和这个问题原封不动发给 AI 就行。** 记得带上前面那句提示词「请用傻子都能懂的方式回答我」,AI 现在真的是最好的私教 #### 自学编程或者教别人学编程的过程中,遇到最难的问题是什么? 好问题,我记得有张图特别能说明这件事。  很多问题明明教程和文档里都写得清清楚楚,但就是因为没有认真看文档,最后踩了坑。这类问题最难的地方不在技术本身,而在于人不愿意去读。 好在现在有 AI 了,你可以把整份文档丢给它,让它替你读完再回答你的问题,这个坑基本算是被填平了。 ## 4、给学生和求职者的建议 上面那批问题大多来自已经工作的朋友,评论区里还有不少在校生,他们关心的事情又不太一样。 #### 给非 92 的计算机大一学生有什么建议? 无论是不是 92,学习建议其实都是一样的,关键在于做好规划、多动手实践,学校的层次决定不了你四年后的样子。 我很早之前录过一期《我的大学四年规划》,把每一年该干什么讲得比较细,建议新同学去看一下。 > 视频指路:https://codefather.cn/live/1788387889965436929  相信我,四年后你会来感谢我的。 #### 对于学人工智能的学生有什么建议吗? 也是一样的,多做东西、多实践,别只跟着学校学。课本里的内容很可能已经和企业里的实际应用脱轨了,你等着老师讲完再动手就太晚了。 最关键的一点是多看鱼皮的视频(哈哈哈哈哈哈哈哈。 #### 如何看待今年秋招大量缩减岗位?还有两年毕业,如果做不了计算机开发,如何提前规划别的职业? 首先我不太清楚你是在哪里看到这个信息的。就我观察到的情况,有不少传统开发岗位其实是转成了 AI 全栈开发,招聘需求并没有消失。 拿字节今年的校招来说,技术和产品岗位的需求占比超过 70%,算法类岗位需求比去年还有增加,而且首次上新了 AI 全栈工程师、AI Agent 开发这些岗位。  AI 发展起来了,时代变了,肯定是要学新东西的,比如 AI 编程,学就好了,不用慌。 岗位不是消失了,只是换了一种形式和名字,而适应变化本身就是程序员最核心的能力。 #### 在 AI 高速发展的今天,开发的学习路线是否发生了变化?如果重回大一,鱼皮你会干什么? 学习路线肯定是有变化的。放在今天,我建议先学 AI 编程,把东西做出来拿到正反馈,再倒回去补传统技术基础,这个顺序和几年前是完全反过来的。 具体的路线比较长,我在 [编程导航](https://www.codefather.cn/) 里完整分享过,包括每个阶段学什么、做什么项目、怎么写进简历。  至于如果重回大一,我肯定是做自媒体起号,然后尽快在校园里创业。 大学时候大家还很单纯、有冲劲,试错成本也低,等出来打工几年之后想重燃这份热情,真的很难。 ## 5、编程这条路怎么才能走得久 聊完短期的规划,再聊聊长期的坚持。 #### 鱼皮你是如何坚持下来编程的?编程的乐趣在哪?来点小故事。 我觉得编程本身是没什么乐趣的,有乐趣的是你用编程创造东西。 比如我之前写过一个抢课工具,帮自己抢到了一门特别难抢的课,还做过整人软件,甚至做过表白网站。这些东西技术上都不复杂,但每一个都实实在在解决了我当时的问题,那种爽感是刷题刷不出来的。  你也可以试着用编程解决自己生活里的一个小麻烦,从这里开始就够了。 #### 鱼皮大学用了很多时间在编程,想问问怎么持之以恒的? 我很久之前就分享过自己大学四年的学习经历,想让自己坚持下来,核心是要有源源不断的输出和成就感。 比如做出一个作品就分享给别人看、组队去参加竞赛、找一份实习赚点钱给自己买设备。 这些事情会不断给你正反馈,有了正反馈,学编程就不再是一个难搞的任务,而变成了你自己想干的事。 #### 普通人想在编程这条路走远,最核心的底层能力是什么? 好家伙,这么深奥的问题?! 我觉得最重要的能力就是能坚持学习新东西、能适应变化,有这一条就够了。 现在 AI 发展成这样,写程序本身已经没有什么门槛了,但你不用、不学,差距就会被慢慢拉开。 #### 工作了两年,同样对比鱼皮工作两年 996,回家只想躺着,对于工作后的额外任务是如何协调的?  提问的同学说大二就开始看我了,那真的是从小看我到大。 其实我的很多时间都是挤出来的。白天尽快把工作完成,想办法提高效率,下班之后才有精力做一些自己感兴趣的事。 **这个顺序不能反,先把主业的事情干利索了,额外的时间才是真正属于你的。** 如果你回家只想躺着,说明你还没有找到让自己动起来的动力。不妨试试 Vibe Coding,成本很低,说不定就让你感受到创作的乐趣了。  #### 平时工作用的哪些顺手的设备,或者说好的工作习惯? 这期没有广告,所以设备我就不推荐了。 工作习惯里我觉得最重要的一条,是把大的工作分解成你觉得很轻松就能完成的小任务。 任务一旦小到你不抗拒,就能利用碎片时间往前推一点,积少成多,最后你会发现那件看起来很大的事已经做完了。 #### 有没有什么好的学习建议能提高技术、找到更好的工作?  我觉得 **想得越多,做得越少**,迷茫可能是因为想太多导致的。 其实要做的事情很简单。每天看 3 篇技术文章或者 AI 编程教程保持输入,同时用 AI 编程上线一个属于你自己的王牌项目并且持续打磨它,面试之前再刷一刷 [面试鸭](https://www.mianshiya.com/),升职加薪基本就是时间问题了。  ## 6、聊聊创业、公司和副业 这部分是大家问得最多的私事,我绝对坦诚。 #### 鱼皮为什么想要从大厂出来开始自己做? 我 23 年从腾讯离职的那期视频里有提到过,主要原因是在公司已经没有什么成长了,再加上当时 AI 的势头很猛,我就想自己折腾一下试试看。 当然这个决定也离不开关注我的朋友们给我的底气,如果当时没人看我的内容,我大概是不敢走的。 #### 现在 AI 发展那么快,有没有后悔离开鹅厂? 完全不后悔,而且我觉得自己离开的时机恰到好处。 这是我考虑了很久才做的决定,离开的时候,办公室的场地都已经租了好几个月了。 等到真正做出决定的那一刻,什么都不要想,干就完了! 你确实不知道哪个选择是最好的,但你可以努力把自己做的这个决定变成最好的选择。 #### 好奇鱼皮的公司现在经营的怎么样? 确实很久没有聊自己公司的情况了,都怪 AI 时代节奏太快,新模型新教程根本出不完。 坦诚地说,现在公司人数少了,场地大了,也更灵活了。后面我再专门给大家介绍一下新场地吧。 #### 入职贵公司需要准备什么? 这个问题问得很好,正好我们团队最近在招人,而且不卡学历! > 指路:https://yuyuanweb.com/join  我自己是个很注重细节的人,所以希望候选人做事细心、有责任感。 另外对于创业公司来说,需要候选人有一颗热忱之心,保持积极向上。 #### 如果你没有当程序员,可能会在什么其他行业工作?如果现在转行,什么方向比较适合? 我大概会去开线下店,比如开个桌游店,然后设计自己的桌游。 这不是随口说的,我确实这么干过。25 年我开了一家剧本杀桌游店,后来因为一些妖魔鬼怪倒闭了。  虽然结果不太好,但我还是觉得要做自己最感兴趣的方向,起码这个过程中你是快乐的。 #### 现在如果要互联网创业,该做什么方向呢? 我的排序是做自媒体 > 卖课,卖课 > 用 Vibe Coding 做产品,真心话。 前面两件事的确定性更高,你付出的时间基本能换回对应的回报。 做产品的不确定性要大得多,而且很多人低估了推广的难度,东西做出来其实只是个开始。 当然,自媒体和卖课也都不容易,还是需要你有一个明确的方向、并且有东西持续输出的,如果你能把这些精力投入到主业上,结果肯定也不会差。 #### AI 时代程序员如何搞副业呢? 好问题,我自己就是副业变主业的。 AI 时代最大的变化是创造成本被打下来了,有了 AI,一个人就能搞定过去一个团队的活儿,所以机会真的很多,关键是你愿不愿意迈出第一步。 具体怎么迈呢,可以先跟着我免费开源的 AI 编程教程,用 Vibe Coding 做出你的第一个作品,然后发到社交平台上分享出来。 有了第一个作品和第一批反馈,剩下的路是越走越宽的。 > 教程指路:https://github.com/liyupi/ai-guide  #### 讲讲普通人怎么开始做自媒体的?有什么赛道适合普通人呢? 我的建议是 **保持真实接地气**,从你自己的职业和经验出发,分享你最擅长的那件事。别一上来就想做自己不熟的领域,那样撑不了几期。 AI 视频现在虽然很火,但成本也高,而且非常容易同质化,我不太建议普通人从这里切入。 正好我最近在考虑线下带一些朋友做自媒体。 > 啊我随便说的,不要找我咨询。 ## 7、课程、教程和出书的计划 #### 鱼皮有没有开设一门编程课的想法,比如 Agent 开发? 不会还有人不知道吧,我已经做了整整 4 年的课程了! 编程导航、面试鸭、AI 导航都是我的网站。  毕竟我擅长做课,和卖课。 #### 会做针对零基础的 Java 视频教程吗? 应该有很多同学都是通过 Java 学习路线那期视频认识我的吧。 你别说,我 25 年的时候真的花了整整一个月去写一套 Java 零基础教程。  但后来 AI 发展得太快,我的创作方向也转到了 AI 编程,我觉得现在完全可以直接用 AI 帮你学 Java,没有必要再专门搞一套视频教程了,所以那套教程到现在都没有发出来。 #### AI 兴起了,还会出基础技术视频教程吗? 坦白说,传统技术的视频教程估计是不会再出了。 现在的 AI 已经可以直接生成交互式的教学网站,你想学什么就让它现场给你搭一个,比看录播视频的效率高很多。 大家喜欢的小阿巴系列,估计也只能偶尔限时返场了。 #### 买过鱼皮的书,有没有新书规划? 我确实在 24 年出版过自己的《编程导航,全栈项目实战课》,当时还冲上了某东图书销量总榜第一,签名快把我的手签断了。  但现在 AI 发展太快,书籍太容易过时了,一本书从写完到上架就要好几个月,所以我目前没有出书计划。 ## 8、来点轻松的 正经内容差不多聊完了,剩下这几个问题纯属整活,介意的朋友可以直接跳到下一部分。 #### 鱼皮你谈了没?别告诉我你和小鲸鱼谈的  怎么会有人和小鲸鱼谈恋爱啊,我肯定更喜欢大肥鱼!  #### 讲讲鱼哥的感情史。  放下过去,珍惜当下,一切都是最好的安排。 #### 读到我说大喊一句「鱼皮是狗」  鱼皮是狗!  你小子,AI 检测器是吧。 #### 可以拍拍鱼皮哥一天工作的流程 Vlog 吗? 行,那就给大家看看我一天的真实状态。 早上到公司的时候还是充满希望的,加油加油加油。  然后坐下工作……  唉,又是疲惫的一天呐,就是这么枯燥。  ## 9、关于人生和未来 #### 你觉得人生的意义是什么? 这个问题我想了很久。  开心就好,想那么多干什么! #### 以后你打算做什么?之后有什么发展方向? 近两年肯定还是关注和分享 AI 编程,毕竟新东西太多了,我自己都学不完,更分享不完。 不过我真的很希望自己的精力还能跟得上…… 毕竟明年很有可能…… 要生小孩啦。 ## 最后 写到这里,40 多个问题差不多都回答完了。 最后哔哔几句,一个人闷头做内容做 6 年是件挺难坚持的事,能撑到今天靠的就是评论区里那些声音,有催更的、纠错的、说自己靠着某个项目找到工作的,也有一直喊我是狗的。 总之,非常感谢大家这么多年的支持,我会继续输出内容的,干就完了!
刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归
大家好,我是程序员鱼皮。 刚刚,DeepSeek 正式发布了 V4.1 Flash 模型。 它是一个 552B 参数的 MoE 模型,采用了全新的模型结构,**原生支持多模态视觉理解**,而且直接开源了。  这次更新力度很大。DeepSeek 网页版原来的快速、专家、识图 3 个模式直接合并成了一个入口,用户不需要再手动选模式了,AI 会根据任务复杂度自动调度,检测到图片就自动激活视觉能力。  炸裂的是,DeepSeek 官方称:**V4.1 Flash 在性能、费用、速度、总用时等各项指标上已经全面超越 V4 Pro!** 好家伙,自家的快速模型吊打旗舰模型? 要知道,DeepSeek 的 Flash 模型比 Pro 模型便宜好几倍!效果反而更好? 那之后谁还会用 Pro 模型啊?  果不其然,官方已经下线了旧的 V4 Flash 和 V4 Flash Vision Exp 模型,而且 9 月 14 日 V4 Pro 也要正式下线,到时候所有发给 V4 Pro 的请求全部自动路由到 V4.1 Flash。 相当于 Flash 彻底把 Pro 干掉了…… 那 Flash 模型真的比 Pro 强么?差距有多少?我打算自己测一测。 于是我准备了 **2 个不同类型的项目**,同时拉上很火的 GLM-5.3-Flash 做横向对比。 这次测试我特意从日常使用场景出发,DeepSeek 的两个模型放在 DeepSeek Harness 里跑,GLM-5.3-Flash 放在智谱自家的 ZCode 里跑。你平时用哪个模型就搭配对应的自家工具,往往能获得更好的效果。 ## 怎么用 V4.1 Flash 如果你用的是 DeepSeek Harness,更新一下版本,V4.1 Flash 就可以直接在模型列表里选了,不需要额外配置。  如果你是通过 API 调用 V4.1 Flash,现在模型名简化成了 `deepseek-flash`,不用修改 base_url。之前的 `deepseek-v4-flash` 和 `deepseek-v4-flash-vision-exp` 也会自动路由到新模型,不用改代码。 ## 项目实战测评 ### 3D 程序化城市生成器 第一个案例对标的是 OpenAI 官方展示馆里那个用 GPT-5.5 做的程序化城市生成器,我之前测 GPT-6 Astra 的时候用过同一段提示词,效果非常惊艳。这次拿同样的提示词让 3 个 Flash 级模型来做,正好能看出差距。 提示词很简单,我让 AI 做一个程序化 3D 城市生成器的网页应用,至少包含重庆、上海、西安、深圳、江南五种城市风格,切换风格之后建筑形态、色调和地形要有明显差异。编辑器布局和参数维度怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。  来看看三个模型各自做出了什么效果。 #### DeepSeek V4.1 Flash V4.1 Flash 拿到任务后,先用 Firecrawl 联网搜索了官方 Showcase 的产品设计,分析完参数维度之后才开始写代码。AI 选的技术栈是 Vite + TypeScript + Three.js,没有多余的框架依赖。 整个过程跑了 250 步,LLM 推理只花了 18 分钟,输出速度达到了每秒 287 tokens。不过工具调用花了 83 分钟,总用时被拉得比较长。  看看成品效果。第一眼看上去感觉还不错,错综复杂的重庆山城给做出来了,右侧有完整的城市生成器控制面板,城市风格、布局参数、天际线、地块配比全都能自由调整。  通过拖拽和滚轮可以自由移动和放大视角,能看到更多细节,比如道路上行驶的车流。 右侧面板里还能自由调整建筑密度、街区尺度、街道形态、商业和居住占比等等。  切换到上海,你能认出来中间那几栋最高的建筑么?  整体功能虽然完成了,但是精细度还差点儿意思。比如看看西安城市的效果,很难说一眼就能认出来是古都的感觉。  #### DeepSeek V4 Pro V4 Pro 的最大问题是没有视觉能力。AI 写完代码之后没办法自己截图看一眼效果对不对,只能通过调用子 Agent 让其他有视觉能力的模型帮忙验证。  先看看重庆的效果,建模的精细度明显不如 V4.1 Flash,尤其是这个橙色的大桥,有点出戏。  再切换到上海。 额,这个东方明珠我怎么看怎么像糖葫芦,而且怎么还建在水上了呢?  直接就是一个大失败啊! 还好我替你们测了,不要浪费钱去做这玩意啊! #### GLM-5.3-Flash 再看看 GLM-5.3-Flash 生成的效果,第一眼看上去还不错,建筑上的灯光效果做了出来,这个夕阳的氛围也挺有意境。  不过放大看细节就露馅了,有明显的穿模问题,画面中还有很多飞来飞去的小方块,不知道是什么东西。  看看上海的东方明珠,我觉得比前两个略好一点,但也有明显的 Bug,塔尖凭空悬浮了,而且好多大楼直接建到了水上……  看到这里,我个人认为 V4.1 Flash 的完成度和细节丰富度最高,GLM-5.3-Flash 的氛围感做得不错但细节 Bug 更多,可以说二者半斤八两吧。至于 V4 Pro 的效果,确实是三者之间最拉的。 #### GPT-6 Astra 之前我用同一段提示词测 GPT-6 Astra 的时候,AI 只用了 18 分钟就交卷了,而且每种城市的精细度都非常高。  整个的建模正确性也更高,可以说 GPT-6 Astra 完爆这三个 Flash 级模型,差距一眼就能看出来。  不过这也是理所应当的,毕竟 Astra 是全球顶级模型,价格贵了不知道多少倍,跟 Flash 模型比效果就有点欺负人了…… ### AI 智能绘图工具 第二个项目考的是全栈工程能力。我让 AI 开发一个 AI 智能绘图工具,用户通过自然语言描述,AI 自动生成可编辑的流程图、架构图和思维导图,前端在 draw.io 编辑器的基础上二次开发,加上 AI 对话面板,支持连续对话修改图表。  #### DeepSeek V4.1 Flash V4.1 Flash 先联网抓了 draw.io 官方的嵌入协议文档和 GitHub 仓库,研究了一遍源码之后找到了零改动嵌入的方案,然后才开始写代码。 打开成品页面,整个界面布局很有科技感,AI 把 draw.io 深度融合到了项目里,连产品名都自己取了一个叫 DrawMind。左侧是 AI 对话面板,右侧是完整的 draw.io 画布编辑器。  我让 AI 画一个微服务电商系统的架构图,能实时看到 AI 的思考过程,而且输出速度非常快,20 秒左右就完成了。  画出来的架构图效果很好,分层清晰、节点整齐、没有错位,这点比之前用 V4 Pro 来画的要好不少。  更关键的是连续对话修改的能力。我说「把业务服务层的背景改为红色」,AI 精准定位到了对应的元素并修改样式,右侧画布实时更新,改得又快又准。  我又试了一些其他类型的图,流程图、思维导图都能正常生成,没有出现生成失败的情况,比较稳定。  #### GLM-5.3-Flash 再来看看 GLM-5.3-Flash 在 ZCode 里做出来的版本,花了大约 46 分钟。 界面同样很有科技感,而且也成功把 draw.io 深度融合了进去:  生成架构图的效果也不错,分层清晰,但是有时候会有些连线错位的问题:  同样支持连续对话修改:  不过多试几遍就会发现,偶尔会出现生成的 XML 跟 draw.io 不兼容的情况,画布上弹出解析报错,稳定性差了一些。  #### DeepSeek V4 Pro V4 Pro 做出来的版本就差了不少。 最明显的问题是 draw.io 被很生硬地嵌入到了页面里,左下角的文字还出现了溢出,右侧画布默认显示的是一大坨空白和加载图标。  AI 生成图表的功能是可以正常使用的,但是没有 AI 思考过程实时输出的能力,生成速度和准确度也都一般。  简单总结一下,显然 V4.1 Flash 的整体完成度最高,draw.io 成功集成、生成速度快、连续对话修改精准,而且只花了 21 分钟。 GLM-5.3-Flash 的前端效果跟 V4.1 Flash 不相上下,但耗时翻倍到 46 分钟,偶尔还会出现 XML 兼容性问题。 V4 Pro 成功垫底,界面生硬、功能粗糙、没有思考过程输出。 ## 测试总结 两个项目跑完,我觉得 V4.1 Flash 确实做到了全面超越 V4 Pro。 首先,原生多模态太方便了! V4 Pro 写完前端之后看不到自己画面长什么样,只能瞎猜或者调用子 Agent 帮忙看一眼,这个体验非常割裂。V4.1 Flash 直接自己截图验证,该修就修,生成的质量明显高了一档。 然后是 **速度**。我额外做了一个对比测试,让两个 DeepSeek 模型用相同的提示词各写一篇一万字的小说。  结果 V4.1 Flash 的输出速度达到了 160 TOK/s,V4 Pro 只有 50 TOK/s,差了整整 3 倍! 首 token 延迟也差很多,V4.1 Flash 只要 0.3 秒,V4 Pro 要 1.1 秒。日常用的感受就是 V4.1 Flash 秒回,V4 Pro 要稍微等一下。写代码的时候这个差距体感更明显,287 TOK/s 的速度下屏幕上的代码几乎是瞬间刷出来的。 再看看 **花了多少钱**。 V4 Pro 光是做一个 3D 城市生成器就花了大约 16 元,而 V4.1 Flash 开发完两个项目才花了不到 10 元,平均每个项目 5 元左右。  另外 DeepSeek 今天同步调整了 Flash 系列的定价,空闲时段缓存命中的输入价格降到了 0.02 元 / 百万 token,日常开销低了很多。 看来 DeepSeek 可以重新作为日常 AI 编程和办公的推荐模型了。 我单方面不负责任地宣布:**梁神回归!**  最后再分享个小故事,关于 V4 Pro 下线这件事,DeepSeek 的本意是给用户免费升级模型,V4 Pro 的请求自动路由到 V4.1 Flash,还按更便宜的 Flash 价格计费。 听着是好事对吧? 结果反而遭到了一堆开发者的吐槽。很多人已经把 V4 Pro 接进了自己的线上产品,提示词、参数、业务逻辑全部是按 V4 Pro 的行为特征调过的,突然换一个模型底座,输出风格和能力边界都会变,线上产品可能直接出问题。  还有人担心 V4.1 Flash 虽然跑分超过了 V4 Pro,但在自己的特定场景下不一定更好,「全面超越」和「我的场景也超越」是两回事。 这种情况在 AI 行业已经不是第一次了,几乎每一家厂商做模型升级的时候都遇到过类似的争议…… 你怎么看?
