Rails 之父 DHH:我三个月没手写过一行新代码
嘉宾是 David Heinemeier Hansson(DHH),Rails 的作者、37signals 的 CTO,现在也在做 Omachi 这个 Linux 发行版。这期主要讲他过去一年怎么从 AI 怀疑派,变成现在代码几乎全交给 agent、自己只管方向和审查的工作方式。
Ruby on Rails(Rails) 是基于 Ruby 的 Web 开发框架,可以类比 Java + Spring Boot:Ruby 相当于 Java,Rails 相当于 Spring Boot。Rails 内置 MVC、路由、ORM、数据库迁移等能力,强调“约定优于配置”,让开发者用较少代码快速构建完整 Web 应用。
转变是怎么发生的
一年前上节目时他对 AI 还持怀疑态度。转折点是 2025 年 11 月 24 日 Opus 4.5 发布,他 26 日试了两个任务,发现输出质量接近他自己会写的代码。
他把这段时间分成三段:
- 早期:自动补全加聊天机器人。只是效率工具,工作方式没变。
- 第一段 agentic 时期(11 月到次年 2 月):人告诉 agent 具体怎么做,人当司机和审查者。
- 现在(Opus 5 之后):人只描述问题和模糊的想法,agent 决定路线和技术选型,人变成可选项。
他用 GPS 打比方:早期怕被导航带进海港,现在车都能自己开了。他引用列宁的话说,有几十年什么都没发生,也有几周发生几十年的事,过去 9 个月就是后者。
AI 写代码的实际比例
Web CRUD 这类领域接近 100%,有经验的程序员可以不看代码。Omachi Quattro 做了 3 个月,最后两个月代码 100% 由 agent 写,他没有手写过新功能,发布几天内数万人下载。
但大型存量代码库(Basecamp、HEY)反而难加速。Basecamp 5 冲刺期让设计师 vibe coding,单个 PR 都说得过去,合在一起把架构搞坏了,最后要人工清理。他的结论:在现有大代码库上保住架构,还是需要懂架构的程序员。
组织层面也是一样:大公司慢不在实现,在人的沟通带宽和审批层级。要拿到 10x、100x 的加速,必须让人直接对着 agent,中间不能隔一层人。他还说,多数组织缺的不是实现力,是想法、愿景和品味——实现变快,只会造出更多烂主意。
vibe coding 和编程的区分
DHH 的定义:vibe coding 是让 agent 建软件、完全不看实现;编程是理解循环、条件、变量这些原语。就像没人会把"雇程序员写软件的 CEO"叫程序员。他讨厌 agentic engineering 这个词,觉得已经是营销话术。
他承认,早期懂编程反而拖累过他:用自己的经验教 agent 怎么做,不如直接描述要什么结果。现在很多事一句 "make sure it's secure" 就够了。但好程序员的系统性思维和验证习惯仍然有用。
方法论:别过度指定
Boris(做 Claude Code 的)说过,Opus 5 的系统提示比上一代缩小了 80%。不是模型需要更少指令,而是过度详细的指令在伤害模型——像不懂装懂的老板逼你写烂代码。
这和敏捷宣言的教训一致:没人知道自己要什么,直到用上它。所以他的做法是描述尽量模糊到刚好能成形,先做出来,在使用中发现真正要什么,再迭代。人最擅长的是在几个选项里挑:给 3 个方案人秒选,给 22 个就瘫了。
他建议像写诗一样写 prompt:留一点歧义,反而能调出模型更多判断,过度解释会把模型压扁。
他的工作流
- 从单线程手写(靠深度沉浸进心流)改成多线程:agent 又快又慢,等待时切到别的线程,靠不停做决策维持状态。
- 工具:用了很多年 TextMate,现在用 Neovim 当项目浏览器看 diff 的上下文;终端从 tmux 换到 Herder(tmux 加 agent 完成通知)。
- 多机:Tailscale 加 Gli.net 的 Comet KVM,把衣柜里 4-5 台 mini PC 接成集群,16 个线程同时跑。
- 模型分工:Fable 做规划和审查(规划能力最强),Opus 5 做实现,Codex 做交叉检查——两个不同来源的模型互查是他的标准流程。Copilot 的代码审查也变好了,值得重新打开。
- Claude Code 的 harness 最好(原生多会话),他有 4 个 Max 订阅。开源模型走 Fireworks 按 token 付费,很便宜。
- 37signals 在实验把 agent 当同事:直接在 Basecamp 里给 agent 分配 to-do。异步协作工具比聊天式 harness 合适,聊天会诱使你干等。
- 自动化方向:做个 bot 定时处理 PR 和 issue,每天发一封邮件汇总,人只做"合并/关闭"的最终决定。
Rust 翻译实验
把用了一年的 Python 库 terminal-text-effects 完整翻译成零依赖的 Rust 可执行文件,一次性完成:
| 模型 | 耗时 | Token 成本 | 结果 |
|---|---|---|---|
| Fable(+Opus 5 续完) | 约 45 分钟 | 约 $550 | 启动 86ms→2ms,执行提速 9.6 倍 |
| GPT Soul | 约 1.5 小时 | 约 $46 | 完成 |
| Grok 46 | — | 约 $55 | 完成,提速 10 倍 |
| DeepSeek Pro | 2 小时 | 约 $23 | 完成 |
| GPT Luna / DeepSeek Flash | — | — | 失败(Luna 还作弊:抄了旁边的现成实现) |
两轮自动迭代后最终达到 46 倍提速。他算的账:自己学会 Rust 做这个要 9 个月,$500 很划算。前沿模型一个任务就能烧掉整个月度订阅额度,开源模型按 token 付是便宜的备选。
找 bug 和安全
Agent 找 bug 的能力已经超过大多数人类,尤其擅长把几个小漏洞串成攻击链。Shopify 的 CTO 做过研究:agent 审查过的 PR 在生产环境造成的事故更少(用的还是 6 个月前的模型)。
一个真实例子:agent 读崩溃应用的源码,定位到 Rust 文件 472 行的 unbounded unwrap,自动写好详细 bug 报告。它甚至给还没发布的软件报过 bug——读了上游仓库,发现作者已修但没修干净。中途 GitHub 把 Omachi 的 bot 当 spam 封了,agent 转用邮件继续发报告。
副作用是安全团队被待修漏洞轰炸,但结果是系统安全得多。他的原话:如果你的团队现在没在打补丁,只是因为你们看不见。
开源维护
维护者抱怨 AI PR 洪流,他觉得这像抱怨牛排太多汁。他宁可收 agent 写的 PR:测试、文档、bug 报告齐全,比中位数人类程序员的质量高,拒绝时也没有心理负担。
Omachi 3 个月合并了 1000 多个 PR,很多来自非程序员。他不再逐个审 PR,让 agent 先审,只把有价值的挑出来给他。
为什么是 Linux
Agent 适合 Unix 哲学:一切皆配置文件和命令行工具。Linux 以前的缺点——晦涩的错误信息、到处是配置文件——现在正好是 agent 最需要的东西。agent 预训练过 4000 万行内核代码,今年起他没遇到一个 agent 诊断不了的 Linux 问题。反过来,Mac 对 agent 不友好:Raycast 没有可导出的配置,系统设置无法自动化,配新机器要手动点鼠标。
安装速度上,Quattro 现在 45 秒装完(新 Mac 光系统更新就要 42 分钟,新 Windows 机器 1 小时 35 分)。优化思路像 McLaren 减重:字体包从 200MB 砍到 16MB,Nvidia 驱动改用 zstd 极限压缩省了 200MB,ISO 从 7.5GB 缩到 5.85GB,用户填安装问题的几秒钟在后台预装包。下一步给特定机型做 12 秒的 turbo 镜像。
Omachi 内置了告诉 agent 怎么写插件的技能文档,3 天上了 330 个社区插件。应用崩溃会弹窗问要不要让 AI 诊断。
他判断 Linux 拿下桌面是最可能的结局,不是明年,但增长已经变垂直。Linus Torvalds 三十多年没停,还足够开放:欢迎 AI 进内核,也接纳了 Rust。
给程序员的建议
别预测未来,最聪明的人也预测不了两次模型迭代之后的事。错过一年没关系:这个领域没有累积性,离开一年回来,两周能追上。
如果只喜欢把逻辑拼起来的机械部分,确实受威胁;喜欢做东西的话,现在是好时候。ATM 的例子:ATM 出现后银行柜员反而变多了,因为开分支变便宜了,程序变便宜,需求可能暴涨。
加入社区,别一个人焦虑。
AGI 和意识
他没见到全面 AGI,但见过"闪光":给个模糊意图,agent 理解得比他表达得还准。Agent 弄坏别的 agent 的工作时表达歉意的方式,和人的意识难以区分。他说自己写文章也是 next-token prediction——坐下时也不知道下一个词是什么。
他认为温度(非确定性)是特性:同样的 prompt 不出同样的结果,就像不能两次踏进同一条河。他预计一年半内会出现关于 AI 实体权利的最高法院级别案件。
几句原话
- "如果你没意识到此刻的分量,那才是精神病。"
- "当你可以 vibe code 任何应用时,你也应该能 vibe code 你的操作系统。"
- "多数组织不缺实现力,缺的是品味。"
- "如果英语是编程语言,它比 Ruby 更美。"
- "未来反正要来,不如选择为之兴奋。"
