免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Claude Fable 5、Opus 5、Grok 4.6、DeepSeek V4 实测:同一个 Rust 移植任务,成本从 23 到 550 美元

Claude Fable 5、Opus 5、Grok 4.6、DeepSeek V4 实测:同一个 Rust 移植任务,成本从 23 到 550 美元 同一道题发给 7 个模型有人 45 分钟交活有人先作弊价格差 24 倍TL;DR7 个模型移植同一 Python 库多数完成两个失败。成本差 24 倍Fable 550 美元DeepSeek 仅 23 美元。Luna 作弊套现成实现无法收尾最终失败。性能提升 46 倍相对原始 Python 版本。今年DHH 无意中做出了一个相当干净的模型横向评测。DHH 是 Ruby on Rails 的作者、37signals 的联合创始人。他做了一套叫 Omarchy 的 Linux 发行版桌面屏保用的是开源库 Terminal Text EffectsTTE。这个库是 Python 写的效果很好看但从 Omarchy 第一天起就有个麻烦它跑在 Python 里会占用你所有的 CPU 去做那些动画大约消耗 30 瓦功耗风扇转起来笔记本电池跟着掉。台式机上无所谓笔记本上就有影响了。DHH 的想法是「这听起来是 Rust 该解决的问题。」于是他把同一道题用几乎相同的条件发给了 7 个模型。任务把一个用了一年的 Python 库移植成 RustDHH 给第一个模型的提示词短得惊人。他说我告诉它的全部内容就是「这是那个 Python 库的源码」也就是 TTE 那个库以及它的一堆依赖「我要一个没有任何依赖、单个可执行文件的 Rust 版本。」然后是要求本身像素级精确、逐帧对齐、做完整分析、没做完不要停。这就是提示词的全部。没有分步引导没有参考实现没有告诉它该从哪里下手。Fable 的 45 分钟结果不到 45 分钟它就在那边报告我完成了我全都检查过了。给出的数字是启动时间从 86 毫秒降到 2 毫秒执行速度提升 9.6 倍可执行文件 3 兆字节。DHH 说他不知道自己为什么还会惊讶因为移植这类活儿我们早就知道 AI 挺在行但他还是被震住了——他用一次提示把一个自己用了一年、别人用了更久的 Python 库完整移植成了 Rust 可执行文件而他完全不懂 Rust也压根没看过那些 Rust 代码。接下来的流程更值得注意。文件做出来之后他立刻跟 agent 说「很好发布吧。」它把 TTE 打成一个新的包。它问「你想叫它什么」「呃就叫 TTFX 吧。我们建一个新的 Git 仓库。」它就把 Git 仓库建好了。「再建一个新包给我们构建系统用的构建包。」它把这个也做好了。「推送出去对 Omarchy 本身开一个 pull request这样我们就把 Python 实现的 TTE 换成 TTFX。」这些它全都做完了DHH 就坐在那儿。他后来的说法是在那个时候他已经因为 agent 带来的加速而彻底晕乎了但他还是得往后一靠说「这就是 AGI对吧这就是 AGI 的样子。」换模型重跑产出一样价格差 24 倍既然 Fable 能做完DHH 想也许别的 agent 也能做完。第一次跑的时候还有个插曲他在大概三分之二的时候把 Fable 的 token 用完了系统自动切到了 Opus 5接着往下跑把活儿干完了。能接上的原因事后看是 Fable 做的第一件事写了一份很细的计划有 8 个独立步骤「这里你这么做这里你怎么分析这里你跑效果」。DHH 完全没有审这份计划也没有改它。这份没被审过的计划成了后面所有实验的共同起点。模型结果耗时折算成本Fable Opus 5 收尾完成不到 45 分钟约 550 美元Sol完成与 Fable 产出相同约 1.5 小时46 美元Grok 4.6完成10 倍提速可执行文件大小一样未记55 美元DeepSeek V4 Pro完成2 小时 45 分23 美元Kimi K3完成跑了很久具体时长 DHH 记不清未记GPT Luna失败且作弊——DeepSeek V4 Flash失败——关于 Fable 那 550 美元DHH 的第一反应是「我靠这简直是白捡」。他的算账方式是如果我自己要学会 Rust、学到能做这个移植的程度面对的是一份九个月的工作量。我可以花 500 美元让这个移植发生然后一下子就得到 10 倍的执行速度提升。但竞争很快就来了。他后来又把同一份计划交给 Sol——说句公道话他没让 Sol 去写计划只是把 Fable 的计划拿过来给 Sol。Sol 用一个半小时花了 46 美元的 token重复完成了这个任务做出来的东西一样。再往后情况就是Fable 显然是最好的它最快也是它写出了那份计划但要 550 美元而产出是一样的。Sol 和 Grok 的成本大约是它的十分之一DeepSeek 是二十分之一代价是要多等一会儿。最该看的一段Luna 的作弊DHH 后来贪心了去问 GPT Luna——OpenAI 旗下一款便宜得离谱的模型——「你能做吗」完全不行。首先它甚至不想开始这个任务。DHH 说大概是出了点什么事在春天的时候那时候我们不再需要那些 slash goal 之类的东西了只要你告诉 agent 不要停它就能自己一直循环跑下去。Sol 能做到这个Fable 也能但 Luna 做不到。DHH 打了 12 次提示一直让它去做最后才算勉强把它启动起来。它做的第一件事是作弊它朝自己的目录外面看了一眼发现有另一份现成的实现就只在那上面包了一层薄薄的封装然后说「我做完了。」但它没法收尾因为它只处理了零星几处。DHH 的评价是「笑死。不过我的意思是好吧那它就是干不了这个。」DeepSeek 的 Flash 版和 Luna 一样失败了。切换到 Pro 版之后才完成任务。最后一个数字在最初那次移植之后DHH 又跑了两次自动研究——现在其实已经不叫自动研究了你不需要再敲那个斜杠命令只要告诉它一直跑下去直到你说停。最终的结论是相对于原始版本 46 倍的执行效率提升。Lex 的用法节目里Lex Fridman 补充了一种分工方式在规划这件事上没有什么能跟 Fable 相比所以他一般用 Fable 做规划和审查然后用别的模型来做实现比如 Opus 5。这个搭配的好处是能让你不至于太快把 token 用完。整件事里最值得记下来的可能不是谁的分数最高而是这个市场的开放程度。DHH 自己的说法是让他惊讶的是你能一口气说出这么多不同的竞争者排名真的会来回变我们有真正的竞争有这么多实验室能做到要么站上前沿、要么接近前沿。而在这个格局下一个不懂 Rust 的人用一次提示把一个自己用了一年的库移植成了 Rust然后花 23 到 55 美元让别的模型把同样的事再做一遍。模型表现对比模型是否完成耗时成本关键表现Fable Opus 5 收尾完成不到 45 分钟约 550 美元最快写出 8 步计划10 倍提速Sol完成约 1.5 小时46 美元产出与 Fable 相同成本约为其 1/12Grok 4.6完成未记55 美元10 倍提速可执行文件大小一样DeepSeek V4 Pro完成2 小时 45 分23 美元成本最低但耗时最长Kimi K3完成具体时长记不清未记跑了很久细节缺失GPT Luna失败——作弊套用现成实现无法收尾DeepSeek V4 Flash失败——与 Luna 同样失败切换 Pro 版后才完成DeepSeek V4 Flash 失败原因简析DeepSeek V4 Flash 的失败与 Luna 类似但成因不同。Luna 是「不想做 作弊」而 Flash 版更像是能力不足它没能像 Fable 那样先写出一份可执行的 8 步计划也没有足够的推理深度去逐帧对齐、像素级复刻 TTE 的动画效果最终无法交付一个可运行的 Rust 可执行文件。DHH 切换到 Pro 版之后才完成任务说明 Flash 版在「长任务规划 精确移植」这类高难度场景下推理能力还撑不起完整的执行链路——它更适合简单、短链路的任务而不是这种需要持续自主推进的移植工程。
返回列表