免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

DeepSeek Harness 实测:大模型为什么还需要 Harness?

DeepSeek Harness 实测:大模型为什么还需要 Harness? 视频 https://www.bilibili.com/video/BV1ghbi6fE2H最近 DeepSeek 推出了 DeepSeek Harness。类似的 AI 编程和 Agent 工具还有 Codex、Claude Code、Pi、OpenHarness、OpenCode、Cline 等。很多人可能会问大模型本身已经足够强了为什么还需要一个 Harness我这次没有停留在 Hello World而是从安装开始实际测试了三个任务生成一个幸存者类小游戏生成一个俄罗斯方块生成一个“梁子滑动变阻器”网页同时我把相同或相近的任务交给 GPT / Codex 做对比记录完成时间、Token 消耗、实际费用和最终效果最后再看 DeepSeek Harness 的插件生态。官方地址https://www.deepseek.com/harness/一、Harness 解决了什么问题普通聊天助手通常是用户提问 ↓ 模型回答 ↓ 结束而 Agent 工具需要让模型真正参与一个完整的执行流程用户给出目标 ↓ 模型分析任务 ↓ 调用工具 ↓ 读取执行结果 ↓ 修改文件或执行命令 ↓ 运行项目并测试 ↓ 发现问题后继续修改可以把大模型理解成“大脑”把 Harness 理解成让大脑拥有“手和脚”的运行环境。它负责提供文件读写、终端命令、脚本执行、浏览器操作和工具调用等能力并把每一步的结果重新交给模型判断。以前我们问 AI这段代码应该怎么改模型给出建议后还需要我们自己找到文件、完成修改、运行项目并检查结果。现在更理想的方式是让 Agent 直接完成这些动作遇到错误后继续修复。这正是普通聊天助手和 Agent 的主要区别。二、安装 DeepSeek Harness我使用的是一台 16GB 内存的 Mac mini。DeepSeek Harness 官方提供了通过 NPX 运行的方式因此需要先准备 Node.js 和 NPX。1. 准备 Node.js 和 NPX安装 Node.js 后先检查 NPX 是否可用npx-v我这次测试得到的版本是11.17.0。不同机器的版本可能不同能够正常输出版本号即可。Mac 用户可以通过 Homebrew 安装 Node.jsWindows 用户可以直接从 Node.js 官网下载安装包。安装命令以 DeepSeek Harness 官方页面的最新说明为准。2. 启动 Harness回到官方页面复制当前的启动命令并执行。第一次运行时NPX 可能会询问是否安装相关软件包确认安装即可。如果安装过程长时间卡住或依赖下载失败通常与网络、代理或 NPM Registry 有关。可以切换到可用的镜像源后重试npmconfigsetregistry你的 NPM 镜像地址启动成功后终端会返回一个本地地址。把这个地址复制到浏览器中打开即可。3. 配置 API Key第一次进入页面时需要配置 DeepSeek API Key。可以在 DeepSeek 开放平台创建一个新的 Key再粘贴到 Harness 页面中。API Key 属于敏感凭证不要提交到 Git 仓库也不要直接发布在文章或截图中。如果页面显示的是127.0.0.1说明服务默认只监听本机其他设备无法直接访问。整个安装流程可以概括为安装 Node.js / NPX启动 DeepSeek Harness配置 DeepSeek API Key三、第一次使用进入 DeepSeek Harness 后需要先选择一个工作目录。Agent 创建、读取和修改的项目文件都会集中在这个目录里。进入工作区后可以看到模型和推理等级等选项。这次测试主要使用 DeepSeek V4 Flash 和 DeepSeek V4 Pro。先发送一条简单消息hi模型能够正常响应后就说明一个可以读取文件、修改代码和执行命令的 DeepSeek Agent 已经运行起来了。有趣的是安装 Harness 这件事本身也可以交给其他 Agent。把官方地址或安装说明交给 Codex、Claude Code 等工具然后告诉它帮我安装 DeepSeek Harness。让一个 Agent 安装另一个 Agent正在逐渐变成 AI 编程工具的常见使用方式。四、第一轮测试幸存者类小游戏第一个任务不是 Hello World也不是 Todo List而是生成一个类似 Vampire Survivors 的极简网页版幸存者游戏。我希望它从一句自然语言需求开始自己创建文件、编写代码、组织游戏逻辑最后给出一个可以打开运行的网页游戏。这次使用 DeepSeek V4 Flash。任务开始后Harness 会分析需求、创建项目并写入代码。本轮结果指标结果完成时间约 3 分 08 秒输入 Token约 243K输出 Token约 29K最终结果可以运行最终代码直接写入 HTML 文件。打开后游戏具备角色、敌人、血量、升级和能力强化等基本机制游戏结束后也可以重新开始。视觉效果目前只能算 Demo人物和敌人主要由方块、三角形、圆点等基础图形组成。不过从“几分钟内根据自然语言生成一个真正能玩的网页小游戏”这个目标来看DeepSeek V4 Flash 的表现是合格的。与 GPT / Codex 对比我把相同需求交给 GPT / Codex并将推理强度调高。这一轮 GPT / Codex 的完成时间约为 2 分 35 秒同样生成了一个可以运行的网页小游戏还给它起名为“暮色幸存者”。两边最终完成度接近也都使用了基础图形表现人物和敌人。至少在这一轮测试里DeepSeek V4 Flash 和 GPT 的差距并不明显可以看作基本打平。五、第二轮测试俄罗斯方块第二个任务是实现俄罗斯方块。这次 DeepSeek 使用 V4 Pro。DeepSeek 这一轮的速度非常快指标结果完成时间约 1 分 52 秒页面状态可以打开基础操作方向键可以控制方块形态可以切换核心问题方块不会自动下落页面、方块和控制逻辑都有了但最核心的自动下落逻辑没有实现。因此这一轮的结论是做出来了但没有完全做对。这个问题也说明Agent 说“任务已完成”并不代表最终结果没有 Bug。代码必须真正运行起来核心流程也需要人工验证。GPT / Codex 的俄罗斯方块GPT / Codex 这一轮明显慢很多。执行过程中出现过一次中断我让它继续后它完成了写代码、运行命令、打开浏览器、测试页面和根据结果修改代码等流程。最终耗时约 18 分 13 秒但俄罗斯方块可以正常自动下落核心逻辑更加完整。这一轮形成了一个很有意思的对比工具完成时间最终结果DeepSeek Harness1 分 52 秒很快但核心逻辑有 BugGPT / Codex18 分 13 秒较慢但结果更加完整因此比较 Agent 不能只看谁先生成代码至少还应该关注完成时间最终质量Token 消耗实际费用是否一次完成这次 GPT / Codex 使用的是中转 API算力和上游状态也会影响执行速度。18 分 13 秒只代表本次测试不代表每次都会这么慢。六、第三轮测试梁子滑动变阻器前两个任务都有相对明确的游戏规则第三个任务则更偏向网络梗网页通过拖动滑块让人物从“小梁子”逐渐发生变化。这类任务不只是写代码还需要理解想要模仿的视觉效果和交互方式。DeepSeek 继续使用 V4 Pro最终耗时约 3 分 24 秒。“小梁子”“老梁”等状态基本做了出来整体复刻效果不错。GPT / Codex 这一轮等待约 5 分钟后最终提示无法打开页面。在这一次具体测试中DeepSeek 成功GPT / Codex 失败。当然一次任务不能证明某个模型绝对更强。它只能说明 Agent 的真实体验并不完全等于模型排行榜上的分数。任务规划、文件操作、浏览器能力、工具调用、执行稳定性和失败恢复能力都会影响最后能不能真正把事情做完。七、为什么需要 Harness把这几轮测试放在一起就能回答文章开头的问题。模型负责判断下一步应该做什么Harness 负责把判断执行出来找到文件 ↓ 打开文件 ↓ 修改代码 ↓ 执行项目 ↓ 读取报错 ↓ 继续修改 ↓ 打开浏览器 ↓ 验证结果在测试中DeepSeek Harness 会进入 Think 阶段然后不断创建文件、读取文件和执行命令。有些网页任务还会通过curl获取资源。GPT / Codex 也会调用浏览器、Skill 和其他工具。它们的共同点是模型不再只是输出一段答案而是可以在一个工作目录里持续行动。所以模型能力强并不等于 Agent 任务一定完成得好。模型、Harness 和工具链需要共同工作。八、Agent 任务到底贵不贵这次测试时DeepSeek 后台显示的实际消费大致如下测试任务模型本次实际费用幸存者类小游戏V4 Flash约 0.36 元俄罗斯方块V4 Pro约 0.37 元梁子滑动变阻器V4 Pro约 1.2 元这些是录制测试时后台显示的实际消费不代表长期固定价格具体计费应该以 DeepSeek 官方最新说明为准。普通请求只调用一次模型但一个 Agent 任务可能经历多轮调用理解任务 ↓ 决定创建哪些文件 ↓ 执行工具 ↓ 读取结果 ↓ 遇到报错后重新请求模型 ↓ 打开浏览器测试 ↓ 继续修改因此单看“每百万 Token 多少钱”并不能说明一个 Agent 到底贵不贵。更有意义的比较方式是记录一次完整任务的总成本指标GPT / CodexDeepSeek Harness输入 Token实测实测输出 Token实测实测Cache Token实测实测完成时间实测实测API 总费用实测实测是否一次完成是 / 否是 / 否最终效果实际评价实际评价Token 单价便宜的模型如果任务需要反复重试最终未必便宜Token 单价更高的模型如果一次就把任务完成也可能更划算。九、DeepSeek Harness 的插件生态我觉得 DeepSeek Harness 最有意思的部分之一是围绕它逐渐出现的插件和周边项目。有人把这种发展形容为“一切皆插件”。Harness 提供的是 Agent 基础能力社区则在上面叠加文件引用、多模态、数据库、设计画布、长期记忆、插件市场、侧边栏、TUI、桌面端和主题等功能。下面是本次整理到的项目1. 文件引用dsh-at-file项目地址https://github.com/omdsh-dev/dsh-at-file这个插件为 DeepSeek Harness 增加文件能力。在输入框中输入后可以引用本地 PDF、Word、PPT、图片和代码文件使用体验接近给聊天助手上传文件。2. 多模态图片识别dsh-vision-toolkit项目地址https://github.com/Anionex/dsh-vision-toolkit它为 Harness 增加图片识别和视觉能力可以处理 UI 截图、报错截图、网页截图和设计稿。3. Data Agentdsh-data-agent项目地址https://github.com/omdsh-dev/dsh-data-agent这个项目把 Agent 和数据库连接起来。用户可以直接提出“统计最近 30 天每天的订单量和销售额”等需求再让 Agent 负责查询和分析。4. Agent 设计画布dsh-openpencil项目地址https://github.com/ZSeven-W/dsh-openpencil它把 Agent 和设计画布结合起来让 Harness 不只服务于程序员也能进入设计、产品和原型工作流。5. 多 Agent 长期记忆dsh-mnemon项目地址https://github.com/omdsh-dev/dsh-mnemonAgent 的一个明显问题是记忆。不同会话之间未必能完整保留上下文如果多个 Agent 长期参与同一个项目长期记忆会变得非常重要。6. 插件市场dsh-market项目地址https://github.com/dsh-market/dsh-market插件数量增加后普通用户不可能每天去 GitHub 搜索项目。插件市场可以集中解决插件发现、安装和管理问题。7. 侧边栏工作台DSH Better Sidebar项目地址https://github.com/omdsh-dev/DSH-better-sidebar这个项目主要增强 UI 和工作区。对于每天使用 Agent 的人来说工作区是否顺手会直接影响效率。8. TUIdsh-TUI项目地址https://github.com/ccch1mneyyy/dsh-TUI它将 DeepSeek Harness 做成 TUI。习惯 Claude Code、Codex CLI 等终端工作方式的用户可能会更喜欢这种交互。9. 桌面端DeepSeek Harness Desktop项目地址https://github.com/anywhere-labs/deepseek-harness-desktop不喜欢终端的用户可以选择桌面端以传统软件的方式使用 DeepSeek Harness。10. TUI Desktop Weboh-dsh项目地址https://github.com/hust-open-atom-club/oh-dsh这个项目尝试同时覆盖 TUI、Desktop 和 Web。它也说明底层 Agent 能力和外部交互界面可以分离同一套能力可以对应不同的产品形态。11. Deep Whale项目地址https://github.com/Small-tailqwq/dsh-deep-whale有人做功能有人做多模态、数据库、桌面端和 TUI也有人专门做主题和皮肤。Deep Whale 就属于后者。当一个项目周围同时出现底层扩展、插件、UI、桌面端和 TUI 时它已经开始从单个工具发展为一个生态。十、实际安装一个插件文件引用最后实际安装dsh-at-filehttps://github.com/omdsh-dev/dsh-at-file传统安装一个 GitHub 项目通常需要打开 README、阅读文档、复制命令、安装依赖再处理过程中遇到的报错。现在也可以直接把项目地址交给 Agent帮我安装这个插件。让 Agent 自己阅读 README、执行命令和修改配置。这次安装文件引用插件大约用了三分多钟。安装完成后按照提示重新启动 DeepSeek Harness 并刷新页面在输入框中输入就可以选择本地文件。这样PDF、Word、PPT、图片和代码文件都可以直接作为上下文交给 Agent。这形成了一个有意思的循环我们正在用 Agent 增强 Agent 自己。以后安装 Skill、插件、MCP甚至安装另一个 Agent可能都不需要手动完成每一步。十一、总结模型是大脑Harness 是手和脚为什么需要 Codex、Claude Code、OpenCode、Cline 和 DeepSeek Harness因为模型强不等于 Agent 强。一个大模型可以很聪明但如果它只能在聊天框里告诉你这个文件应该这样修改。那它本质上还是一个对话助手。有了 Harness 以后它可以直接找到文件、修改代码、执行项目、读取报错、继续修复再打开浏览器验证结果。AI 也就从“告诉你怎么做”开始变成“帮你把事情做完”。未来 AI 的竞争可能不只是单个模型的 Benchmark而是下面这整套组合模型 Harness Tool Skill Plugin Memory MCP 生态这次测试并不能证明 DeepSeek 每个任务都比 GPT 强。俄罗斯方块这一轮GPT / Codex 的最终完成度就更高DeepSeek 也会出现“任务说完成了但实际还有 Bug”的情况。但它至少展示了一个趋势国产模型正在快速补齐模型之外的 Agent 工具链社区也在不断贡献文件引用、多模态、数据库、设计画布、长期记忆、插件市场、TUI、桌面端和主题等扩展。DeepSeek Harness 不只是一个“DeepSeek 版 Claude Code”更像一个可以持续叠加能力的 Agent 底座。如果你正在研究 Claude Code、Codex、OpenCode 或其他 AI Agent值得亲自安装体验一次。毕竟看再多 Benchmark都不如真正让 Agent 帮你完成一次工作。我是王仕宇JavaPub。我们下期见。https://javapub.net.cn/posts/ai/deepseek/deepseek_harness.html#
返回列表