免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总

Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总 Hermes Agent 调教实录七AI Agent 配置七条铁律——200 次实验的结论汇总Hermes Agent 调教实录 · 7/8 | 实验批次HERMES-101~105 云端复现汇总基于 Hermes Agent v0.20.0 实测2026-08deepseek-v4-flash 摘要200 多次实验的结论汇总成七条铁律结构化约束、纪律进身份、记忆粗粒度、触发词精准窄、小技能单文件大技能拆 refs、约束有甜点区、验收用考卷六维。每条带实测数据和适用边界可直接复制使用。为什么要有「铁律」六篇文章六个主题约束、记忆、技能、交付包、多轮、验收。每篇都有实验数据、都有适用边界——但真到交付现场你不会带着六篇文章干活。你需要的是几条能直接用的判断。所以最后一篇把 200 多次对照实验的结论压成七条铁律。每条都带「为什么」和「什么时候不适用」——铁律不是教条是有边界的经验。七条铁律铁律一结构化约束 裸铁律内容约束文件写成分节 纪律表格要求/禁止成对不要写一句话铁律。数据结构化写法达标率 100%、成本 1.44×裸铁律达标率 96.1%、成本 2.28×还出过事实错误。为什么只写要求不写禁止Agent 会把要求「字面执行」成过度行为。不适用任务极简单无纪律要求时两种写法没差别。铁律二纪律放身份层信息放记忆层内容行为纪律先查技能/写完自测写进身份文件SOUL环境事实/偏好写进记忆MEMORY。数据同一条「先加载技能」身份文件触发 3/3记忆文件只触发 1-2/3。为什么记忆是「参考信息」身份是「自我要求」——Agent 对两者的执行强度完全不同。不适用一次性任务不跨会话时记忆层纪律的弱触发影响不大。铁律三记忆默认粗粒度细节按需补内容记忆先写 5 条左右一句话偏好不要一上来写 10 条分类细节。数据粗粒度记忆成本 0.80×比不写还省细结构化 1.24× 只换来 4% 达标率。为什么粗粒度给了方向感减少探索细粒度在一般任务上边际收益递减。不适用高度依赖具体规范的任务行业术语/字段规范细粒度必要。铁律四触发词精准窄技能名当门面内容技能描述只写真实场景触发词技能命名要直观表达能力。数据宽触发词让弱相关任务 3/3 误加载模糊描述挡不住正主加载技能名本身就是信号。为什么Agent 先看「技能名 描述」决定加载与否——误加载浪费上下文命名差则正主也不加载。不适用技能库很小10 个时误加载成本可接受。铁律五小技能单文件大技能拆 refs内容≤25KB 技能全写一个文件50KB 拆成骨架 细节文件。数据1.4KB 技能拆 refs 成本 1.29×负优化77KB 大技能拆 refs 省 13.5% 输入 token58.5k → 50.6k。为什么小技能拆了多一次加载往返大技能单文件一次加载不完要反复读。不适用25-50KB 的技能按内容形态判断查表型拆、方法论留。铁律六约束有甜点区交付包按形态选配内容约束 1-2 层结构化是甜点1.4-1.7×100% 达标全家桶过载2.66×纪律稀释。交付按形态分档多轮配纪律层 记忆单轮配全套。数据单层结构化 1.44×/100%三层组合 1.66×/100%四层全家桶 2.66×/96.1%。为什么约束本质是上下文指令指令越多注意力越分散层间还可能冲突。不适用客户明确要求全配置矩阵时极少数合规场景过载成本要提前报给客户。铁律七验收用考卷 六维 取证内容考卷选约束敏感型任务六维评估一次成功率/达标率/自我修正/成本/稳定性/退化风险证据可复现。数据v1 考卷漏「事实准确」用例事实错误输出满分通过v2 补上后 100% 暴露。云端复现确认结论跨环境可迁移达标率 94.1% / ~97% 一致。为什么没有验收 没有「合格」的定义交付说不清。不适用纯内部实验不对外交付时验收可以简化到只跑考卷。结论汇总表配置决策的总入口一张图多轮对话IM 接入单轮自动化是否交付一个 Agent交付形态纪律层 记忆输出靠对话全套纪律 输出格式技能层1-2 个精准触发词验收考卷 六维 取证达标交付版本锁定按铁律 1-6 定位修复#铁律核心数据一句话1结构化 裸铁律100% vs 96.1%1.44× vs 2.28×要求/禁止成对写2纪律进身份信息进记忆触发 3/3 vs 1-2/3记忆是参考身份是要求3记忆粗粒度起步0.80× vs 1.24×5 条一句话起步4触发词精准窄误加载 3/3 vs 0/3技能名当门面5体积分界 25/50KB1.29× vs 省 13.5%小不拆大拆6甜点区 形态分档1.4-1.7× vs 2.66×别全家桶7考卷 六维 取证事实用例补漏可复现地能用这套方法的边界诚实版这套铁律来自 200 多次会话但有几件事我们还没测长对话退化8 轮内无退化是实测20-50 轮的边界未知交付中观察中模型差异全部实验基于 deepseek-v4-flash换模型后成本绝对值变相对比率可参考框架差异实验载体是 Hermes Agent开源其他框架的约束注入/记忆机制不同阈值要实测任务类型考卷是 4 个约束敏感型任务纯创作类/纯检索类任务的配置结论可能不同欢迎用你手上的 Agent 框架复现这套方法——方法比结论更通用立考卷、定基线、跑对照、取六维。如果复现结果和我们不一样欢迎来评论区对账那正是这个系列存在的意义。系列完结从「AGENTS.md 怎么写」到「怎么验收」七篇文章、200 多次实验——我们把「AI Agent 配置」从经验之谈变成了可测量的数据。本系列的核心资产全部可直接复制AGENTS.md 结构化模板第一篇粗粒度记忆模板第二篇技能描述范式 体积判据第三篇交付包分档配置第四篇多轮交付三件事第五篇验收报告模板第六篇后续我们会在真实交付中继续验证和补充这些结论尤其是长对话退化边界有新数据会在评论区/后续文章同步。 你复现了哪条铁律结果一致还是翻车了评论区对账我们持续更新。本系列完——欢迎回看 获取完整阅读信息。
返回列表