当前进度
📌 新会话从这里开始!先读这个文件了解进度。
基本信息
- 开始日期:2026-08-12
- 当前进度:第 3 周(2026-08-27)
- 当前周:第 3 周 / 共 6 周
- 当前任务:Day 12 - 读《AI Agents in Action》第4章 Memory
- 整体进度:11/30 天完成(36.7%)
第 1 周完成
| 天 | 日期 | 完成内容 | 产出 |
|---|---|---|---|
| Day 1 | 2026-08-12 | 精读 Hermes-3 Model Card | ChatML/FC/四角色/System Prompt |
| Day 2 | 2026-08-13 | 通读项目 AI 搜索完整链路 | 数据流图+局限性分析 |
| Day 3 | 2026-08-17 | 读 Anthropic Tool Use 文档做对比 | 四层讲解+对比表+速查卡 |
| Day 4 | 2026-08-18 | 前台触点分析+搜索数据评估 | 触点评分+方案2可行性+指标体系 |
| Day 5 | 2026-08-19 | 第1周产出整理 | 6条关键洞察+周总结 |
| Day 6 | 2026-08-20 | 安装 Ollama + 拉取 Hermes 跑通 | 实测数据+中英文对比+System Prompt验证 |
| Day 7 | 2026-08-24 | 测试 Hermes Function Calling | 7项实测+FC对比表+格式合规率100% |
| Day 8 | 2026-08-25 | 通读后台 Admin 各模块 | 27模块全景+Agent适配评分+2个核心场景方案 |
| Day 9 | 2026-08-26 | 深挖后台运营痛点 | 3个核心场景确认+社区审核暂不纳入+场景分类体系 |
| Day 10 | 2026-08-26 | 第2周产出整理 | 周总结+实测报告+评分表归档+5条Top洞察 |
| Day 11 | 2026-08-27 | 读《AI Agents in Action》第3章 Tool Use | ✅ 读书笔记:Agent Loop + Schema 设计 + ReAct 模式 + PM/开发职责边界 |
第 1 周关键洞察
- Tool Use 就 3 件事:tools 定义 + tool_choice 控制 + tool_use/tool_result 轮转
- Claude 是标杆,Hermes 是替代:快速验证用 Claude,大规模部署用 Hermes
- 场景化推荐是核心卡点:场景词搜索仅 1.0%,83.6% 会话在「拼凑」需求
- 数据验证了方案可行性:日均 117 个会话可触发 Agent,全渠道预估 1,053 个
- 三步迭代,Tool 复用:搜索→详情页→订单,4 个共享 Tool,成本递减
当前进行中
| 天 | 轨 | 任务 | 预计产出 |
|---|---|---|---|
| Day 12 | 轨1 | 读《AI Agents in Action》第4章 Memory | 读书笔记 |
第 3 周新增洞察
Agent Loop = 五步循环:Plan → Call → Execute → Observe → Respond,LLM 管决策,Harness 管执行
Tool Schema 是 PM 和开发的接口协议:PM 写好 description + enum + required,开发按 Schema 实现 Harness
ReAct = 边想边做 + 思考可见:模型训练时决定的,Claude/Hermes 原生不支持但可通过 System Prompt 模拟
PM 设计 Tool 要先画全局字段字典:所有 Tool 的输入输出对齐同一本字典,避免字段名不一致
错误处理两层:System Prompt 管原则,tool_result 管这一次:PM 重点设计每种异常场景的 tool_result 返回内容
Hermes 8B 英文 4 分,中文 2 分:英文专业术语准确,中文生硬如机翻,中文站 Agent 场景受限
1s 延迟是可接受边界:多轮 Tool 调用(3 次)总延迟 = 3s + 工具时间,体验在及格线
System Prompt 可控行为,但知识缺口靠 Tool 填补:模型自己不知道 SmallRig 产品,这正是 Agent 存在的意义
Ollama 是接口层,不是 Harness:三层的中间层——对上提供 API,对下管理推理
Hermes FC 格式合规率 100%:7 次实测 JSON 全部有效,比预期更可靠
中文 FC 可用但不完美:参数提取主体正确,但细节(预算约束)易遗漏
延迟是真实瓶颈:本地推理 15-30s,3 轮 Tool 调用可能 15-45s,需要异步体验设计
模糊意图需 Harness 兜底:Hermes 倾向于强行调 Tool,需要在 Harness 层加意图门控
后台 Agent 化价值公式:价值 = 操作频次 × 单次耗时 × 渠道数 × 币种复杂度
两大核心场景:营销活动创建(优惠券/规则/直降/表单)+ 模板配置工具(LandingPageTool/DynamicFormTool)
componentTemplateStore 是后端 API:Agent 可直接查询模板库,基于模板创建更可靠
Agent 设计核心原则:确认优先:Agent 不做自动执行,做智能填表 + 人工确认
三个场景统一架构:自然语言 → 结构化参数 → API 调用 → 确认,可复用同一套 Agent 框架
场景筛选要务实:评分表是参考,最终决策要看实际业务量(社区审核评分高但量少,暂不纳入)
遗留问题
Hermes 的 FC 准确率实际表现?→ ✅ Day 7 已验证:格式合规率 100%,7/7 正确- 中文能力不足的绕过方案?(前台用 Claude,后台用 Hermes 是可行路径)
- 8B vs 70B 的 Agent 能力差距?
- 当前 AI 搜索改造为 Agent 的第一步:把模型输出改为
<tool_call>格式 - 非 US 渠道搜索行为是否类似?(需补充数据)
后台 admin 哪些模块适合 Agent 化?(Day 8-9 回答)→ ✅ Day 8 已回答:27 模块评分,两大核心场景确认
下一步行动
- 打开 学习记录/第3周/Day11_读书AIAA第3章.md
- 按 checklist 完成今日任务
- 完成后更新本文件