📚 Harness 学习计划 / 第1周 / Day05_周产出整理

Day 5 · 第1周产出整理

属性
日期 2026-08-19
周次 第1周:双轨认知框架建立
双轨 · 整理
时间 1 小时
状态 ✅ 已完成

📋 Checklist


📤 本周产出汇总

产出 状态 位置
Hermes vs Claude Tool Use 对比表 产出归档/对比笔记.md
前台 Agent 适配度评分表 产出归档/20260818-前台触点分析/
场景化购物 Agent 产品方案 产出归档/20260818-前台触点分析/
第1周学习总结 本文件

✍️ 第1周关键洞察

洞察 1:Tool Use 就 3 件事

tools 定义 + tool_choice 控制 + tool_use/tool_result 轮转。Claude 用 API 原生 JSON block,Hermes 用 XML 文本标签——本质一样,可靠性差一档。stop_reason 是 Claude 独有的关键机制,让 Agent 循环不需要「猜」。

洞察 2:Claude 是标杆,Hermes 是替代

Claude Tool Use 是行业标杆(开箱即用、strict 校验、并行调用、可控性强),适合快速验证。Hermes 是开源替代(自部署、数据隐私、成本低),适合大规模部署。混合方案可能最优:前台用 Claude(多语言),后台用 Hermes(数据不出服务器)。

洞察 3:场景化推荐是 SmallRig 的核心卡点

场景词搜索仅 1.0%,但 83.6% 的多搜索会话在「拼凑」场景需求(先搜相机再搜配件)。用户不是没需求,是不知道可以这样搜。Agent 的场景化对话正好填补这个空白。

洞察 4:数据验证了方案可行性

US 单渠道日均 164 个搜索会话,71.1% 搜索≥2 次,日均 117 个会话可触发 Agent。全渠道预估日均 1,053 个。方案 2「搜索 2 次触发 Agent」有充分的数据支撑。

洞察 5:三步迭代,Tool 复用,成本递减

搜索 Agent → 详情页 Agent → 订单 Agent,覆盖用户全旅程。11 个 Tool 中 4 个共享,每个 Phase 只新增 2-3 个。每个 Phase 有关键决策点,不盲目投入。

洞察 6:大模型是无状态的,每次请求必须带全部上下文

大模型没有记忆——每次对话都是全新的。每次 API 请求必须携带:system(每次一样)、tools(每次一样)、tool_choice(每次一样)、messages(全部历史,越来越长)。成本增长主要来自 messages 膨胀,system + tools 成本恒定。这解释了为什么对话越长越贵,也解释了为什么需要 Memory 机制来压缩历史。

每次请求带的东西:

┌─────────────────────────────────────────┐
│                每次请求                  │
│                                         │
│  ① system(固定,每次一样)              │
│     → 几百 tokens                        │
│                                         │
│  ② tools(固定,每次一样)               │
│     → 和工具数量成正比,越多越贵          │
│                                         │
│  ③ tool_choice(每次一样或不同)         │
│     → 几个 bytes,可忽略                 │
│                                         │
│  ④ messages(越来越长)                  │
│     → 对话越长,这个数组越大              │
│     → 这是主要的成本增长来源              │
└─────────────────────────────────────────┘

完整请求示例(第 3 轮对话后):

{
  "model": "claude-opus-5",
  "max_tokens": 1024,
  "system": "你是 SmallRig 的 AI 购物助手...",
  "tools": [
    {"name": "search_product", "description": "...", "input_schema": {...}},
    {"name": "get_weather", "description": "...", "input_schema": {...}}
  ],
  "tool_choice": {"type": "auto"},
  "messages": [
    {"role": "user", "content": "推荐兔笼"},
    {"role": "assistant", "content": [{"type": "tool_use", "id": "toolu_01", "name": "search_product", "input": {"query": "兔笼"}}]},
    {"role": "user", "content": [{"type": "tool_result", "tool_use_id": "toolu_01", "content": "[...]"}]},
    {"role": "assistant", "content": "推荐 A7III 兔笼 ¥899"},
    {"role": "user", "content": "有没有更便宜的"}
  ]
}

第 3 轮消息「有没有更便宜的」只有 6 个字,但请求体已经包含了前面 4 轮的全部历史 + system + tools。对话越长,每次请求的有效信息占比越低。


❓ 本周遗留问题

  1. Hermes 的 FC 准确率实际表现?(Day 7 实测验证)
  2. 中文能力不足的绕过方案?
  3. 8B vs 70B 的 Agent 能力差距?
  4. 当前 AI 搜索改造为 Agent 的第一步:把模型输出改为 <tool_call> 格式
  5. 非 US 渠道搜索行为是否类似?(需补充数据)
  6. 搜索≥2 次但未加购的用户占比?(需关联订单数据)

📊 第1周学习数据

指标 数值
学习天数 5 天(实际 4 天学习 + 1 天整理)
轨1(架构认知) Day 1 + Day 3
轨2(项目落地) Day 2 + Day 4
产出文档 5 份
自测题 18 道

⏭️ 下一周 → Day 6