Day 5 · 第1周产出整理
| 属性 | 值 |
|---|---|
| 日期 | 2026-08-19 |
| 周次 | 第1周:双轨认知框架建立 |
| 轨 | 双轨 · 整理 |
| 时间 | 1 小时 |
| 状态 | ✅ 已完成 |
📋 Checklist
- 回顾 Day 1-4 的所有笔记
- 对比表 → 产出归档/对比笔记.md
- 触点评分表 → 产出归档/20260818-前台触点分析/前台Agent适配度评分表.md
- 产品方案 → 产出归档/20260818-前台触点分析/场景化购物Agent产品方案.md
- 提炼本周 5 条关键洞察
- 更新总览 + 进度
📤 本周产出汇总
| 产出 | 状态 | 位置 |
|---|---|---|
| Hermes vs Claude Tool Use 对比表 | ✅ | 产出归档/对比笔记.md |
| 前台 Agent 适配度评分表 | ✅ | 产出归档/20260818-前台触点分析/ |
| 场景化购物 Agent 产品方案 | ✅ | 产出归档/20260818-前台触点分析/ |
| 第1周学习总结 | ✅ | 本文件 |
✍️ 第1周关键洞察
洞察 1:Tool Use 就 3 件事
tools 定义 + tool_choice 控制 + tool_use/tool_result 轮转。Claude 用 API 原生 JSON block,Hermes 用 XML 文本标签——本质一样,可靠性差一档。
stop_reason是 Claude 独有的关键机制,让 Agent 循环不需要「猜」。
洞察 2:Claude 是标杆,Hermes 是替代
Claude Tool Use 是行业标杆(开箱即用、strict 校验、并行调用、可控性强),适合快速验证。Hermes 是开源替代(自部署、数据隐私、成本低),适合大规模部署。混合方案可能最优:前台用 Claude(多语言),后台用 Hermes(数据不出服务器)。
洞察 3:场景化推荐是 SmallRig 的核心卡点
场景词搜索仅 1.0%,但 83.6% 的多搜索会话在「拼凑」场景需求(先搜相机再搜配件)。用户不是没需求,是不知道可以这样搜。Agent 的场景化对话正好填补这个空白。
洞察 4:数据验证了方案可行性
US 单渠道日均 164 个搜索会话,71.1% 搜索≥2 次,日均 117 个会话可触发 Agent。全渠道预估日均 1,053 个。方案 2「搜索 2 次触发 Agent」有充分的数据支撑。
洞察 5:三步迭代,Tool 复用,成本递减
搜索 Agent → 详情页 Agent → 订单 Agent,覆盖用户全旅程。11 个 Tool 中 4 个共享,每个 Phase 只新增 2-3 个。每个 Phase 有关键决策点,不盲目投入。
洞察 6:大模型是无状态的,每次请求必须带全部上下文
大模型没有记忆——每次对话都是全新的。每次 API 请求必须携带:system(每次一样)、tools(每次一样)、tool_choice(每次一样)、messages(全部历史,越来越长)。成本增长主要来自 messages 膨胀,system + tools 成本恒定。这解释了为什么对话越长越贵,也解释了为什么需要 Memory 机制来压缩历史。
每次请求带的东西:
┌─────────────────────────────────────────┐
│ 每次请求 │
│ │
│ ① system(固定,每次一样) │
│ → 几百 tokens │
│ │
│ ② tools(固定,每次一样) │
│ → 和工具数量成正比,越多越贵 │
│ │
│ ③ tool_choice(每次一样或不同) │
│ → 几个 bytes,可忽略 │
│ │
│ ④ messages(越来越长) │
│ → 对话越长,这个数组越大 │
│ → 这是主要的成本增长来源 │
└─────────────────────────────────────────┘
完整请求示例(第 3 轮对话后):
{
"model": "claude-opus-5",
"max_tokens": 1024,
"system": "你是 SmallRig 的 AI 购物助手...",
"tools": [
{"name": "search_product", "description": "...", "input_schema": {...}},
{"name": "get_weather", "description": "...", "input_schema": {...}}
],
"tool_choice": {"type": "auto"},
"messages": [
{"role": "user", "content": "推荐兔笼"},
{"role": "assistant", "content": [{"type": "tool_use", "id": "toolu_01", "name": "search_product", "input": {"query": "兔笼"}}]},
{"role": "user", "content": [{"type": "tool_result", "tool_use_id": "toolu_01", "content": "[...]"}]},
{"role": "assistant", "content": "推荐 A7III 兔笼 ¥899"},
{"role": "user", "content": "有没有更便宜的"}
]
}
第 3 轮消息「有没有更便宜的」只有 6 个字,但请求体已经包含了前面 4 轮的全部历史 + system + tools。对话越长,每次请求的有效信息占比越低。
❓ 本周遗留问题
- Hermes 的 FC 准确率实际表现?(Day 7 实测验证)
- 中文能力不足的绕过方案?
- 8B vs 70B 的 Agent 能力差距?
- 当前 AI 搜索改造为 Agent 的第一步:把模型输出改为
<tool_call>格式 - 非 US 渠道搜索行为是否类似?(需补充数据)
- 搜索≥2 次但未加购的用户占比?(需关联订单数据)
📊 第1周学习数据
| 指标 | 数值 |
|---|---|
| 学习天数 | 5 天(实际 4 天学习 + 1 天整理) |
| 轨1(架构认知) | Day 1 + Day 3 |
| 轨2(项目落地) | Day 2 + Day 4 |
| 产出文档 | 5 份 |
| 自测题 | 18 道 |
⏭️ 下一周 → Day 6