📚 Harness 学习计划 / 第2周 / Day10_周产出整理

Day 10 · 第2周产出整理

属性
日期 2026-08-26
周次 第2周:动手体验+场景深挖
双轨 · 整理
时间 1 小时
状态 ✅ 已完成

📋 Checklist


📤 本周产出汇总

产出 状态 位置
Hermes 本地实测报告 本地实测报告
后台 Agent 适配度评分表 后台Agent适配度评分表
落地页搭建 Agent 化方案 后台agent落地场景汇总/落地页搭建Agent化方案20260825
营销活动创建 Agent 化方案 后台agent落地场景汇总/营销活动创建Agent化方案
表单创建 Agent 化方案 后台agent落地场景汇总/表单创建Agent化方案
第2周学习总结 本文件

✍️ 第2周回顾

Day 6 · 安装 Ollama + Hermes 跑通(轨1)

核心收获:Hermes 8B 英文 4 分,中文 2 分。System Prompt 控制行为,但知识缺口靠 Tool 填补。

Day 7 · 测试 Hermes Function Calling(轨1)

核心收获:FC 格式合规率 100%,但延迟是真实瓶颈。

Day 8 · 通读后台 Admin 各模块(轨2)

核心收获:27 模块 → 6 大类,两大核心场景确认。

Day 9 · 深挖后台运营痛点(轨2)

核心收获:3 个核心场景确认,社区审核暂不纳入。


💡 第2周关键洞察 Top 5

洞察 1:Hermes 的 FC 能力比预期可靠,但延迟是真实瓶颈

格式合规率 100%,7 次 JSON 全部有效。但 15-30s 的延迟让实时对话场景受限。后台 Agent 场景(非实时)是 Hermes 的最佳落地场景。

洞察 2:Agent 设计核心原则——确认优先

三个场景都遵循同一个原则:Agent 不做自动执行,做智能填表 + 人工确认。创建型操作的容错度低,运营需要掌控感和微调能力。确认环节不是"模型不够好"的妥协,而是产品设计原则。

洞察 3:三个场景可以统一架构

营销活动创建、模板配置工具、表单创建本质相同:自然语言 → 结构化参数 → API 调用 → 确认。 可以复用同一套 Agent 框架,区别只在输入解析层和模板匹配层。

洞察 4:场景筛选要务实,评分表是参考

社区审核评分 20 分(⭐⭐⭐⭐),但实际内容量太少(每天几个帖子),Agent 化投入产出比不高。评分表是参考,最终决策要看实际业务量。 不需要强行凑 5 个场景——3 个够用。

洞察 5:双轨并行正在产生化学反应

轨1(Hermes 技术认知)告诉了我们"能做什么"和"不能做什么"——格式合规率 100%、延迟 15-30s、中文 2 分。轨2(项目落地设计)告诉了我们"该做什么"——后台 3 个创建型场景。两条轨的交叉点就是最佳落地路径:用 Hermes 做后台 Agent(非实时,容忍延迟),用确定性的 Tool 调用替代模糊的中文对话。


❓ 本周遗留问题

  1. Hermes 的 FC 准确率? → ✅ 已验证:格式合规率 100%
  2. 中文能力不足的绕过方案?(前台用 Claude,后台用 Hermes 是可行路径)
  3. 8B vs 70B 的 Agent 能力差距?(待第 3 周评估)
  4. 非 US 渠道搜索行为是否类似?(待补充数据)
  5. 后台 admin 哪些模块适合 Agent 化? → ✅ 已确认:3 个核心场景
  6. 页面模板的 description 字段设计,后端是否需要新增接口?
  7. 营销活动创建的 Excel 解析,是否需要标准模板?
  8. 三个场景的 Agent Tool 定义,具体 API 参数是什么?

📊 第2周数据总结

指标 数据
完成天数 5 天(Day 6-10)
轨1产出 Hermes 本地实测报告(7 项 FC 测试 + Claude 对比)
轨2产出 27 模块全景 + 3 个场景方案 + 适配度评分表
方案归档 3 份 Agent 化方案文档
累计进度 10/30 天(33.3%)
累计洞察 14 条

⏭️ 完成后:下一周 → Day 11