Hermes 本地实测报告
完成日期:2026-08-26
来源:Day 6-7 学习记录
一、测试环境
| 项目 | 配置 |
|---|---|
| 模型 | Hermes-3-Llama-3.1-8B (Q4_0 量化) |
| 推理工具 | Ollama(本地部署) |
| 接口 | Ollama /api/chat(OpenAI 兼容格式) |
| 参数 | temperature=0.0, num_predict=256-512 |
二、基础对话测试
英文能力
| 测试项 | 结果 | 评分 |
|---|---|---|
| 英文专业术语(camera cage, rig, mount) | 准确理解,回答专业 | ⭐⭐⭐⭐ |
| 英文产品推荐 | 能给出合理推荐,但不知道 SmallRig 具体产品 | ⭐⭐⭐ |
| 英文对话流畅度 | 自然流畅,接近 GPT-3.5 水平 | ⭐⭐⭐⭐ |
中文能力
| 测试项 | 结果 | 评分 |
|---|---|---|
| 中文理解 | 能理解,但表达生硬 | ⭐⭐ |
| 中文专业术语(兔笼、上手提、侧手柄) | 基本理解,但不如英文准确 | ⭐⭐ |
| 中文对话流畅度 | 生硬如机翻,不够自然 | ⭐⭐ |
结论:英文 4 分,中文 2 分。中文站 Agent 场景受限。
三、Function Calling 测试
测试设计
定义两个 Tool:
Tool 1: search_product(query, category)
→ 搜索 SmallRig 商品
Tool 2: get_product_detail(sku_id)
→ 获取商品详情
七项测试结果
| 测试 | 场景 | 是否正确 | 参数准确度 | 备注 |
|---|---|---|---|---|
| 1 | 英文单次 Tool | ✅ | ⭐⭐⭐⭐⭐ | search_product({"query": "Sony A7III", "category": "camera-cage"}) — 完美 |
| 2 | 英文多轮首步 | ✅ | ⭐⭐⭐⭐⭐ | search_product({"query": "Sony FX3", "category": "camera-cage"}) — 完美 |
| 3 | 中文单次 | ✅ | ⭐⭐⭐⭐⭐ | search_product({"query": "BMPCC 6K", "category": "camera-cage"}) — 中文理解正确 |
| 4 | 中文参数提取 | ✅ | ⭐⭐⭐⭐ | search_product({"query": "A7M4", "category": "camera-cage"}) — 遗漏了"预算500" |
| 5 | 无需 Tool | ✅ | N/A | 直接英文解释 camera cage,正确判断不调 Tool |
| 6 | 模糊意图 | ⚠️ | ⭐⭐⭐ | search_product({"query": "camera-cage", "category": "all"}) — 强行调 Tool |
| 7 | 多轮结果回传 | ✅ | ⭐⭐⭐⭐⭐ | 完美消化 tool_result,生成自然推荐(含价格+SKU+追问) |
格式合规率
7 次调用中 7 次 JSON 有效,格式合规率 100%。
延迟数据
| 阶段 | 典型耗时 |
|---|---|
| 模型加载(首次) | 8-14s |
| 模型加载(热启动) | 1-3ms |
| Prompt 评估 | 1-15s(取决于上下文长度) |
| Token 生成 | 4-10s(30-75 tokens) |
| 总延迟(含加载) | 15-30s |
| 总延迟(热启动) | 5-15s |
四、与 Claude 对比
| 维度 | Hermes-3 8B | Claude (Sonnet) | 差距 |
|---|---|---|---|
| 英文 FC 准确率 | 5/5 | 5/5 | 无 |
| 中文 FC 准确率 | 4/5 | 5/5 | 小 |
| 参数提取精度 | 遗漏"预算500" | 能提取预算约束 | 中 |
| 不调 Tool 的判断 | 1/1 | 1/1 | 无 |
| 模糊意图处理 | 强行调 Tool | 先追问澄清 | 中 |
| 多轮结果消化 | 完美 | 完美 | 无 |
| 格式合规率 | 100% JSON 有效 | 100% API 保证 | 无 |
| 延迟 | 15-30s(含加载) | 1-3s | 大 |
五、核心结论
1. FC 格式比预期可靠
Day 6 担心"正则解析可能格式错误",实测 7 次 JSON 全部有效。Hermes 8B 对 <tool_call> 标签的格式遵守度很高。
2. 中文 FC 可用,但不如英文
参数提取主体正确(query/category),但细节可能遗漏(预算约束)。中文 Agent 场景需要在 Harness 层做参数校验兜底。
3. 延迟是真实瓶颈
热启动 5-15s 对实时对话场景偏慢。如果 Agent 需要 3 轮 Tool 调用,用户可能等 15-45s。需要异步化体验设计(如"正在为您搜索..."加载态)。
4. 模糊意图需 Harness 兜底
Hermes 在模糊场景下倾向于"强行调 Tool"而非追问。Claude 的判断力更强。用 Hermes 做 Agent 时,Harness 需要在"调 Tool 之前"加一层意图清晰度判断。
5. 适合后台场景
后台 Agent 场景(营销活动创建、模板配置、表单创建)不是实时对话,用户对延迟的容忍度更高(30s 可以接受)。本地部署 Hermes 做后台 Agent 是可行的路径。