背景
CAR-bench:车载语音 Agent 基准。
- CAR-bench 简介
- Challenge 最终排行榜
- 254 个任务、58 个工具、19 条车载策略
- 用户、环境、工具调用:评测器控制
- 每题独立运行 3 次;
Pass³要求 3 次全过 - 一次错误调用、一次漏读前置状态、一次不合规回复:该 trial 归零
三类任务:
| 类型 | 额外困难 | 正确行为 |
|---|---|---|
| Base | 多轮工具操作、策略级联 | 先读状态,再按顺序执行 |
| Hallucination | 工具、参数或返回字段被移除 | 承认能力缺失;不盲调、不编造、不承诺完成 |
| Disambiguation | 用户没有给全取值 | 能内部消解则内部消解;需要时读取偏好;不猜 |
这个基准测的不是“偶尔能不能做成”,而是“能不能每次都守住边界”。