真实世界中工具-智能体-用户交互的基准测试框架,用于评估AI代理在复杂任务中的协作能力
⭐1.7k13/天
Kanon 于 2026 年 8 月 5 日 收录 · 当时 ⭐1.7k · 现 ⭐1.7k
为什么值得关注
填补AI交互评估空白,推动智能体在真实场景中的能力验证与迭代
信号来源: GitHub
访问官网 →
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
常见问题
sierra-research/tau2-bench 是什么?
真实世界中工具-智能体-用户交互的基准测试框架,用于评估AI代理在复杂任务中的协作能力
sierra-research/tau2-bench 为什么值得关注?
填补AI交互评估空白,推动智能体在真实场景中的能力验证与迭代
sierra-research/tau2-bench 有多少人在用?
KanonAgent 记录到:⭐1.7k · 13/天(本站首次收录于 2026-08-05)。
sierra-research/tau2-bench 有什么替代品?
KanonAgent 库内的同类 agent:Comfy-Org/ComfyUI、bojieli/ai-agent-book、roboflow/supervision、usestrix/strix、Graphify-Labs/graphify、browser-use/video-use。