# 评估
22 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-11,KanonAgent 库内有 22 个带「评估」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
An AI agent skill repo built around evals, not demos
一个以评估为核心而非演示的AI代理技能库,强调真实性能验证。
Conversational AI Fluency Assessment
AISA 2.0 是全球首个对话式AI语言能力评估平台,通过20分钟自适应对话生成详细报告,帮助用户真实评估自己的AI沟通能力,适合求职或语言学习者。
Plurai
为AI应用提供定制化评估与安全防护能力,可按业务场景训练AI的‘性格’与行为边界
Spendict – a performance marketer's verdict for AI agents, over MCP
Spendict 是为性能营销人员设计的 AI 代理评估工具,对比 MCP 等方案,帮助快速判断 AI 代理在实际投放中的表现与性价比。
I can appraise your data for purchase
提供数据资产评估服务,帮助数据拥有者判断其数据的市场价值,推动数据资产化与交易流通。
Dagaz AI Readiness Scorecard
2分钟完成的 AI 就绪度测评工具,通过8个问题评估企业是否准备好引入 AI,适合管理者快速诊断。
Alsa Market & Risk Readiness Quiz
Alsa Market & Risk Readiness Quiz 是一款 Fintech 工具,可在 90 秒内评估企业的市场风险架构,帮助机构快速识别潜在风险。
An AI agent skill repo built around evals, not demos
专注于AI智能体评估而非演示的技能仓库,提供可复现、可量化的AI能力评测体系。
AgentLab
开源项目,用于测试、评估和理解AI智能体的行为表现,适合AI研究人员和开发者,亮点是提供标准化评估框架与可视化分析。
DFAH-Bench – same agent decision, different tool paths
DFAH-Bench 是一个评估AI代理决策路径差异的基准测试框架,帮助研究者对比不同工具组合对同一任务的影响
TraceLogicAI: AI Architecture Evaluation
基于证据的AI架构评估工具,帮助开发者和研究者客观对比不同AI模型设计,避免主观判断
sierra-research/tau2-bench
真实世界中工具-智能体-用户交互的基准测试框架,用于评估AI代理在复杂任务中的协作能力
Oqoqo – build evals and custom benchmarks for real-world tasks
Oqoqo 是一个用于构建真实任务评估和自定义基准测试的工具,帮助开发者验证AI模型在实际场景中的表现,适合AI研究者与工程团队。
Agent Memory Leaderboard – first public results for AI memory systems
一个公开的AI记忆系统性能排行榜,用于评估和比较不同AI代理的记忆能力,帮助开发者选择更优的记忆架构。
Self-bench – build SWE-bench style evals from private repos
基于私有代码仓库构建类似 SWE-bench 的软件工程评估体系,帮助团队自动化测试和衡量开发能力。
Bench-bench – Long-horizon planning, measured in bench press
Bench-bench 是一个用于长周期规划任务的AI评估框架,以“卧推次数”作为衡量智能体长期规划能力的趣味指标,适合AI研究员和智能体开发者,亮点是用直观的类比方式评估复杂决策
AI Evaluation Tools
AI Evaluation Tools 是一套用于测试大模型、RAG 系统和 AI Agent 的评估工具,帮助开发者验证 AI 产品的可靠性与性能。
EvalTrim
开源项目,用于验证和筛选 AI 代理评估任务的有效性,帮助团队识别真正有价值的 AI 测试基准。
Agent Review Studio – local-first agent evaluation workbench
Agent Review Studio 是一个本地优先的 AI 代理评估工作台,支持对 AI 代理行为进行可视化、可复现的评测与调试。
Coder Eval – A Framework for Evals
用于评估AI代码生成能力的标准化框架,支持自动化测试与结果对比,提升开发可信度。
Agenomics
用于评估AI智能体性能并构建真实世界应用证据的工具平台,适合AI研究人员与开发者验证智能体实际表现
Wayfinder – A reference implementation for evaluating AI applications
Wayfinder 是一个用于评估 AI 应用的参考实现,帮助开发者构建、测试和衡量 AI 产品的效果与可靠性,适合 AI 工程师与产品团队使用,亮点是提供标准化评估框架与可复现的
其他标签
常见问题
「评估」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-11 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data