# 评测
18 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-12,KanonAgent 库内有 18 个带「评测」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
Coarena by Coasty
AI Agent 竞技场,让多个 Agent 在真实工作场景中竞争协作,评估其真实生产力表现
AI Rank
阿拉伯语AI工具评测平台,提供基于六项客观标准的AI工具对比与独立评测,帮助用户发现可信、高质量的AI产品,解决信息过载与虚假宣传问题。
SiftedTools
一个独立的AI工具评测平台,专为电商运营者(Shopify/WooCommerce/DTC)提供真实店铺测试后的AI工具对比,覆盖10大类、7种语言。
AgentMafia – A Social Deduction Benchmark
AgentMafia 是一个社交推理类基准测试平台,用于评估 AI 助手在复杂人际互动中的推理与策略能力。
Geo Checker
Geo Checker 是一个由独立开发者运营的 AI 工具评测平台,专注提供真实、深入的 AI 工具、SaaS 和数码产品测评,帮助用户避开信息噪音,精准选择适合自己的技术产品。
VeilPlays
VeilPlays 让用户在不知情的情况下体验由AI生成的游戏,通过盲测对比不同AI模型在游戏概念、视觉与代码质量上的表现,将AI模型评估变为互动娱乐。
An AI office-work benchmark, and 4 bugs we found in our own judge
一个用于评估AI办公任务表现的基准测试平台,同时揭示了自身评估系统中的4个关键缺陷,适合AI研发团队优化模型表现
Redline AI
一个用于评估 AI Agent 行为的工具,不看最终答案,而是分析其调用记录,实现对 Agent 执行过程的客观评测。
ProviderBench
ProviderBench 提供统一标准的 LLM 服务商对比工具,可横向比较不同模型在响应时间、价格、可靠性等维度的表现。
The AI Leaderboard
全球领先AI模型性能排行榜,基于权威基准测试提供可比性评估与对比分析
I created a platform to check which AI models is the best gamer
AI游戏性能评测平台,对比不同AI模型在游戏中的表现,适合AI研究者与游戏AI开发者
VeilPlays
基于游戏化评测的AI模型对比平台,通过趣味任务直观衡量不同AI模型的真实性能差异
harveyai/harvey-labs
Harvey Labs 是一个专为法律工作设计的 AI 代理基准测试平台,用于评估和提升 AI 在法律文书、案例分析等方面的能力。
ZYNTLOX — Brutally Honest Website Roasts
60 秒内用 AI 给网站做“毒舌”评测,免费提供真实、直白的网站体验反馈
Coarena by Coasty
AI代理竞技场,让多个AI智能体在真实工作任务中竞争表现,用于评估与优化AI工作能力。
SkillWorks – every Claude Code skill, scored on whether it loads
SkillWorks 项目对 Claude Code 的所有开发技能进行实测评分,验证其实际加载与可用性,帮助开发者快速判断技能实用性。
I asked LLMs to choose between popular developer tools
用大语言模型对比主流开发者工具的优劣,生成客观评测报告,帮助开发者快速决策选型。
Tested Ai
独立评测AI与商业软件的平台,提供无广告、客观公正的产品测评,帮助用户做出明智决策。
其他标签
常见问题
「评测」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-12 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data