# 基准测试
16 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-12,KanonAgent 库内有 16 个带「基准测试」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
PhysicsThinking
一个AI物理推理能力评测平台,允许开发者通过API接入AI代理,在8个物理场景中测试其模拟现实世界的能力,推动AI具身认知发展
VetoBench – benchmarking AI memory beyond retrieval
一个用于评估AI模型记忆能力的基准测试框架,超越传统检索机制,测试模型在复杂上下文中的长期记忆与推理能力,适用于AI研究与模型优化。
Stickblade Arena – I made two LLMs sword-fight to benchmark them
一个用于对比大语言模型性能的趣味性对抗平台,让两个LLM以‘剑斗’形式比拼推理与生成能力,适合AI研究员和开发者测试模型表现。
Deep Skill Finder – Find agent skills using real execution benchmarks
Deep Skill Finder 是一个基于真实执行基准测试的智能工具,帮助开发者和 AI 研究者评估与选择大模型代理(Agent)的技能,提升 AI 应用的可靠性与性能。
DFAH-Bench – same agent decision, different tool paths
DFAH-Bench 是一个评估AI代理决策路径差异的基准测试框架,帮助研究者对比不同工具组合对同一任务的影响
A fixed harness for comparing LLM agent memory systems
一个用于对比大语言模型代理记忆系统的固定基准测试框架,为LLM Agent研究提供可复现的评估标准。
An AI office-work benchmark, and 4 bugs we found in our own judge
一个用于评估AI在办公场景下表现的基准测试工具,同时揭示了其自身评估系统中的4个缺陷,适合AI研究者与开发者用于验证AI办公助手的真实能力
Oqoqo – build evals and custom benchmarks for real-world tasks
Oqoqo 是一个用于构建真实任务评估和自定义基准测试的工具,帮助开发者验证AI模型在实际场景中的表现,适合AI研究者与工程团队。
SWE-ContextBench – A Benchmark for Context Learning in Coding Agents
SWE-ContextBench 是一个用于评估编程智能体(Coding Agents)理解上下文能力的基准测试集,为 AI 编程工具的性能评估提供标准化参考,适合 AI 研究者和
Artificial Analysis tool to create custom benchmarks for any use case
一款用于为任意场景自定义创建AI性能基准测试的分析工具,帮助开发者和研究者量化AI模型在特定任务中的表现,适合AI工程与评估团队使用。
A benchmark for AI agent guardrails that caught my own plugin
一项针对 AI 代理安全防护机制的基准测试,揭示了现有插件在安全防护上的漏洞,推动 AI 应用的可信与可控发展。
MacroBench - Financial Agent Benchmark
一个金融AI代理基准测试平台,评估AI能否胜任对冲基金级别的投资决策,适合AI研究者与量化团队,亮点是真实金融场景下的性能验证。
TreasuryBench
TreasuryBench 是公开的 AI 金融建议基准测试平台,用于评估和比较 AI 在投资建议上的表现,适合金融科技开发者与研究者,亮点是透明化、可复现的 AI 金融决策评估体
SignalBench
基于公开证据的软件性能基准测试平台,提供可验证、可对比的竞品性能数据
AgentMafia – A Social Deduction Benchmark
AgentMafia 是一个用于评估人工智能代理在社交推理与欺骗行为上表现的基准测试框架,适合 AI 研究者和开发者,亮点是模拟多人社交博弈场景并量化智能体的策略与欺骗能力。
datacurve-ai/deep-swe
一个用于评估前沿编程智能体在真实、长周期工程任务上表现的基准测试框架,专为AI编程研究者和开发者设计,支持可复现的复杂任务评测。
其他标签
常见问题
「基准测试」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-12 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data