# 测试
80 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-10,KanonAgent 库内有 80 个带「测试」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
Checksum AI
为代码AI代理提供测试辅助的工具,解决AI生成代码后难以验证正确性与鲁棒性的痛点,适合开发团队与AI工程师。
Buddy Visual Tests
Buddy Visual Tests 利用 AI 智能体自动执行 UI 可视化回归测试,捕捉每次界面变更并像素级比对基线,确保视觉一致性,提升前端开发质量。
Deltix – AI Driven Testing
Deltix 是一个由 AI 驱动的自动化测试工具,帮助开发者自动生成和执行测试用例,解决传统测试耗时长、覆盖率低的痛点,主要面向开发团队和软件工程师。
Text2Test | 0 → Test Suite in Minutes
通过自然语言描述生成可执行的自动化测试脚本,让非技术背景人员也能快速构建稳定测试用例
Fauvido Technologies
为硬件开发团队提供物理计算的测试层,通过AI或手动方式在真实硬件的仿真环境中注入故障、编写测试用例,提升固件测试效率
QAProvider
QAProvider 让产品团队连接全球真实设备上的真实用户进行测试,发现 CI 流水线无法捕捉的设备兼容性问题,提升产品在真实环境中的稳定性。
Milo
Milo 是AI邮件代理测试工具,通过真实SMTP发送预设角色的邮件(如愤怒客户、GDPR请求等),用于测试AI邮件系统的响应能力
Tracely
Tracely 是一个开源的 AI 驱动的测试工具,能自动分析 Agent 调用轨迹,识别失败并生成可复现的测试用例,防止错误代码合并到主分支。
PreScale
开源命令行负载测试工具,可自动向目标 URL 发起虚拟用户请求,识别系统瓶颈并用自然语言解释失败原因。
AgentLab
一个开源的本地优先 AI agent 测试平台,支持通过 YAML 配置测试套件,安全执行命令,提供 PASS/FAIL/ERROR 分析和可下载报告,适合开发者本地调试 AI a
VeriWasp
一个AI驱动的产品测试工具,可自动模拟用户操作(如注册、下单)并检测功能缺陷,支持手动运行或接入CI/CD流水线。
Flasqo
Flasqo 是一个 AI 驱动的 API 测试平台,只需粘贴接口地址,即可自动生成功能、安全、性能等 14+ 类型的测试用例,帮助开发者快速完成全链路测试,无需手动编写。
Abloh
Abloh 是一个自动化代码审查工具,提交代码后自动对每个变更行运行 AI 驱动的变异测试与不变量测试,帮助开发者验证测试覆盖率并发现潜在缺陷。
The self-improving QA agent for software teams
一个能自我进化的 QA 自动化 agent,专为软件团队设计,能持续学习测试用例、发现新 bug 并优化测试流程,提升团队质量保障效率。
testmagic.link – Zero-setup magic link testing for coding agents
为编码代理(coding agents)提供零配置的魔法链接测试功能,简化自动化测试流程。
Before Users Do
为编程 AI 助手(coding agent)提供浏览器级 QA 能力,通过 MCP 协议让 AI 自动运行流程、收集控制台与网络请求证据,支持结构化测试路径或自由操作(点击/说话
A prompt to make LLMs write property-based tests
一个提示词模板,可让大模型自动生成属性测试,提升代码可靠性,面向关注质量保障的开发者;
A reproducible harness for catching agent-eval cheating
一个可复现的测试框架,用于检测智能体评估中的作弊行为,保障AI代理评测的公平性与可靠性,专为AI研究者与开发者设计;
Test Data Filler
自动填充网页表单的测试数据,支持真实、无效、边界和注入攻击等四类测试场景,提升开发与测试效率。
I Repurposed Unit Tests to Show How Much Coding Agents "Improvise"
用单元测试作为评估 AI 编码代理‘即兴发挥’程度的创新方法,通过对比测试通过率来量化 Agent 的代码生成可靠性,帮助开发者判断 AI 生成代码的可信度
Agent-Eval
Agent-Eval 是用于LLM Agent的统计回归测试工具,可对比两个Agent版本在50次运行中的表现差异,输出p值、效应量和置信区间,验证行为是否真正改变。
MacroBench - Financial Agent Benchmark
MacroBench 是一个金融 AI 代理的基准测试平台,通过模拟金融危机、互联网泡沫和疫情崩盘等历史市场场景,评估 AI 代理在复杂环境下的交易表现,为开发者提供可量化的性能对
Termaxa – my agent gate passed its security rig, failed a two-user test
一个AI代理网关,通过安全测试但未通过双用户场景测试,暴露了AI代理在协作场景中的可靠性挑战
Closed Testing Assistant
为应用开发者提供闭环测试管理工具,帮助寻找测试伙伴、管理测试应用、跟踪进度并生成专业测试报告,提升内测效率。
Poleric
Poleric 是一个 AI 驱动的测试自动化平台,专为构建稳定、可扩展的回归测试而设计,无需编写脆弱的脚本即可自动验证 Web 应用。
Talotrace
一款能自主探索真实用户路径、自动验证功能完整性的AI测试工具,突破传统测试仅依赖预设用例的局限,提升测试覆盖率与效率。
Agenci
Agenci为AI Agent提供CI/CD流水线,能在部署前自动运行功能测试、安全检查和回归对比,帮开发者及团队提前发现prompt注入、工具权限等问题。
Treseko
一个开源自托管的测试管理平台,帮助团队统一管理用例、执行记录、缺陷和发布报告,通过AI工作流自动生成测试内容,适合开发与测试团队使用。
AutomationCodeless
AutomationCodeless 允许用户无需编写代码即可构建和运行 API、数据库(如 Postgres、MySQL)及 AWS 的端到端自动化测试流程,支持链式调用与断言。
PaloQA
本地优先的Chrome扩展,自动记录、回放并验证端到端浏览器流程,支持AI驱动的视觉与API差异检测,用于自动化测试与回归审计
Riglet
专为开发者和测试人员设计的 Windows 浏览器,支持拦截重写 API、自动化鼠标键盘操作和代理式爬虫,替代多个工具。
Open-source simulation testing infra for voice agents
一个开源的语音智能体仿真测试基础设施,支持对语音助手在复杂场景下的行为进行自动化测试,适合AI语音产品开发者与测试工程师,亮点是可模拟真实对话与异常情况。
SanityCheck
SanityCheck 利用 AI 代理在真实浏览器中自动测试网页应用,模拟用户操作并检测缺陷,专为开发者和 QA 团队设计,提升测试效率与覆盖率。
Selector Forge – browser extension for AI-generated resilient selectors
Selector Forge 是一个浏览器扩展,利用 AI 生成更稳定、抗 DOM 变化的选择器,帮助前端测试与自动化脚本开发者减少因页面变动导致的失败。
QAIT - Configure once. AI tests forever.
一款AI驱动的自动化测试工具,支持一次配置长期运行,实现“ vibe testing”(氛围测试)——即模拟真实用户行为验证系统稳定性,专为开发团队优化QA流程
Suitest
免费的端到端AI测试与MCP服务器,替代TestSprite,专为开发者提供AI驱动的自动化测试解决方案,支持复杂AI应用验证。
LangDrift – test AI agents across languages
LangDrift 是一个用于测试 AI 代理在多语言环境下表现的工具,帮助开发者验证 AI 在不同语言任务中的稳定性与泛化能力。
testcat
testcat 是一个开源 AI 助手,能自动测试 iOS 应用并实时展示测试过程,开发者可边看边优化,提升测试效率与覆盖率。
cngx
开源项目,用于检测AI代理在测试中谎报通过的情况,保障自动化测试的可信度,适合开发团队与CI/CD流程使用
FetchSandbox
FetchSandbox 是一个能记住失败接口的API集成测试工具,帮助开发者快速定位和修复接口问题,适合后端和测试团队使用,亮点是自动记录与回溯故障
Crucible – your AI wrote the tests, so who tested the tests?
Crucible 是一个 AI 测试验证框架,用于检测由 AI 生成的测试代码是否可靠,帮助开发者确保 AI 写的测试不会引入虚假通过。
AIQualityHQ
AIQualityHQ 是一个免费的 AI 提示词质量评估工具,可确定性地检测提示词的清晰度、完整性和有效性,帮助开发者优化 AI 应用输入。
SeekinWeb – Check if AI agents can read your website
SeekinWeb 是一个测试 AI 代理是否能正确读取和理解网站内容的工具,供 Web 开发者与 AI 研究者使用,用于评估网页可访问性与 AI 可解析性。
EvalCore
开源AI行为快照测试工具,可在CI/CD中自动化验证AI模型输出的一致性与正确性
Codex Harness for Java Unit Testing
Java单元测试的自动化工具,通过Codex智能生成测试用例,提升开发效率与代码质量,适合Java开发者
Lagotto Meter – how well do AI agents understand your website?
一款用于评估AI代理理解网站内容能力的工具,帮助开发者验证AI对网页语义的理解准确度
Testweave
无需代码的测试自动化工具,输出真实Playwright代码,兼顾易用与可维护性
Argmin AI
Argmin AI 是一款无需机器学习背景的AI代理工作流测试工具,帮助开发者快速验证AI任务逻辑,适合非AI专家的工程团队。
Qualifix
AI驱动的端到端测试工具,能自动生成并自我修复E2E测试用例,显著降低测试维护成本。
ASL V6 – Open-source AST red-teaming engine for Python AI agents
ASL V6 是一个开源的 Python AI 代理对抗测试引擎,用于模拟攻击以发现 AI 代理在逻辑、决策和安全上的漏洞,适合 AI 安全研究人员和开发者。
Comber explores your app once, then replays QA checks deterministically
Comber 能自动探索应用一次,之后可重复执行相同的 QA 检查,实现可复现、确定性的测试流程,提升测试效率与一致性。
Agentsnap – Snapshot testing for AI agents
AI智能体快照测试工具,用于验证AI Agent行为的一致性与可复现性,适合AI开发团队保障质量
Brain & Bounce Kids
由真实儿童测试的儿童学习应用,内容真实有趣且符合儿童认知,适合家长与教育者筛选可靠学习工具
Verity
Verity 是一个 AI 驱动的测试套件,能自动编写、修复、分类和预测软件缺陷,专为开发团队设计,显著提升测试效率与代码质量。
Scovant
基于真实AI代理测试网站表现,而非静态评分,提供动态、可交互的用户体验评估。
Skill-up – Regression testing for Agent Skills
Skill-up 为AI智能体的技能提供回归测试能力,确保技能更新后仍能稳定运行,提升AI系统的可靠性
Figranium – Open-source visual Playwright control plane (Docker, API)
Figranium 是开源的可视化Playwright控制平面,提供Docker化部署与API接口,简化端到端浏览器自动化管理
VeriWasp
AI驱动的SaaS产品预测试工具,通过模拟真实用户行为提前发现产品问题,降低上线风险
Flasqo
全自动 API 测试平台,支持智能测试用例生成与执行,帮助开发团队快速验证接口稳定性与功能正确性。
Agent-Eval
Agent-Eval 是用于大语言模型代理(LLM Agent)的统计回归测试工具,帮助开发者验证代理在不同输入下的行为稳定性与可靠性,适用于 AI 研发团队。
RobotActions
让 AI 代理直接操控真实 iOS 和 Android 设备,实现端到端自动化测试与操作。
AutomationCodeless
无需编写代码即可自动化测试API、数据库和云服务,适合非技术背景的测试人员和开发团队,支持可视化配置与快速执行
BoundaryBench – benchmarking coding agents under real sandbox policy
用于评估AI编程代理在真实沙箱策略下表现的基准测试框架,帮助开发者衡量AI在安全环境中的实际能力。
promptfoo/promptfoo
AI 提示词、代理与 RAG 系统的测试框架,支持多模型对比、红队测试与 CI/CD 集成,帮助开发者验证 AI 应用的稳定性与安全性
PaloQA
PaloQA 是一款Chrome扩展,支持本地运行的端到端测试,能检测视觉与API变化,结合AI实现自动化质量验证。
lackeyjb/playwright-skill
Claude Code 的 Playwright 自动化技能,可让 AI 模型自主编写并执行浏览器自动化脚本,用于测试与验证,实现端到端的智能测试流程
confident-ai/deepteam
DeepTeam 是一个用于红队测试大语言模型和 AI 代理的安全框架,帮助发现模型中的漏洞与对抗风险,保障 AI 系统可靠性。
Linejudge – an independent verification harness for coding agents
Linejudge 是一个独立的代码代理验证框架,用于检测和评估编程代理生成代码的正确性与安全性,提升自动化开发的可信度。
Zyrix Test Autopilot
Zyrix Test Autopilot 是一个自主测试工具,帮助开发团队自动执行测试、提升质量并加速发布流程,特别适合需要持续集成/持续交付(CI/CD)的工程团队。
CrewScore – coverage check for AI agent prompts (0.6.11)
AI代理提示词覆盖率检查工具,帮助开发者验证提示词是否覆盖所有关键场景,提升AI应用的鲁棒性与可靠性。
Dynobox – A test runner for AI agent skills and workflows
AI代理技能与工作流的测试运行器,支持对AI任务链进行自动化测试与性能评估,提升AI应用的可维护性。
Mutant-AI
AI系统评估工具,通过红队测试(Red Agents)主动发现模型漏洞,提升AI系统的鲁棒性与安全性
Kane CLI
Kane CLI 允许用户通过自然语言在终端中生成浏览器自动化测试脚本,降低测试编写门槛,适合非专业测试人员快速构建测试用例。
Deltix – AI Driven Testing
Deltix 是一个由 AI 驱动的自动化测试工具,帮助开发者自动生成和执行测试用例,提升测试覆盖率与效率,特别适合需要快速迭代的软件团队。
TestingURL
免费的沙箱环境,用于网页抓取、HTTP请求测试与AI代理行为验证,适合开发者调试与自动化测试
Text2Test | 0 → Test Suite in Minutes
将自然语言描述快速转换为自动化测试用例的 SaaS 工具,适合开发团队和测试工程师,显著提升测试编写效率
Stunt – a stunt double for the APIs you integrate (95 adapters)
为集成的API提供“替身”服务,通过95个预置适配器模拟第三方API行为,用于测试、开发与联调,无需真实依赖。
Run, tests, and find issues in your services with no code changes
无需修改代码即可运行测试并发现服务问题的工具,通过运行时注入方式检测系统缺陷,适用于微服务与云原生环境
Checksum AI
一个为开发者AI助手提供自动测试支持的API工具,能生成测试用例、验证代码逻辑,提升AI编程助手的可靠性与开发效率。
testmagic.link – Zero-setup magic link testing for coding agents
为编码代理(coding agents)提供零配置魔法链接测试的工具,简化自动化测试流程,提升开发与测试协作效率
其他标签
常见问题
「测试」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-10 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data