~/home / tags / 运维

# 运维

80 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-10,KanonAgent 库内有 80 个带「运维」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
holmesgpt
面向SRE(站点可靠性工程师)的AI代理,已进入CNCF沙盒项目,可自动诊断系统问题并执行运维任务。
agent
一个开源的本地 AI 代理,能全天候自动运行并维护你的应用,实现代码部署的全自动“自动驾驶”。
ongrid
ongrid 是一个运维AI代理,能理解基础设施状态,自动定位故障根源并修复问题,支持在Slack、Telegram等即时通讯工具中触发,提升运维响应效率。
Hyperprobe
Hyperprobe 让 AI agent 在不重新部署的情况下调试生产环境问题,极大提升故障排查效率,适合运维与开发团队
Alert Grouping by DrDroid
通过智能分组减少告警噪音,帮助运维团队快速识别关键问题,提升系统监控效率。
Staats
让开发者通过自然语言向AI编码助手提问,实时了解网站运行状态,实现“问即知”的运维体验。
Aura – a Rust agent that investigates and fixes production incidents
一个用 Rust 编写的 AI agent,能自主调查并修复生产环境中的线上故障,实现从问题发现到修复的闭环,适合运维与 SRE 团队提升响应效率。
Infrawrench – A tool to manage cloud and svcs with workflows and chat
一个通过工作流与聊天结合来管理云服务和系统资源的工具,实现运维自动化与协作
HookLens
HookLens 利用 AI 实时分析 Webhook 请求,自动定位问题根源,帮助开发者快速排查系统故障,适合高频率 API 交互的后端团队。
Osuite
Osuite 是面向技术团队的生产环境智能诊断工具,能将系统故障从发生到根因分析与修复的全流程压缩至5分钟内,通过AI自动关联日志、指标与追踪数据,解决传统可观测性工具响应慢、分析
Selfship.ai – Surface and fix isues with your agentic applications 24x7
一个用于持续监控和自动修复智能体应用问题的工具,帮助开发者在24小时内发现并解决AI代理应用中的异常,提升系统稳定性。
Kube Hammer
基于AI的Kubernetes集成开发环境,提供Pod、日志、YAML、RBAC等操作的一体化桌面界面,支持离线使用且不发送任何遥测数据
Field Service
Field Service 是由Kiaan Technology开发的云端现场服务管理平台,支持工单、调度、客户请求、资产与发票管理,专为现场服务团队打造。
Corvin
AI调试代理工具,通过WebSocket接入运行中的服务,实时监控请求并跨服务追踪故障,替代传统堆栈贴入式调试方式。
Cartha — Agent Operations Platform
面向AI智能体团队的运维管理平台,提供完整的运行轨迹追踪、权限控制与预算限制,解决AI代理失控与治理缺失的行业难题
Incident-Ops Kit
基于n8n和Claude构建的SaaS工具包,自动处理值班警报的AI初步诊断和无责复盘报告生成,提升技术团队应急响应效率
Sitepulse
面向多网站运营团队的监控工具,自动检测网站停机、SSL、DNS、死链与性能问题,并精准路由告警
SitesRadar
自动监控客户网站的链接失效、SSL过期、宕机、邮件送达率等问题,提前预警,帮助服务商避免客户投诉。
Vizze
为代理机构自动化管理客户SSL证书,自动追踪并仅在需要操作时提醒,降低运维风险与人力成本
Sitrep - AI Copilot For Incidents
AI 指挥官式事故响应助手,帮助团队在系统故障时快速定位问题、生成应对方案。
OpsMate — Auto
一款自动运维助手,能主动检测并修复服务器问题(如重启崩溃应用、清理磁盘、续签SSL),无需人工介入,仅在无法解决时才通知,适合运维人员和开发者
XorMon
免费的全栈式基础设施监控工具,覆盖服务器、数据库、云、容器、存储等各类IT系统,支持本地部署
NetengineX IP monitor
一个面向现代网络的实时IP网络监控与分析平台,提供追踪诊断和AI智能分析,帮助运维人员快速定位网络问题
UptimeBunny
实时网站与服务器监控工具,提供宕机警报、Linux 服务器指标、响应时间分析、SSL 跟踪和 SEO 可用性保护。
Voxtakr
Voxtakr 是一款为系统管理员设计的语音笔记转文档工具,用户口述 IT 运维记录,AI 自动整理成结构清晰的专业文档,节省整理时间。
TokenTimer
自动发现并管理所有证书、密钥、令牌和许可证,提前预警到期并支持自动化续期,保障系统安全与合规
Pingzo
Pingzo 是面向开发者的智能监控工具,通过重试机制减少误报,支持多平台即时告警,提升系统稳定性监控效率,适合对告警质量要求高的技术团队。
AgentPulse, drift investigation for multi-agent systems
多智能体系统中的漂移检测工具,帮助开发者监控和诊断AI代理行为异常,面向AI系统运维与可靠性保障团队
DevicePulse AI
DevicePulse AI 是一款 AI 驱动的设备健康监控平台,可实时诊断设备性能、预测硬件故障并提供智能维护建议。
CrawlPanel
监控网站的可用性、API、表单、登录和结账流程,失败时提供截图和错误步骤的详细技术上下文。
Orqit
Orqit 是一个 AI 驱动的 IT 运维平台,整合 IT 服务管理、资产管理、项目管理与设备监控,帮助团队降低服务台工单量。
Argonix – One AI-powered platform for SRE and cloud operations
一个面向 SRE 和云运维的 AI 平台,整合监控、告警、故障排查与自动化响应,提升云环境稳定性
NEURU
NEURU 是一款开源自托管的AI驱动网络监控工具,可自动监控路由器、服务器、容器等设备,替代Zabbix/PRTG等传统方案。
Intelix
自主运行的AI运维代理,能自动诊断并修复生产环境中的故障,连接PagerDuty、Datadog、GitHub等工具,实现从告警到修复的闭环处理。
AnyIntelli Up
基于大模型和图形分析的系统可用性监控工具,专为初创企业设计,可自动检测系统异常并提供深度分析报告
A agentic nervous system for all DevOps tools
一个为所有 DevOps 工具构建的智能中枢系统,自动协调和执行运维任务,解决多工具协同复杂、响应滞后的问题,面向 DevOps 团队与 SRE 工程师。
MonX
MonX v2 提供实时服务器监控与 AI 根因分析,支持多云环境、eBPF 服务拓扑与 LLM 观测,部署仅需60秒,适合运维团队快速诊断系统问题。
FixBrokenApp
为使用 AI 工具搭建产品后陷入困境的创始人和小团队提供紧急修复服务,解决部署失败、安全漏洞等问题,由资深工程师提供支持。
ChaosOps
自托管的AI运维平台,可在自有基础设施上实现服务器监控、AI根因分析与自动修复,支持永久授权
Alertum
Alertum 通过双区域(美欧)检测,精准识别服务器故障类型(如DNS、证书过期、TLS错误等),并给出置信度判断,避免误报。
SIF Agent
面向技术服务团队的AI工作流自动化工具,自动处理工单分配、协调现场技术人员,替代混乱的微信群和Excel表格。
Tagfire
用于持续监控 Google Analytics 4 和 Google Tag Manager 配置是否正常运行的审计工具,解决配置失效却无法及时发现的问题。
Intelix – AI agent that investigates and resolves production incidents
Intelix 是一个 AI 助手,能自动调查并解决生产环境中的系统故障,提升 DevOps 响应效率。
SolveSavant
一个自动化、安全的SaaS事件管理系统,用于企业级故障响应与管理,适合技术团队快速处理线上事故
WPFixAgent
一个能诊断并自动修复WordPress问题的AI代理,可检测插件冲突、错误、安全漏洞和功能异常,支持创建恢复点和可控修复
Toby AI TruePilot
AI智能观测助手,能理解实时仪表盘或日志上下文,自动预测用户意图并执行复杂查询,提升运维效率
Skyportal
一个开源的部署监控与故障诊断系统,能自动分析 Kubernetes、GPU、日志等异常,提出修复建议并验证结果。
patchletter
patchletter 是面向系统管理员的更新监控工具,自动扫描700+软件硬件组件,一旦有新版本发布即推送邮件提醒,确保系统安全及时更新。
StackWitness
StackWitness 通过多区域主动探测服务状态,结合厂商官方状态源,生成真实可靠的客户状态页,帮助团队在凌晨也能准确判断故障归属。
Woopy
一个面向开发者的应用崩溃监控工具,当应用出错时推送通知,并提供一键修复操作(如重启服务、清缓存),通过签名Webhook自动触发运维动作。
Driftn
监控技术栈的运行成本、安全性和可用性,提前预警潜在故障,帮助开发者在问题发生前采取行动。
PulseGuard AI
PulseGuard AI 是一个自动监控 Web 应用、API 和结账流程的系统,发现故障后自动进行 AI 根因分析并提供修复命令与告警通知。
Gonewatch
Gonewatch 是一种反向监控工具,通过让任务主动向它发送心跳信号来检测运行状态,解决传统监控工具无法发现任务未启动的问题,适合开发者和运维人员。
WakeUp Dev — Voice On-Call Alerts
将Grafana、UptimeRobot等系统的告警通过电话呼叫通知运维人员,并支持按1确认与自动升级,确保关键问题不被遗漏。
Deadly — Deadline tracking
Deadly 是一个客户端域名与SSL证书到期管理工具,自动监控多个客户的服务到期时间并提前多级提醒,避免因疏忽导致服务中断。
Provibr
Provibr 是一个面向主机服务商与运维团队的集中式服务器管理平台,通过安全出站代理管理 Proxmox 等环境,无需暴露管理接口。
Flowlert
一个自动化工作流监控工具,能实时检测n8n、Make、Zapier等平台的工作流是否中断,尤其是“无声失败”(即流程停止但无报错),并自动发送AI分析报告,解决自动化流程不可靠的痛
AiONA
基于AI的本地优先网络运维平台,强调数据隐私与实时响应,适合需要安全可控运维的中小型企业IT团队。
Nightwatch, The open-source, read-only AI SRE
Nightwatch 是一个开源的只读 AI SRE 工具,帮助运维团队通过 AI 自动分析系统状态、识别异常并提供可操作建议,适用于需要降低运维负担的 DevOps 团队,亮点是
Tracer-Cloud/opensre
开源的 AI SRE 工具包,帮助开发者构建自己的 AI 驱动的运维代理,实现故障自愈、监控告警与系统优化,迈向智能运维新时代。
Busbar
AI控制平面,统一管理企业级AI代理的部署、调度与监控,适合AI工程化团队
SHE - Self Healing Engine
实时自愈系统引擎,能自动检测并修复运行中的软件故障,适用于高可用性系统与运维场景。
NeatContext
在事故处理过程中为AI提供关键上下文信息,提升AI在运维、安全等场景下的响应准确性和决策能力。
Runscribe – Turn a terminal session into a re-runnable runbook, offline
Runscribe 可将终端操作会话录制为可重复执行的运行手册(runbook),支持离线运行,帮助运维和开发人员自动化重复任务、复现环境,提升效率与可追溯性。
SelfHeal
AI代理自动监控并修复企业SaaS系统间的集成故障,实现“自愈式”系统运维
An uptime monitor with an MCP server, create monitors by asking Claude
一款基于 MCP 服务器的 uptime 监控工具,用户只需用自然语言描述需求,即可通过 Claude 自动生成监控任务,极大简化运维配置。
OpsMate — Auto
OpsMate 是一款自修复的 SaaS 监控工具,专为开发者和运维团队设计,能自动检测并修复系统异常,减少人工干预
Alert Grouping by DrDroid
SaaS类告警聚合工具,通过智能规则自动归类和降噪告警,适合运维与DevOps团队,亮点是大幅减少误报与信息过载
twNetMap
twNetMap 是一款 AI 辅助的跨路由器网络拓扑图生成工具,适合网络工程师与运维人员,亮点是自动识别设备关系并生成清晰可视化拓扑图。
FlowMotions Service Desk Platform
FlowMotions 是一个集 IT 服务管理、工单系统、自动化与变更管理于一体的 SaaS 平台,内置 AI 功能,适用于企业 IT 团队提升运维效率。
DataDog/pup
Datadog Pup 是一个 AI 助手的 CLI 工具,集成 200+ 命令覆盖 Datadog 全产品线,帮助运维与开发者高效操作监控系统。
Opearia
Opearia 是一个连接支持、现场服务、设备与备件的生产力工具,帮助团队高效管理运维全流程,适合服务型企业和技术团队使用,亮点是整合多环节数据实现闭环管理。
Cartha — Agent Operations Platform
Cartha 是面向 AI 代理集群的运维平台,提供追踪、记忆管理与资源预算控制,专为大规模 AI 代理应用设计。
Incident-Ops Kit
基于AI的SaaS运维应急工具,结合n8n与Claude实现自动故障诊断与事后复盘报告生成,适合运维团队
ovexro/dockpanel
用Rust与React构建的现代化服务器管理面板,集成网站、数据库、Docker应用、Git部署、邮件、DNS、监控与备份等功能,一站式管理多服务,适合运维人员与独立开发者
WPManta
WPManta 是 WordPress 网站的自动化运维管家,提供自动更新、安全防护与技术支持,适合非技术背景的网站所有者,亮点是“零运维”式托管体验。
Sitrep - AI Copilot For Incidents
Sitrep 是一个 AI 智能事故响应协作者,能自动分析系统告警、生成事件摘要并建议应对措施,适用于运维与 SRE 团队
Orqit
Orqit 是一款基于 AI 的 IT 管理平台,整合 IT 服务管理(ITSM)、资产管理(ITAM)、远程监控(RMM)与终端管理功能,帮助中小团队自动化运维。
Online Zone
Online Zone 将日常运维任务转化为可自主运行的 AI 代理,让系统自动执行重复性操作,减少人工干预。
PlainPing
SaaS监控服务,自动检测网站状态并实时告警,让开发者和运营者无需手动查看即可掌握系统健康度
其他标签

常见问题

「运维」这个标签是怎么归的?

标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。

这里的排序依据是什么?

按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。

数据多久更新?

追踪持续进行(分钟级),本页于 2026-09-10 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data