~/home / tags / 运维

# 运维

71 个相关产品 · 中文解读 · 按热度排序
holmesgpt
面向SRE(站点可靠性工程师)的AI代理,已进入CNCF沙盒项目,可自动诊断系统问题并执行运维任务。
agent
一个开源的本地 AI 代理,能全天候自动运行并维护你的应用,实现代码部署的全自动“自动驾驶”。
ongrid
ongrid 是一个运维AI代理,能理解基础设施状态,自动定位故障根源并修复问题,支持在Slack、Telegram等即时通讯工具中触发,提升运维响应效率。
Alert Grouping by DrDroid
通过智能分组减少告警噪音,帮助运维团队快速识别关键问题,提升系统监控效率。
Pulse
面向 Proxmox、Docker、K8s 等基础设施的智能监控系统,通过 AI 检测隐形故障并提供验证修复建议。
anubis
一个HTTP请求灵魂称重系统,通过智能识别机制阻止AI爬虫访问,保护网站资源不被滥用,适合网站运营者与开发者
Kube Hammer
基于AI的Kubernetes集成开发环境,提供Pod、日志、YAML、RBAC等操作的一体化桌面界面,支持离线使用且不发送任何遥测数据
Field Service
Field Service 是由Kiaan Technology开发的云端现场服务管理平台,支持工单、调度、客户请求、资产与发票管理,专为现场服务团队打造。
Corvin
AI调试代理工具,通过WebSocket接入运行中的服务,实时监控请求并跨服务追踪故障,替代传统堆栈贴入式调试方式。
Cartha — Agent Operations Platform
面向AI智能体团队的运维管理平台,提供完整的运行轨迹追踪、权限控制与预算限制,解决AI代理失控与治理缺失的行业难题
Incident-Ops Kit
基于n8n和Claude构建的SaaS工具包,自动处理值班警报的AI初步诊断和无责复盘报告生成,提升技术团队应急响应效率
Sitepulse
面向多网站运营团队的监控工具,自动检测网站停机、SSL、DNS、死链与性能问题,并精准路由告警
SitesRadar
自动监控客户网站的链接失效、SSL过期、宕机、邮件送达率等问题,提前预警,帮助服务商避免客户投诉。
Vizze
为代理机构自动化管理客户SSL证书,自动追踪并仅在需要操作时提醒,降低运维风险与人力成本
azure-powershell
微软官方的 Azure PowerShell 模块,用于通过命令行管理 Azure 云资源,适合云工程师和 DevOps 团队进行自动化运维。
Cpulse – See why your Docker Compose stack is stuck
一款诊断Docker Compose部署卡顿问题的工具,通过分析配置和运行状态,快速定位容器栈卡死原因,专为使用Docker的开发者和运维人员设计
OpsMate — Auto
一款自动运维助手,能主动检测并修复服务器问题(如重启崩溃应用、清理磁盘、续签SSL),无需人工介入,仅在无法解决时才通知,适合运维人员和开发者
XorMon
免费的全栈式基础设施监控工具,覆盖服务器、数据库、云、容器、存储等各类IT系统,支持本地部署
Pingzo
Pingzo 是面向开发者的智能监控工具,通过重试机制减少误报,支持多平台即时告警,提升系统稳定性监控效率,适合对告警质量要求高的技术团队。
AgentPulse, drift investigation for multi-agent systems
多智能体系统中的漂移检测工具,帮助开发者监控和诊断AI代理行为异常,面向AI系统运维与可靠性保障团队
Crondex - All the Cron Jobs
一个集中管理所有定时任务(Cron Jobs)的平台,帮助开发者统一监控、调试和部署系统中的定时任务,解决运维中任务分散、难追踪的痛点。
Runscribe – Turn a terminal session into a re-runnable runbook, offline
将终端会话记录转化为可重复执行的离线运行手册,帮助开发者复现操作流程,提升团队协作效率。
A agentic nervous system for all DevOps tools
一个为所有 DevOps 工具构建的智能中枢系统,自动协调和执行运维任务,解决多工具协同复杂、响应滞后的问题,面向 DevOps 团队与 SRE 工程师。
MonX
MonX v2 提供实时服务器监控与 AI 根因分析,支持多云环境、eBPF 服务拓扑与 LLM 观测,部署仅需60秒,适合运维团队快速诊断系统问题。
Rasptele – Manage a Raspberry Pi Docker Server from Telegram
通过 Telegram 远程管理树莓派上的 Docker 服务,让开发者或极客用聊天机器人轻松运维边缘设备。
ovexro/dockpanel
用Rust与React构建的现代化服务器管理面板,集成网站、数据库、Docker应用、Git部署、邮件、DNS、监控与备份等功能,一站式管理多服务,适合运维人员与独立开发者
kubernetes/kubernetes
Kubernetes 官方项目,用于自动化容器的部署、扩展和管理,是现代云原生应用的运行基石。
nextcloud/all-in-one
Nextcloud 一站式部署方案,集成所有核心功能,简化安装与运维流程,适合个人、团队及企业快速搭建私有云平台。
Managing on-premise servers without Kubernetes
一款无需 Kubernetes 即可管理本地服务器的轻量级运维工具,适合中小团队或不想引入复杂编排系统的 DevOps 团队。
ansible/ansible
Ansible 是一个简单高效的 IT 自动化平台,用于配置管理、应用部署、任务编排等,通过无代理架构实现跨平台运维自动化。
Nightwatch, The open-source, read-only AI SRE
Nightwatch 是一个开源的只读 AI SRE 工具,帮助运维团队通过 AI 自动分析系统状态、识别异常并提供可操作建议,适用于需要降低运维负担的 DevOps 团队,亮点是
Tracer-Cloud/opensre
开源的 AI SRE 工具包,帮助开发者构建自己的 AI 驱动的运维代理,实现故障自愈、监控告警与系统优化,迈向智能运维新时代。
cedar2025/Xboard
Xboard 是基于 V2board 的高性能面板系统,支持新型协议与功能扩展,专为 V2Ray/Xray 等代理服务提供管理后台,适合运维与服务提供商使用。
Native TUI Network Throughput Inspection
Native TUI 网络吞吐量监控工具,提供终端内实时查看网络性能的界面,适合运维人员和开发者在服务器上快速诊断网络瓶颈。
imthenachoman/How-To-Secure-A-Linux-Server
一份持续更新的 Linux 服务器安全指南,面向系统管理员和运维工程师,涵盖从基础配置到高级防护的实战建议。
NVIDIA/infra-controller
NVIDIA Infra Controller 是一个用 Rust 编写的硬件生命周期管理与多租户网络控制工具,面向数据中心和企业级基础设施运维团队,支持自动化硬件配置与网络隔离,
Busbar
AI控制平面,统一管理企业级AI代理的部署、调度与监控,适合AI工程化团队
Haizu – Placement Management System
Haizu 是一个用于管理资源或服务部署位置的系统,帮助团队在多环境、多区域中高效分配和追踪服务实例,适用于云原生架构下的运维与平台工程团队,核心优势是可视化与策略驱动的放置逻辑。
SHE - Self Healing Engine
实时自愈系统引擎,能自动检测并修复运行中的软件故障,适用于高可用性系统与运维场景。
Monitor any website, discuss outages, and post verified owner updates
一个网站监控与故障讨论平台,支持官方运维人员发布经验证的故障更新,帮助用户快速了解服务状态并参与讨论。
NeatContext
在事故处理过程中为AI提供关键上下文信息,提升AI在运维、安全等场景下的响应准确性和决策能力。
Runscribe – Turn a terminal session into a re-runnable runbook, offline
Runscribe 可将终端操作会话录制为可重复执行的运行手册(runbook),支持离线运行,帮助运维和开发人员自动化重复任务、复现环境,提升效率与可追溯性。
SelfHeal
AI代理自动监控并修复企业SaaS系统间的集成故障,实现“自愈式”系统运维
gnmyt/Nexterm
开源服务器管理工具,支持SSH、VNC、RDP一键连接与管理,适合运维人员和开发者统一管理远程服务器
An uptime monitor with an MCP server, create monitors by asking Claude
一款基于 MCP 服务器的 uptime 监控工具,用户只需用自然语言描述需求,即可通过 Claude 自动生成监控任务,极大简化运维配置。
lollipopkit/flutter_server_box
Flutter 开发的服务器状态监控与运维工具箱,提供可视化面板与实用工具,便于管理后端服务。
OpsMate — Auto
OpsMate 是一款自修复的 SaaS 监控工具,专为开发者和运维团队设计,能自动检测并修复系统异常,减少人工干预
Alert Grouping by DrDroid
SaaS类告警聚合工具,通过智能规则自动归类和降噪告警,适合运维与DevOps团队,亮点是大幅减少误报与信息过载
twNetMap
twNetMap 是一款 AI 辅助的跨路由器网络拓扑图生成工具,适合网络工程师与运维人员,亮点是自动识别设备关系并生成清晰可视化拓扑图。
CyberSilo
一个 SaaS 化的 SIEM(安全信息与事件管理)解决方案,帮助团队实时监控、分析和响应安全威胁,适合中小型企业快速部署安全防护
centreon/centreon
Centreon 是一款面向企业级的 IT 监控平台,支持从云到边缘的全栈监控,提供 AIOps 能力,帮助运维团队实现复杂 IT 架构的可视化与智能告警。
FlowMotions Service Desk Platform
FlowMotions 是一个集 IT 服务管理、工单系统、自动化与变更管理于一体的 SaaS 平台,内置 AI 功能,适用于企业 IT 团队提升运维效率。
XorMon
全栈式基础设施监控工具,支持从硬件到应用层的统一可观测性,适合运维与DevOps团队。
DataDog/pup
Datadog Pup 是一个 AI 助手的 CLI 工具,集成 200+ 命令覆盖 Datadog 全产品线,帮助运维与开发者高效操作监控系统。
gravitational/teleport
Teleport 是一个安全、易用的基础设施访问与管理平台,支持零信任访问控制,可统一管理服务器、数据库、Kubernetes 等资源,适合 DevOps 和安全团队使用。
FNS Solutions - FNS Solutions
IT基础设施托管服务,为企业提供稳定可靠的系统运维支持
Opearia
Opearia 是一个连接支持、现场服务、设备与备件的生产力工具,帮助团队高效管理运维全流程,适合服务型企业和技术团队使用,亮点是整合多环节数据实现闭环管理。
Cartha — Agent Operations Platform
Cartha 是面向 AI 代理集群的运维平台,提供追踪、记忆管理与资源预算控制,专为大规模 AI 代理应用设计。
Basecheck agent – Local database checks with HTTP/syslog output
Basecheck agent 是一个本地数据库健康检查工具,支持 HTTP 和 syslog 输出,用于运维监控,适合 DevOps 团队快速验证数据库状态,亮点是轻量、可嵌入、
IOTManager
面向Linux设备的物联网设备集群管理工具,简化远程设备监控与运维,适用于企业级IoT部署
Incident-Ops Kit
基于AI的SaaS运维应急工具,结合n8n与Claude实现自动故障诊断与事后复盘报告生成,适合运维团队
alibaba/arthas
Arthas 是阿里巴巴开源的 Java 诊断工具,支持在线排查 JVM 问题,如方法调用、内存分析、线程监控等。
Netmon – self-hosted LAN monitor with sarcastic AI reports to Telegram
自托管局域网监控工具,通过幽默讽刺的 AI 报告向 Telegram 发送网络状态提醒,让运维更有趣。
StatusMirror
API 工具,帮助团队在系统故障时自动澄清责任,避免被误归咎于运维问题
wal-g/wal-g
wal-g 是一个用于数据库 WAL(Write-Ahead Log)归档与恢复的工具,支持 PostgreSQL、MySQL 等主流数据库,适用于云环境下的备份与灾难恢复。
VMKeeper, backups for standalone ESXi without vCenter
VMKeeper 为独立运行的ESXi服务器提供无需vCenter的备份解决方案,简化小型数据中心的虚拟机容灾流程
theforeman/foreman
服务器生命周期自动化管理工具,支持配置管理、部署与监控,适用于大规模服务器运维
ytti/oxidized
用 Ruby 编写的网络设备配置备份工具,替代 RANCID,支持多厂商设备自动备份与版本管理。
WPManta
WPManta 是 WordPress 网站的自动化运维管家,提供自动更新、安全防护与技术支持,适合非技术背景的网站所有者,亮点是“零运维”式托管体验。
Crewtron
Crewtron 是一款面向现场服务管理的 Android 应用,帮助维修、巡检团队高效调度任务、记录工单与追踪进度。
puppetlabs/puppet
Puppet 是一个成熟的服务器自动化框架,用于配置管理、应用部署与系统运维,适用于 DevOps 团队和企业级基础设施自动化
其他标签