~/home / tags / 语音处理

# 语音处理

45 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-11,KanonAgent 库内有 45 个带「语音处理」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
Trace – Offline Mac meeting transcripts you can flag mid-call
Mac端离线会议录音转写工具,支持通话中实时标记重点内容,解决远程会议记录效率低、信息遗漏问题,适合远程工作者与团队协作场景
Universal-3.5 Pro
支持原生代码切换、多语言识别和更优说话人分离的语音处理模型,适合开发者和多语言内容创作者
Still Your Words
针对语音转文字错误的AI修复工具,保留原始表达风格,避免过度“美化”导致失真
STT-MCP – local STT for agents
本地化语音转文字(STT)服务,专为AI代理设计,解决云端STT隐私与延迟问题,适合注重数据安全的开发者
ActionNote
ActionNote 将杂乱的语音笔记自动转为结构化内容,包括标题、摘要、要点和待办任务,支持多语言混合输入,适合需要快速转化语音为行动项的用户。
Dictata – Local Whisper dictation with LLM cleanup
本地运行 Whisper 实时语音转写,并用大模型自动清理和优化转录文本,提升准确率与可读性
WishPilot
一个本地优先的语音智能引擎与实时面试助手,支持毫秒级语音转写和多模型接入,适合需要隐私保护的开发者与面试官使用。
Ved AI Voice Assistant
一个基于 AI 的语音助手,专注于提升语音交互体验,可能用于会议记录、任务管理等场景,适合需要高效语音处理的个人或团队。
Vuci – make the spoken word searchable
将语音内容转化为可搜索的文本,让口语化表达(如会议、播客)也能被高效检索和分析,适合内容创作者与知识工作者。
NoteCast
浏览器标签音频转笔记工具,本地化处理音频,自动区分说话人并支持重命名同步更新历史笔记,保护隐私且高效
Kekoso
Kekoso 是一款 Mac 平台的语音转文字工具,支持热键启动,可实时转录音频、视频和 YouTube 链接,支持多种本地化语音模型,适合会议记录与内容创作。
Trelis Tiron – open-weights multi-speaker meeting transcription
Trelis Tiron 是一个开源多说话人会议转录工具,支持多语言、高精度语音识别与说话人分离,适合会议记录与协作场景
articulate AI
articulate AI 是一个语音分析工具,能实时分析用户60秒即兴演讲中的填充词、语速、语法、词汇、发音和自信度,并提供带标记的语音回放,帮助用户提升表达能力。
Echoryte
将音频和视频内容自动转为可编辑、可搜索的文本,支持字幕级时间戳、说话人识别和多格式导出,适合内容整理与知识沉淀。
Assist (Voice Screenshot)
通过语音截图自动提取并转录语音内容,实现语音信息的快速捕获与结构化处理,适合会议记录或信息快速留存场景
Knight
Knight 能将语音讲座或会议自动转录、去噪、去冗余,并生成结构清晰、可搜索的学习笔记,无需手动整理
VoiceText AI
VoiceText AI 可将语音消息自动转为清晰文本,提升沟通效率,特别适合远程团队和需要快速记录的用户。
ScribeForge
离线运行的语音转文字软件,完全不依赖云端,支持本地处理音频文件,无使用限制与费用,适合隐私敏感场景,如法律、医疗或企业内部沟通。
Vocal Notes
Vocal Notes 是一款 Mac 平台的私有化语音转文字工具,所有处理在设备本地完成,适合注重隐私的创作者与研究人员
SpeechCompass – speaker direction for captioning group conversations
SpeechCompass 是一个用于多人对话字幕生成的语音方向识别工具,能自动判断说话人位置并标注,适合会议记录、远程协作等场景,提升语音转文字的可读性与上下文理解。
k2-fsa/sherpa-onnx
基于ONNX Runtime的离线语音处理工具,支持语音识别、语音合成、说话人分离、语音增强等,适用于嵌入式设备与移动端。
moonshine-ai/moonshine
超低延迟的语音处理引擎,支持语音转文本、意图识别与文本转语音,专为语音交互AI设计。
debpalash/OmniVoice-Studio
一款本地运行的语音克隆、视频配音、语音转写与有声书制作工具,可替代 ElevenLabs 的开源方案,支持全本地化处理,保障隐私安全。
Production duplex speech model for revenue calls
一个用于营收电话的生产级双向语音模型,专为客服与销售场景优化,支持实时语音交互与语义理解,提升通话效率与转化率。
Lipyn
一款基于AI的语音笔记工具,可自动转录、总结并翻译语音内容,适合需要高效记录与处理语音信息的用户,支持多语言且无需额外配置。
I built remembered checkout for Voice calls
一个用于语音通话中自动记录和回放对话内容的工具,帮助用户在会议或客服通话中快速回顾关键信息,适合需要高效沟通的团队与个人用户
Klar. Speak freely. Klar writes.
语音转写工具,自动去除口语中的填充词并修正语法,提升语音内容的专业性
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face (full duplex)
NVIDIA推出的110亿参数全双工语音聊天模型,支持实时双向对话,专为开发者和语音交互研究者设计,具备低延迟与高自然度的语音生成能力。
RVC-Project/Retrieval-based-Voice-Conversion-WebUI
基于检索的语音转换WebUI工具,仅需10分钟语音数据即可训练出高质量语音克隆模型,操作简单、效果出色
Live Transcriber
iPhone端完全离线的AI语音转录与翻译工具,支持实时语音转文字并本地处理,保护隐私
Compare frontier speech-to-speech models for free
一个免费的语音到语音模型对比平台,帮助开发者和研究者快速测试和比较不同语音合成模型的性能与效果。
Arena for Speech-to-Speech Models
一个用于语音到语音模型的开源测试与部署平台,帮助开发者快速验证和优化端到端语音翻译系统,适合语音AI研究者与工程师
VoiceGecko
VoiceGecko 是一个开源的本地语音转文字工具,支持离线运行,适合注重隐私的开发者和音频处理场景,无需依赖云端服务。
Voice note ai
将杂乱的语音笔记智能转写为清晰、结构化且可行动的文本笔记,适合会议记录与灵感捕捉者。
HoldSay, a voice card for unlimited dictation and meeting notes
HoldSay 是一款用于无限语音转文字和会议记录的语音卡片工具,适合需要高效记录会议、访谈或灵感的个人和团队,亮点是支持持续语音输入并自动生成结构化笔记。
Minimo Voice Translate & Transcribe
Minimo Voice Translate & Transcribe 是一款完全在设备端运行的 AI 语音转写与实时翻译工具,保护隐私且支持面对面交流。
ScribeToAny
ScribeToAny 是一款支持 98 种语言的 AI 语音转写工具,可自动翻译成 56 种语言,适合跨国团队和内容创作者高效处理多语言音视频内容。
Dictata – Local Whisper dictation with LLM cleanup
本地运行Whisper语音识别并结合LLM进行文本清理,实现离线高精度语音转写
Kith – AI clinical notes for therapists from ambient session audio
Kith 是一款为心理治疗师设计的 AI 工具,能自动将会议录音转为结构化临床笔记,提升记录效率并减少负担。
Open-Source Local Whisper Flow Alternative
一个开源的本地Whisper语音转文字流程替代方案,支持离线运行,适合注重隐私和数据安全的开发者与内容创作者。
Whisper Web
在浏览器中运行的私密语音转文字工具,不依赖云端,保障用户语音内容完全本地处理
Fahm - AI Tajweed Coach
Fahm 是一个基于 AI 的古兰经诵读辅导工具,帮助用户准确掌握阿拉伯语诵读的音调与规则(Tajweed),适合学习古兰经的初学者和进阶者,通过智能语音分析提供实时反馈。
TranscriptG
TranscriptG 是一款高精度语音转文字工具,不仅能准确转录音频,还能提炼语义知识,帮助用户从声音中提取结构化信息。
Transcribe AI Voice Notes App
Transcribe AI Voice Notes 是一款语音笔记应用,可自动转录、摘要并翻译语音内容,适合需要高效记录与整理会议或灵感的用户。
Voxium - Realtime AI Voice Changer
Windows平台的实时AI语音变声器,免费使用,支持低延迟实时变声,适合直播、游戏和隐私保护场景。
其他标签

常见问题

「语音处理」这个标签是怎么归的?

标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。

这里的排序依据是什么?

按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。

数据多久更新?

追踪持续进行(分钟级),本页于 2026-09-11 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data