~/home / tags / 多模态

# 多模态

42 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-11,KanonAgent 库内有 42 个带「多模态」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
MiniMax H3
一个开源的多模态 AI 模型,能生成带立体声的 2K 视频,支持文本、图像、音频输入,擅长精准文字渲染与复杂指令执行。
tencent/UI-Mate-27B · Hugging Face
基于腾讯自研大模型的多模态AI助手,支持图文理解与生成,面向开发者和企业用户解决跨模态内容处理难题
TulexAI
面向创作者、开发者和团队的AI一体化平台,支持文本、图像、音频、视频等多种内容生成,一站式解决多模态内容创作需求。
FLUX 3
黑森林实验室推出的下一代多模态 AI 模型,支持图像、视频和音频的跨模态理解与生成,推动 AI 向视觉智能迈进。
QuestStudio
QuestStudio 是一个整合规划、多模态生成与迭代优化的 AI 内容工作流平台,支持从构思到图像、视频、语音、音乐的全流程创作,适合创意团队快速产出原型。
AskSary - BYOK-supported AI Studio
一个支持自定义AI模型的全栈AI工作室,整合聊天、编程、游戏开发、媒体生成、演示文稿与编辑,支持BYOK(自带密钥)。
FLUX 3 Video
FLUX 3 是下一代多模态 AI 模型,能用单一基础模型生成视频、图像和同步音频,打破传统多模型流水线限制。
DeepSeek V4 Flash 0731 with MoonViT Vision (NVFP4)
DeepSeek V4 Flash 0731 with MoonViT Vision 是一个融合了视觉理解能力的多模态大模型版本,支持图像与文本联合推理,适用于需要视觉输入的 AI
Minnarone – Multimodal agents that watch, listen, and react live
多模态 AI 代理,能实时观看、聆听并响应环境变化,适用于监控、交互式演示等实时场景。
ModelOrbit AI
一个AI创意工作台,支持在统一画布上处理图像、视频和音频,可跨格式复用AI工作流,避免在不同工具间反复导出。
LLM Council: survival-of-the-fittest multi-modal deliberation
一个支持多模态内容辩论的 LLM 协作框架,通过「适者生存」机制让多个 AI 模型在多轮对话中互相挑战、优化判断,提升复杂问题的推理质量,面向 AI 研究与高阶推理场景。
ImagineLab Art
一个一站式AI创意平台,支持图像、视频、语音、音乐、文本等多模态内容生成,适合创作者、营销人员和企业快速产出多样化创意素材。
genvi
一站式 AI 多模态创作平台,支持图像、视频、音乐、语音、3D 的文本生成与节点式工作流编排,可在浏览器内完成全流程创作并导出 MP4
Lance – image/video generation and understanding in one model
Lance 是一个统一模型,能同时完成图像与视频的生成与理解,实现跨模态内容创作与分析,适用于 AI 创作与多媒体应用。
Muse Spark 1.1 by Meta AI
Meta AI推出的多模态推理模型Muse Spark 1.1,专为自主代理任务设计,支持跨模态理解与复杂决策
Harkixsha AI
一款安卓端全能AI应用,支持聊天、图像生成、文档处理和幻灯片制作,一站式AI生产力工具
MCP server
一个支持图像、视频和音乐生成的 MCP 服务器,作为多模态生成服务的后端基础设施,适合开发者构建 AI 创作应用
Khan AI
一站式AI内容创作工作室,集成文本、图像、视频生成与编辑,适合内容创作者与营销团队,亮点是多模态AI协同工作流
FynixoAI
FynixoAI 是一个集成了多种 AI 功能的一体化工具平台,涵盖写作、编程、设计等场景,适合多任务创作者。
OpenSenseNova/SenseNova-U1
SenseNova-U1:源自第一性原理的统一AI范式框架,支持多模态与通用智能构建,面向AI研究者与系统开发者。
Corino AI
Corino AI 是一个全能型 AI 平台,集成聊天、代码生成、搜索、图像生成与实际工作流,支持多任务协同。
Minnarone – Multimodal agents that watch, listen, and react live
多模态智能体系统,能实时观看、倾听并响应环境变化,适用于自动化监控与交互场景
askLory
支持上传PDF、文本、图片、音频、视频的AI问答工具,用户可对多模态内容提问并获取解析。
AI Pro – All AI Tools
整合多种AI工具的统一平台,支持聊天、内容生成与数据分析,一站式AI工作流体验
DeepSeek V4 Flash 0731 with MoonViT Vision (NVFP4)
DeepSeek V4 Flash 0731 搭载 MoonViT 视觉模型,是高性能多模态大模型,支持文本与图像联合推理,适用于需要视觉理解能力的 AI 应用开发。
ALX AI Studio
ALX AI Studio 是集AI视频、图像、语音生成与编辑于一体的全能创作平台,一站式满足多模态内容生产需求。
jordanrendric/claude-video-vision
为 Claude AI 扩展视频理解能力的插件,支持帧提取与多模态音频分析,让 AI 能真正“看懂”视频内容。
Philadelphia AI
Philadelphia AI 是一个统一 API 平台,支持聊天、图像生成、视频、音乐和网站创建,一站式满足多模态 AI 创作需求
llm-real-video Pro
让大语言模型能“看见”摄像头画面的开发者工具,实现视觉与语言的多模态交互。
I built an MCP that gives DeepSeek V4 Flash eyes (bad ones)
一个为 DeepSeek V4 Flash 模型添加视觉能力的 MCP(模型控制协议)项目,通过模拟‘糟糕的视觉’实现趣味性AI交互,适合开发者探索多模态AI的边界与创意表达
AdmitPlus.AI
AdmitPlus.AI 是围绕用户构建的多模态 AI 学习团队,整合内容生成、答疑、规划等功能,提供一站式留学申请辅导。
tencent/UI-Mate-27B · Hugging Face
腾讯推出的270亿参数多模态大模型UI-Mate-27B,专为UI设计与生成任务优化,支持从文本描述生成界面原型,适合设计师与前端开发者快速构建UI,具备高精度与多语言支持;
DeepSee
DeepSee 让 DeepSeek 模型具备视觉理解能力,并智能路由不同模型处理任务,提升 AI 应用的多模态与效率表现。
Froging AI – image and video models in one workflow
Froging AI 是一个将图像与视频模型整合到统一工作流中的工具,适合AI开发者和内容创作者,支持端到端的多模态内容生成与处理。
MiniMax H3 – Turn text and images into AI video clips
MiniMax H3 可将文本和图像快速生成 AI 视频片段,面向内容创作者和营销团队,支持多模态视频自动化生产
Speakly - Translate
Speakly 是一款支持语音、文本、图片和对话实时翻译的生产力工具,适合跨国沟通场景的个人与团队,亮点是多模态翻译与流畅交互
ModelOrbit AI
ModelOrbit AI 是一款设计工具,支持图像、视频、音频在同一画布上创作与复用工作流,让创意人员高效构建多模态内容。
ai4tools
一站式AI平台,支持写作、图片生成、代码编写和翻译,适合内容创作者、开发者和多任务工作者,统一界面提升效率
krillinai/OpenCreator
一个由 Codex 驱动的开源 AI 创作者工作台,支持视频、图像、语音、虚拟形象、翻译与编辑等多模态内容生成,一站式满足创作者需求。
Gory Ai
Gory Ai 是一个多模型 AI 工具,支持聊天与图像生成,可同时处理文本与视觉内容创作。
ai4tools
一站式AI平台,集成写作、图像生成、代码生成与翻译功能,适合内容创作者与多任务工作者。
LLM Council: survival-of-the-fittest multi-modal deliberation
一个基于多模态大模型的辩论系统,通过‘适者生存’机制让多个AI模型相互辩论、筛选最优答案,提升推理质量。
其他标签

常见问题

「多模态」这个标签是怎么归的?

标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。

这里的排序依据是什么?

按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。

数据多久更新?

追踪持续进行(分钟级),本页于 2026-09-11 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data