# 大模型
70 个相关产品 · 中文解读 · 按热度排序
DeepSeek-Reasonix
一个专为终端设计的DeepSeek原生AI编程代理,具备前缀缓存稳定性,可长期运行,帮助开发者自动完成代码任务。
ktransformers
一个灵活的框架,用于优化异构大模型推理与微调性能,主要面向需要高效部署和调优LLM的开发者与研究者
Sonnet 4.6
Claude Sonnet 4.6版本,全面提升编码、多任务处理、长文本推理与Agent规划能力,支持100万token上下文窗口,显著增强复杂知识工作支持能力
xLAM
xLAM 是由Salesforce研究院推出的大型动作模型家族,旨在增强AI代理系统的决策与执行能力,支持多模态、多步骤任务,是AI agent架构层面的重要研究进展。
airllm
可在单张 4GB 显卡上运行 700 亿参数大模型的推理框架,极大降低 AI 模型部署门槛,适合本地化 AI 开发者
tensorzero
一个开源的LLMOps平台,整合了大模型网关、可观测性、评估、优化与实验功能,帮助团队高效管理大模型应用全生命周期,适合AI研发团队使用。
Aymo AI
一个安全的 AI 模型协作平台,集成 GPT、Claude、Gemini 等 45+ 大模型,支持团队对比输出、上传文件聊天,适合企业级 AI 工作流。
Inkling
由Thinking Machines推出的开源大模型,具备1M上下文、多模态理解与可控推理能力,支持微调与本地部署,面向AI研究与开发场景
Claude Opus 5
Claude Opus 5 是 Claude 系列中面向长周期 AI Agent 的升级版,显著提升编码与专业任务处理能力。
Grok 4.5
SpaceX AI 推出的新型大模型,专为编程、自主任务执行和知识工作优化,支持复杂多步任务处理。
SenseNova-U1
商汤科技推出的统一范式大模型系列,从基础原理出发构建多模态能力,面向 AI 研究与企业级应用
Mooncake
Moonshot AI 旗下 Kimi 大模型的后端服务框架,支撑高并发、低延迟的推理服务,是大模型生产环境部署的关键基础设施,服务于 AI 服务提供商。
cosmos-framework
NVIDIA推出的推理与训练框架,用于运行Cosmos模型,面向高性能AI计算场景
semantic-router
一个智能路由系统,能根据任务自动选择最合适的异构大模型进行推理,提升效率并降低成本,适合需要高效调用多个大模型的开发者和AI应用团队。
Samosa Chat - Run Qwen3.6-35B-A3B Locally on a 16 GB Mac
在 16GB 内存的 Mac 上本地运行 Qwen3.6-35B-A3B 大模型,降低大模型本地部署门槛,适合开发者和 AI 爱好者进行本地实验与开发
Run GLM-4.5-Air(110B)on a 16GBRAM consumer machine
在仅 16GB 内存的消费级设备上运行 1100 亿参数的 GLM-4.5-Air 大模型,突破硬件限制,让普通用户也能本地部署超大规模语言模型,解决大模型本地化部署成本高、硬件要
CacheCatch
CacheCatch 可审计 LLM 提示词缓存效率,识别缓存失效点并优化提示结构,帮助开发者降低大模型调用成本,特别适配 LangSmith、Langfuse 等主流AI开发平台
Running over 80M tokens in one agent session with no compaction
单个 AI 代理会话中处理超 8000 万 token 且无需压缩,突破传统上下文长度限制,为长程推理与复杂任务提供可能,面向 AI 研发与高级应用开发者。
FlexInference LLM Router
基于LLM的推理路由系统,智能分配大模型请求到最优推理服务,提升推理效率与成本控制,适合AI应用开发者
DreamX-World, Alibaba's new realtime world model
DreamX-World 是阿里巴巴推出的实时世界模型,能动态模拟物理世界变化,用于虚拟环境构建与 AI 交互,面向 AI 研究、游戏与元宇宙场景。
euromodels
统一接入多个国产大模型(GLM/DeepSeek/Kimi)的兼容API,支持一键切换模型、流式输出和按需计费,降低AI应用集成门槛
GLM-5.2 is now available via Canopy Wave
通过 Canopy Wave 平台提供 GLM-5.2 大模型的访问服务,降低企业使用国产大模型的技术门槛,面向需要本地化AI能力的To B客户
Self-hosting unpruned GLM-5.2 on a 4-node DGX Spark cluster
在4节点DGX Spark集群上自托管未剪枝的GLM-5.2模型,面向需要全参数大模型推理的科研与企业用户
TurboQuant for mlx-lm (Apple Silicon)
基于mlx-lm框架的Apple Silicon优化推理加速工具,专为在M系列芯片上运行大模型提供高性能推理支持
Run a 120B-parameter MoE on Android mid-range phone CPU-only llama.cpp
在中端安卓手机 CPU 上运行 1200 亿参数的混合专家模型(MoE),无需 GPU,实现本地大模型推理
ZCode
ZCode 是专为 GLM-5.2 大模型打造的官方开发工具套件,帮助开发者快速集成、调试和部署基于 GLM-5.2 的应用,解决大模型本地化开发与工程化落地的复杂性问题,主要面向
Token Harbor
统一接入前沿AI模型的API网关,通过兼容OpenAI接口的方式,实现模型自动路由与透明调用,降低使用多模型的复杂度。
FLUX 3
黑森林实验室推出的下一代多模态 AI 模型,支持图像、视频和音频的跨模态理解与生成,推动 AI 向视觉智能迈进。
Claude Opus 5
Claude Opus 5版本,以接近Fable 5的智能水平但成本减半,提供高效对话体验
Kimi K3 countdown has been released
Kimi K3 countdown 是一个用于本地运行 Kimi K3 大模型的轻量级工具,帮助开发者在本地快速部署和测试大语言模型,特别适合对模型推理性能和隐私有要求的用户。
vllm-project/vllm-ascend
vLLM-Ascend 是 vLLM 框架在华为 Ascend 系列芯片上的社区驱动硬件插件,提升大模型推理性能,推动国产 AI 芯片生态发展。
Claude Opus 4.6
Claude Opus 4.6 是 Anthropic 推出的最新一代 AI 模型,专为复杂代理任务优化,具备更强的推理、规划与多步骤执行能力。
Cactus Hybrid: We taught Gemma 4 to know when it's wrong
Cactus Hybrid 让 Gemma 4 模型学会识别自身错误,通过自我反思机制提升 AI 输出的可靠性,适用于高精度任务场景。
Sonnet 4.6
Sonnet 4.6 是当前最强大的 AI 模型,专为复杂推理与多模态任务设计,适合需要高精度 AI 能力的开发者与企业用户,支持更自然的对话与内容生成,性能显著超越前代。
datawhalechina/all-in-rag
一站式 RAG 技术实战指南,帮助开发者构建基于大模型的检索增强生成应用,涵盖从原理到部署的全链路实践。
TurboQuant for mlx-lm (Apple Silicon)
TurboQuant 是针对 mlx-lm 框架在 Apple Silicon 上优化的量化推理工具,显著提升大模型在 Mac 设备上的运行速度与内存效率。
jingyaogong/minimind
仅用 2 小时即可从零训练一个 64M 参数的大语言模型,降低大模型训练门槛,适合学习与实验。
stanfordnlp/dspy
一种新型语言模型编程框架,强调通过代码逻辑而非提示词来构建AI应用,提升可复用性与可控性
modelcontextprotocol/servers
模型上下文协议服务器实现,用于标准化AI模型交互中的上下文管理,提升多模型协作与系统集成能力
promptai.credit
promptai.credit 是一个 SaaS 平台,提供前沿大模型能力,且承诺零账单,让用户免费体验顶级 AI 模型。
GLM-5.2 is now available via Canopy Wave
GLM-5.2 是由智谱AI推出的最新大语言模型,通过 Canopy Wave 平台提供访问,支持多语言、长文本生成与推理,适合开发者、研究人员及企业用户构建智能应用。
Self-hosting unpruned GLM-5.2 on a 4-node DGX Spark cluster
在4节点DGX Spark集群上自托管未剪枝的GLM-5.2大模型,面向需要高性能本地大模型推理的AI研究与工程团队,支持高精度、低延迟推理。
Neuratly
具备近乎零幻觉的AI系统,拥有类人记忆能力,适合高可靠性场景
Running over 80M tokens in one agent session with no compaction
一个能在单个代理会话中处理超过 8000 万 token 而无需压缩的 AI 系统,突破了上下文长度限制,适用于长文本理解与复杂推理任务。
Unlock Claude Sonnet 5's original reasoning
解锁 Claude Sonnet 5 原始推理能力,通过技术手段还原模型更深层的逻辑推导过程
LLMSlim
LLMSlim 是一个开源库,可对提示词进行语义压缩而不丢失指令,适合优化大模型输入效率。
Tura
Tura 是一个开源大模型,宣称在保持性能的同时减少 80% 的 token 消耗,并在任务成功率上提升 16.7 个百分点,适合对成本和效率敏感的 AI 应用场景。
londai
londai 是一个统一 API 接口,可接入多个主流大模型,简化 AI 应用开发中的模型调用复杂度。
Kimi K3
Kimi K3 是全球首个开源的 3T 级参数大模型,由 Kimi 团队发布,适合研究者、开发者和 AI 创业者使用,亮点是超大规模参数量与完全开源,支持本地部署与定制训练。
Kimi K3
Kimi K3 是全球首个开源的 3T 级大模型,具备超强推理与多语言能力,面向开发者和研究者开放使用
Kimi K3
开源大模型Kimi K3,参数达2.8万亿,支持100万token超长上下文,面向需要处理海量文本的AI研究与应用开发者。
Tencent Hy3 Model Guide
腾讯Hy3大模型的实用开发指南,为开发者提供模型调用、优化与应用场景的实战参考,适合AI开发者与技术团队。
lyogavin/airllm
AirLLM 70B:在单块4GB显存GPU上运行700亿参数大模型推理,专为开发者和研究者设计,支持量化与高效内存管理。
OpenSenseNova/SenseNova-U1
SenseNova-U1:源自第一性原理的统一AI范式框架,支持多模态与通用智能构建,面向AI研究者与系统开发者。
kvcache-ai/Mooncake
Mooncake 是 Moonshot AI 推出的 LLM 服务部署平台,专为 Kimi 大模型设计,支持高性能推理与服务化部署。
Run a 120B-parameter MoE on Android mid-range phone CPU-only llama.cpp
在中端安卓手机 CPU 上运行 1200 亿参数的 MoE 大模型,仅用 llama.cpp 实现,适合移动 AI 爱好者与边缘计算开发者
langchain-ai/open_deep_research
LangChain团队开源的深度研究项目,聚焦大模型在复杂研究任务中的应用,适合AI研究人员和高级开发者,亮点是前沿探索与开放协作
NVIDIA/cosmos-framework
NVIDIA 推出的推理与训练框架,专为 Cosmos 模型设计,支持高效部署大模型,加速 AI 应用落地。
MindCache – An open-source agentic memory system for LLMs
MindCache 是一个开源的 LLM 代理记忆系统,让大语言模型能长期存储、检索和利用上下文,提升 AI 代理的连贯性与智能水平。
API Hub
兼容OpenAI接口的多模型API平台,支持DeepSeek、Qwen、GLM等国产大模型,便于快速切换与集成
Echo – Fable-level results at 1/3 the cost using open-weight models
使用开源大模型实现媲美Fable的高质量生成效果,成本仅为原来的三分之一,适合AI应用开发者降低成本。
Nexus API
提供DeepSeek V4模型的API服务,具备Stripe支付、M4级推理速度与固定定价,适合开发者快速集成大模型能力
We built something different.
We built something different 是一个针对大语言模型幻觉问题的探索性项目,通过创新机制检测并减少 LLM 输出中的虚假信息。
Run GLM-4.5-Air(110B)on a 16GBRAM consumer machine
该项目展示了如何在仅 16GB 内存的消费级机器上运行 1100 亿参数的大模型 GLM-4.5-Air,通过量化与优化技术实现本地大模型推理,适合个人开发者和研究者在低配设备上体
Deep Skill Finder – Find agent skills using real execution benchmarks
Deep Skill Finder 是一个基于真实执行基准测试的智能工具,帮助开发者和 AI 研究者评估与选择大模型代理(Agent)的技能,提升 AI 应用的可靠性与性能。
theopenco/llmgateway
LLM 网关服务,统一管理多个大模型提供商的 API 调用,支持路由、限流、分析与降级,帮助开发者轻松构建多模型混合应用。
Stripe Eyes $10 Billion Deal for AI Model Marketplace OpenRouter
Stripe 正考虑以 100 亿美元收购 AI 模型市场 OpenRouter,意在构建统一的 AI 模型调用平台,推动企业级 AI 服务标准化。
AI Toolbox supports Claude Opus 5
AI 工具箱支持 Claude Opus 5 模型,为开发者提供集成最新大模型能力的统一接口平台
Cuts Long Horizon Inference Costs by 50% via external KV Cache Offload
一种用于大模型长序列推理的外部键值缓存卸载技术,通过将缓存数据移出显存,可降低50%的推理成本,适合需要高效处理长上下文的AI开发者和研究者。
Kimik3
Kimi K3模型的非官方指南与免费在线实验平台,降低开发者使用门槛,加速模型探索与应用落地