# 本地推理
9 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-20,KanonAgent 库内有 9 个带「本地推理」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
TensorSharp: Open-Source Local LLM Inference Engine
TensorSharp 是一个开源的本地大语言模型推理引擎,支持在设备端高效运行 LLM,适合开发者构建离线 AI 应用
Samosa Chat - Run Qwen3.6-35B-A3B Locally on a 16 GB Mac
Samosa Chat 是一款可在 16GB 内存 Mac 上本地运行 Qwen3.6-35B-A3B 大模型的轻量级聊天应用,专为开发者和 AI 爱好者设计,支持本地推理、低资源
Run GLM-4.5-Air(110B)on a 16GBRAM consumer machine
该项目展示了如何在仅 16GB 内存的消费级机器上运行 1100 亿参数的大模型 GLM-4.5-Air,通过量化与优化技术实现本地大模型推理,适合个人开发者和研究者在低配设备上体
I built a hypervisor and client for inference on consumer compute
一个面向消费级硬件的轻量级虚拟机与推理客户端,可在本地运行大模型推理,降低 AI 推理成本与依赖云端的门槛
Multi-agent LLM editor with local inference via WebSockets
支持本地大模型推理的多智能体协作代码编辑器,通过 WebSocket 实现低延迟交互,适合希望在本地运行 LLM 的开发者
Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac
在任何M系列Mac上仅用2GB内存运行Gemma 4 26B大模型的开源引擎,专为本地运行大语言模型的开发者和AI爱好者设计,支持极致轻量化部署。
unsloth/Muse-Glimmer-30B-GGUF · Hugging Face
一个轻量级、高性能的300亿参数本地大模型推理工具,专为在消费级硬件上运行大语言模型设计,支持GGUF格式以实现高效推理,适合开发者和AI爱好者在本地部署和实验大模型。
DFlash 2 available for Qwen 3.8 27B and Muse Glimmer
DFlash 2 是针对 Qwen 3.8 27B 和 Muse Glimmer 模型的本地量化推理工具,支持在消费级硬件上高效运行大模型,适合本地 AI 爱好者与开发者。
Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD
使用 QUASAR QAD 实现全量化 NVFP4 格式的 Qwen3.8-27B 模型,可在消费级硬件上高效运行,面向本地大模型部署与低资源推理场景,显著降低运行门槛。
其他标签
常见问题
「本地推理」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-20 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data