# 模型优化
5 个相关产品 · 中文解读 · 按热度排序
RunInfra
用户描述所需AI模型功能,系统自动生成并优化对应的AI模型部署方案,降低AI工程化门槛
Pairl v1.5 – dual channel token compression for agentic workflows
Pairl v1.5 是一种用于智能体工作流的双通道令牌压缩技术,可降低大模型推理成本并提升效率。
KV-Cache Grafting – Boosting frozen 12B LLMs to 93.3% AIME accuracy
一种针对冻结的120亿参数大模型的KV缓存优化技术,可将推理准确率提升至93.3%的AIME水平,适用于需要高效推理的AI开发者。
Qwen3.6-35B-A3B on a 16 GB M1 Pro with SSD-streamed MoE
在16GB M1 Pro设备上通过SSD流式加载实现350亿参数的混合专家模型(MoE),让本地运行大语言模型更高效、更可行,适合本地AI开发与研究者
NVIDIA/Model-Optimizer
NVIDIA 推出的统一模型优化库,支持量化、剪枝、知识蒸馏、神经架构搜索等前沿技术,用于压缩和加速深度学习模型部署。