~/home / tags / 推理优化

# 推理优化

5 个相关产品 · 中文解读 · 按热度排序
Context Warp Drive – Deterministic context folding for AI agents
为AI代理设计的确定性上下文折叠技术,通过结构化方式管理长上下文,提升AI推理的稳定性和可复现性。
vllm-project/semantic-router
基于 Go 语言的智能混合模型路由系统,能高效调度不同大模型以优化推理性能与成本,适合需要部署多模型的 AI 服务团队。
kvcache-ai/ktransformers
一个灵活的异构大模型推理与微调优化框架,支持多种硬件和模型配置,帮助开发者高效部署和调优LLM,适用于AI工程化落地场景。
Autograd-Free LLM Guiding with 0MB VRAM (Alternative Pathways)
无需显存的LLM引导技术,通过替代路径实现高效推理,适合资源受限环境下的AI开发与部署
flashinfer-ai/flashinfer
FlashInfer 是专为大语言模型推理优化的高性能内核库,通过低级算子优化显著提升 LLM 服务的吞吐与延迟,适合 AI 工程师和推理服务开发者。
其他标签