将Qwen3.6-35B模型量化至2比特,仅需12.3GB显存,在RTX 4090上实现225 tokens/秒的推理速度,适合本地部署大模型的开发者与AI研究者,显著降低硬件门槛。
▲21/天
为什么值得关注
访问 Hacker News 页面 →
在消费级显卡上实现大模型高效推理,突破了大模型本地化部署的性能瓶颈。
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
在消费级显卡上实现大模型高效推理,突破了大模型本地化部署的性能瓶颈。