将 Llm.c 移植到 Mojo 语言并使用 Metal 加速,性能比 PyTorch MPs 快 1.72 倍,是轻量级大模型推理的新标杆。
▲1
为什么值得关注
访问 Hacker News 页面 →
在不依赖 GPU 的情况下实现极致推理速度,为边缘设备部署大模型提供新可能。
手机端点「分享」直达微信/朋友圈/小红书;桌面端用「复制文案」后到 App 内粘贴发布
在不依赖 GPU 的情况下实现极致推理速度,为边缘设备部署大模型提供新可能。