# 深度学习
9 个相关产品 · 中文解读 · 按热度排序
cosmos-framework
NVIDIA推出的推理与训练框架,用于运行Cosmos模型,面向高性能AI计算场景
pytorch/pytorch
PyTorch 是一个基于 Python 的张量计算与动态神经网络框架,提供强大的 GPU 加速能力,是深度学习研究和开发的核心工具
NanoEuler – GPT-2 scale model in pure C/CUDA from scratch
NanoEuler 是从零开始用纯 C/CUDA 实现的 GPT-2 规模模型,旨在教学与研究,帮助开发者理解大模型底层机制。
tinygrad/tinygrad
极简但功能强大的深度学习框架,以极低的代码量实现类似 PyTorch 的体验,适合学习与轻量级推理场景。
A Transformer Is All You Need PT 2L: Precision Brain Surgery
A Transformer Is All You Need PT 2L 是对经典 Transformer 模型的深度剖析,聚焦于模型内部的「精确推理机制」,适合想理解大模型工作原理
Fast NF4 dequantization Triton kernel (1.41x faster than bitsandbytes)
基于 Triton 的 NF4 反量化内核,速度比 bitsandbytes 快 1.41 倍,显著提升 LLM 推理性能。
NVIDIA/Model-Optimizer
NVIDIA 推出的统一模型优化库,支持量化、剪枝、知识蒸馏、神经架构搜索等前沿技术,用于压缩和加速深度学习模型部署。
NVlabs/Sana
NVIDIA推出的高效高分辨率图像生成模型,基于线性扩散Transformer架构,支持高质量图像合成
deepseek-ai/FlashMLA
C++ 实现的高效多头潜在注意力内核,用于加速大模型推理,特别优化了内存与计算效率,适合高性能 AI 推理场景。