# 强化学习
11 个相关产品 · 中文解读 · 按热度排序
截至 2026-09-11,KanonAgent 库内有 11 个带「强化学习」标签的 AI agent 与工具,本页按真实热度排序。标签由中文拆解自动归纳,不是人工打的;数据可经公开 API 复核。
Open-Source AI Racing Harness
开源 AI 赛车模拟框架,允许开发者训练 AI 驾驶赛车,支持多种赛道和车辆配置,适合 AI 研究者与游戏开发者实验强化学习
SkyRL
SkyRL 是一个面向大语言模型的模块化全栈强化学习库,支持 LLM 在复杂任务中通过试错优化决策,适用于构建自主智能体系统,为 AI agent 的训练与部署提供底层框架支持。
A board game with opponents trained by self-play
一款通过自对弈训练对手的棋类桌游,利用强化学习让AI对手不断进化,提供持续挑战性的游戏体验,适合策略游戏爱好者。
radixark/miles
Miles 是一个面向企业级的强化学习框架,专为 LLM 和 VLM 的后训练优化设计,基于 Slime 演化而来,支持复杂决策场景的 AI 训练。
PrimeIntellect-ai/prime-rl
Prime-RL 是一个面向大规模智能体强化学习训练的框架,支持复杂智能体行为建模与分布式训练,适用于 AI 研究者和机器人开发团队。
RL Environment for Sheep Hearding
一个用于训练AI牧羊犬行为的强化学习环境,专为研究智能体在动态群体控制中的决策能力设计,适合AI研究人员与机器人开发者
A board game with opponents trained by self-play
一款通过自对弈训练对手的棋类游戏,利用强化学习打造高难度、自适应的AI对手,适合游戏开发者与AI爱好者。
RL bandits pick coding agent's context,Grok 4.5 out-fixes Fable 5
一个基于强化学习的上下文选择工具,帮助编程代理(coding agent)动态优化其上下文信息,提升代码生成效率;适用于AI编程助手开发者与AI工程团队。
NovaSky-AI/SkyRL
模块化全栈强化学习库,专为大语言模型设计,支持LLM的策略训练与部署,适合RLHF与智能体研究者
pollen-robotics/microduck_rl
MicroDuck RL 是为 MicroDuck 机器人设计的强化学习训练环境,支持复杂任务模拟与智能体训练,面向机器人与 AI 研究者。
Kullback – Synthetic RL Environments from Traces
Kullback 是一个基于真实行为轨迹生成合成强化学习环境的工具,可从用户或系统日志中提取模式,构建逼真的模拟环境,用于训练 AI 模型,尤其适用于复杂交互场景的仿真测试。
其他标签
常见问题
「强化学习」这个标签是怎么归的?
标签来自每个产品的中文拆解(解决什么场景、面向谁),由模型从产品自述里归纳,不是人工逐条打的,也不接受付费打标。
这里的排序依据是什么?
按库内真实热度:投票数 / MRR / 增速,取产品实际有的那个。不是编辑推荐,也不卖位置。
数据多久更新?
追踪持续进行(分钟级),本页于 2026-09-11 生成。全部数字可经公开只读 API 复核:https://kanonagent.com/data