跳到正文
Text
Matrix
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
搜索
Text
Matrix
搜索
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
强化学习
2026
09-08
Microduck RL:800 克双足机器人的完整 sim2real 训练配方
08-09
弱信号聚合的几何学:从 √N 定律到正交化工厂
08-01
OpenRSI 工程全解:把「AI 改进 AI」变成可执行代码的完整技术栈
08-01
35B 追平 2.8T:Frontis-MA1 如何用递归自我改进重写 AI 编程的算力法则
07-15
The Little Book of RL:从零到 PPO 的 CleanRL 风格实现解析
07-01
Looped World Models 论文深度解读——1B 参数世界模型,用迭代深度对标 Claude Opus 4.6 Max
05-31
Hands-on Modern RL:一站式现代强化学习全栈指南
04-17
Mathematical Foundations of Reinforcement Learning:强化学习的数学基石——从入门到精通的完整指南
04-12
MiniMind:从零开始用 3 块钱训练 64M 参数的大语言模型
04-01
Agent Lightning:微软 AI 智能体强化学习训练框架完全指南