由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
reinforcement-learning
话题找到数量
unslothai/unsloth
大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存
bojieli/ai-agent-book
《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码
AI4Finance-Foundation/FinGPT
FinGPT:开源金融大语言模型!我们发布革命性🔥训练模型于HuggingFace平台
Unity-Technologies/ml-agents
Unity机器学习代理工具包(ML-Agents)是一个开源项目,能让游戏和模拟场景成为训练智能代理的环境,支持深度强化学习与模仿学习。
owainlewis/awesome-artificial-intelligence
人工智能(AI)课程、书籍、视频讲座与论文的精选列表
datawhalechina/easy-rl
强化学习中文教程(蘑菇书🍄),在线阅读地址:https://datawhalechina.github.io/easy-rl/
kmario23/deep-learning-drizzle
通过聆听这些精彩讲座,沉浸式学习深度学习、强化学习、机器学习、计算机视觉和自然语言处理!!
aws/amazon-sagemaker-examples
示例 📓 Jupyter 笔记本,展示如何使用 🧠 Amazon SageMaker 构建、训练和部署机器学习模型。
OpenPipe/ART
智能体强化训练器:使用GRPO为现实任务训练多步智能体。为智能体提供在职培训。支持Qwen2.5、Qwen3、Llama等模型的强化学习
tailcallhq/forgecode
面向Claude、GPT、O系列、Grok、Deepseek、Gemini及300多种模型的AI增强型结对编程工具
antinomyhq/forge
面向Claude、GPT、O系列、Grok、Deepseek、Gemini及300多种模型的AI增强型结对编程工具