跳至内容
每时AI

每时AI

  • 资讯
  • 国际
  • 分享
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 关于我们

GRPO

TinyZero:首个DeepSeek R1-Zero超低成本复现,不到30刀!

下午2时 2025/02/04 作者 PaperAgent

DeepSeek R1-Zero无需人类标注即可实现准确推理,通过强化学习自主发展自我验证和搜索能力。TinyZero展示了其在CountDown游戏中的复现成果,成本不到30美元。

分类 分享 标签 DeepSeek R1-Zero、 GRPO、 Mike Knoop、 PPO、 TinyZero、 强化学习 2 条评论

重现Deepseek R1 「Aha Moment」的完整教程来了!

下午11时 2025/01/31 作者 AGI Hunt

DeepSeek r1 模型惊艳亮相后,其
创新及模型实力获得了众多称赞和好评
,但同时也因一些数据

分类 分享 标签 DeepSeekMath、 GRPO、 R1、 典型数字、 准确性、 数学推理 发表评论

DeepSeek R1 训练方法解析

下午11时 2025/01/21 作者 AGI Hunt

DeepSeek AI 推出 DeepSeek-R1 模型,引入群体相对策略优化(GRPO)和多阶段训练方法。通过强化学习提升大语言模型推理能力,并在监督微调和拒绝采样后形成最终模型。

分类 分享 标签 71.0%、 DeepSeek-R1、 GRPO、 OpenAI-o1、 pass@1、 强化学习 1 条评论

RLHF 常见的思维误区

下午11时 2025/01/13 作者 极市干货

↑ 点击
蓝字
关注极市平台
作者丨ybq
来源丨NLP工作站
编辑丨极市平台
极市导读
本文探讨了

分类 学术 标签 GRPO、 OOD问题、 RLHF、 Verifier、 奖励模型、 扩散模型 发表评论
较新文章
← 上一页 页面1 … 页面3 页面4

AGI AI AI技术 Anthropic ChatGPT Claude DeepSeek DeepSeek-R1 DeepSeek R1 GitHub GPT-4o LLM Manus MCP Meta OpenAI Python Sam Altman 人工智能 人形机器人 具身智能 大型语言模型 大模型 大语言模型 字节跳动 开源 强化学习 微软 扩散模型 技术创新 智能体 木易 机器学习 深度学习 清华大学 生成式AI 用户体验 百度 腾讯 自然语言处理 英伟达 谷歌 阿里云 阿里巴巴 马斯克

近期文章

  • 未来可期的技术栈:Kafka+A2A+MCP+Flink
  • 即梦图片3.0又重磅更新,这可能是对普通人最有用的一次。
  • 远超ChatGPT 4o,自然语言超级P图
  • Gemini 2.5 Pro深夜重磅更新,再次登顶AI竞技场!
  • 获1.3亿美元融资,NewLimit利用机器学习指导表观遗传程序设计,延长人类健康寿命研究已有初级成果

分类

  • 分享
  • 国际
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 资讯
2025 年 6 月
一 二 三 四 五 六 日
 1
2345678
9101112131415
16171819202122
23242526272829
30  
« 5 月    

归档

  • 2025 年 6 月
  • 2025 年 5 月
  • 2025 年 4 月
  • 2025 年 3 月
  • 2025 年 2 月
  • 2025 年 1 月
  • 2024 年 12 月
  • 2024 年 11 月

AI新闻 | X平台 | APK反编译 | 京ICP备2024096144号 |
© 2025 每时AI • Built with GeneratePress
 下载我们的APP,AI秒送达!  立即下载
×