跳至内容
每时AI

每时AI

  • 资讯
  • 国际
  • 分享
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 关于我们

PRMBench

ACL 2025 过程奖励模型深陷“信任泥潭”,PRMBench撕开伪高精度面具

2025年7月22日23时 作者 PaperWeekly

(PRMs)的赋能。PRMs 作为 LLMs 进行多步推理和决策的关键“幕后功臣”,负责评估推理过程

分类 大模型、 学术 标签 PRMBench、 多样化测试用例、 奖励黑客、 学术界、 工业界、 过程级奖励模型 发表评论

揭秘大模型强推理能力幕后功臣“缺陷”,过程级奖励模型新基准来了

2025年1月15日23时 作者 量子位

复旦大学宋明阳 投稿
量子位 | 公众号 QbitAI
截止目前,o1 等强推理模型的出现证明了 P

分类 资讯 标签 EXRM、 EXRM模型、 PRMBench、 冗余检测、 可解释奖励模型、 精度 发表评论

过程级奖励模型遭遇“信任危机”?PRMBench精细化基准揭示LLM强大推理幕后功臣的潜在缺陷

2025年1月14日8时 作者 PaperWeekly

©PaperWeekly 原创 · 作者 |
宋明阳
单位 |
复旦大学博士生
研究方向 |
VLM

分类 大模型、 学术 标签 GPT-4o、 PRMBench、 PRMs、 冗余检测、 复杂任务、 过程级奖励模型 发表评论

AGI AI AI技术 Anthropic ChatGPT Claude Cursor DeepSeek DeepSeek-R1 GitHub GPT-4o LLM Meta OpenAI Python Sam Altman 人工智能 人形机器人 具身智能 大型语言模型 大模型 大语言模型 字节跳动 工业机器人 开源 强化学习 微软 扩散模型 技术创新 智能体 木易 机器学习 深度学习 清华大学 生成式AI 用户体验 百度 腾讯 自然语言处理 英伟达 谷歌 阿里云 阿里巴巴 马斯克 黄仁勋

分类

  • 分享
  • 国际
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 资讯
  • Cursor 中最受欢迎的 5 个 MCP Server!
  • 从GPT-5到DeepSeek V3.1,顶尖AI大模型的新方向出现了!
  • “AI购物代理”——电商下一个必争之地
  • 无账号&特殊网络,如何畅跑 Claude Code|附智谱「特别折扣」
  • 文档多模态RAG方案哪个更好?9类Embedding+3类MLLM+4类框架对比及古籍文档数据合成工具

2025 年 9 月
一 二 三 四 五 六 日
1234567
891011121314
15161718192021
22232425262728
2930  
« 8 月    

归档

  • 2025 年 9 月
  • 2025 年 8 月
  • 2025 年 7 月
  • 2025 年 6 月
  • 2025 年 5 月
  • 2025 年 4 月
  • 2025 年 3 月
  • 2025 年 2 月
  • 2025 年 1 月
  • 2024 年 12 月
  • 2024 年 11 月

AI新闻 | X平台 | APK反编译 | 京ICP备2024096144号 |
© 2025 每时AI • Built with GeneratePress
 下载我们的APP,AI秒送达!  立即下载
×