准确率归档 - 每时AI

马斯克Grok-4碾压所有大模型！“比所有领域博士都聪明”，AIME25拿满分

2025年7月10日16时作者量子位

马斯克发布最新AI模型Grok-4，成为首个突破50%准确率的人工智能。该模型训练量是前版本的10倍以上，并且在多项基准测试中表现出色。

2025年6月11日16时作者机器之心

机器学习研究者提出一种名为”强化预训练”的新方法，它将下一个 token 预测任务重构为对 next-token 的推理过程。通过可验证奖励的强化学习，这种方法利用海量无标注文本数据进行通用预训练，显著提升语言建模准确性，并有望推动大模型发展的有效路径。

2025年5月29日16时作者量子位

华为提出S-GRPO方法，通过’串行分组 + 衰减奖励’设计让大模型提前终止思考，提高推理效率60%，生成更精确的答案。

2025年5月7日16时作者 PaperWeekly

论文提出SCoT（推测性思维链），通过小型模型快速生成多个解题草稿，大型模型审核并选择最优解或重新编写。这种协作式推理方法能显著提升速度和准确率，同时降低成本、增加灵活性，并且代码开源便于应用。

2025年4月22日16时作者机器之心

AI 研究人员提出睡眠时间计算概念，让模型在用户未提出查询时「思考」，以提高大型语言模型的推理效率和准确性。

2025年4月11日8时作者 AIGC开放社区

今天凌晨2点，OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度，OpenAI自己的模型准确率只有0.6%和0.9%，但最新发布的Agent模型Deep Research准确率达到51.5%，展示了其在自主搜索、信息整合和准确性校准方面的优秀能力。

业研究人员。
社区的愿景
是促进国内外自然语言处理，机器学习学术界、产业界和广大爱好者之间的交流和进

2025年2月1日12时作者钛媒体AGI

中国AI模型DeepSeek引发的全球讨论热潮持续近半个月，美国OpenAI公司终于发布新模型对此进