刚刚,OpenAI开源BrowseComp,重塑Agent浏览器评测
今天凌晨2点,OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度,OpenAI自己的模型准确率只有0.6%和0.9%,但最新发布的Agent模型Deep Research准确率达到51.5%,展示了其在自主搜索、信息整合和准确性校准方面的优秀能力。
今天凌晨2点,OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度,OpenAI自己的模型准确率只有0.6%和0.9%,但最新发布的Agent模型Deep Research准确率达到51.5%,展示了其在自主搜索、信息整合和准确性校准方面的优秀能力。
文章介绍了RAG技术在数据检索中的问题,并引入了ReRank技术来优化检索效率和准确性。ReRank技术通过多轮筛选的方式快速定位所需数据,解决了传统暴力搜索算法在大规模数据集上的低效问题。