开源
阿里32B新模型比肩满血DeepSeek-R1!苹果Mac本地可跑,网友已玩疯
阿里云发布QwQ-32B推理模型,参数量为32B,性能媲美DeepSeek-R1,在数学和编程能力上与之相当,并可在消费级显卡上部署。该模型开源用于商业和研究用途,已吸引大量关注。
这个Atom of Thoughts 的原子思维让GPT-4O-Mini 秒杀O3和DeepSeek-R1!
香港科技大学研究人员提出「原子思维」(AOT)改进了GPT-4o-mini在HotpotQA上的性能至80.6%,超越了现有方法。该技术通过将复杂问题分解为独立的子问题,实现更高效和准确的推理。
DeepSeek一口气开源3个项目,还有梁文锋亲自参与,昨晚API大降价
DeepSeek 发布了DualPipe和EPLB两个新工具以及训练和推理框架的分析数据,旨在帮助社区更好地理解通信-计算重叠策略和底层实现细节。
阿里QwQ-Max-Preview:AI推理模型的“新标杆”
阿里巴巴Qwen团队发布了深度推理模型QwQ-Max-Preview,其在数学、编程及通用任务中表现出色,并支持联网搜索和思维链展示。该模型将开源,并推出Android和iOS应用程序,促进AI技术在全球范围内的传播和应用。
阿里巴巴发布深层推理模型并准备开源,DeepSeek加速H800的推理速度,Claude开源终端代码助手
Qwen系列的新进展QwQ-Max-Preview专注于深层推理和多领域问题解决,未来将开源。FlashMLA是一款针对Hopper GPU优化的高效MLA解码内核,支持可变长度序列处理。Claude Code是一个终端编码工具,帮助开发者执行代码任务。EasyR1是高效、可扩展的多模态强化学习训练框架,支持视觉语言模型。GibberLink演示了会话AI在意识到彼此都是AI代理时从人类语言切换到音频协议的过程。
拖拽式开发AI工作流!这款开源神器,让LangChain也黯然失色!
PySpur 是一个轻量级的可视化 AI 智能体工作流构建器,提供拖拽式构建、循环迭代等10余种功能,适用于设计师、建筑师等非技术人员快速创建智能应用。
DeepSeek开源周第一天:FlashMLA开源,解锁H800性能上限,提升存量GPU算力
DeepSeek开源首个项目FlashMLA,针对英伟达Hopper GPU优化MLA解码内核,提升LLM模型在H800上的性能。