大模型训练开销还能更小!微软推出首个FP4训练框架,训练效果与BF16相当
首个FP4精度的大模型训练框架发布,可使所需存储和计算资源更少。与BF16相当的训练效果下,最高可达130亿参数规模的模型。研究团队采用定制化的FP4矩阵乘法、不同粒度量化策略以及新的梯度估计方法。
首个FP4精度的大模型训练框架发布,可使所需存储和计算资源更少。与BF16相当的训练效果下,最高可达130亿参数规模的模型。研究团队采用定制化的FP4矩阵乘法、不同粒度量化策略以及新的梯度估计方法。
中国公司DeepSeek发布开源推理模型R1和图像生成模型Janus Pro,引发全球关注。这标志着中美在AI领域的竞争以及封闭与开源模式之间的较量正发生转变。
DeepSeek爆火引发多国关注与调查,OpenAI与Anthropic联合调查其使用API接口行为,Amodei呼吁加强芯片管制,意大利下架应用。
划重点:
❶
中国AI团队强势崛起
!
Qwen2.5系列
实现
多模态理解
、
百万字长文本处理