跳至内容
每时AI

每时AI

  • 资讯
  • 国际
  • 分享
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 关于我们

NoPE

从DeepSeek-V3到Kimi K2:八种现代 LLM 架构大比较

2025年7月21日19时 作者 PaperAgent

GPT-2以来七年,主要大模型架构对比分析。主要介绍DeepSeek V3、Mistral Small 3.1、Qwen3、SmolLM3等模型的架构特点及其在内存占用、性能优化等方面的创新点。

分类 分享 标签 MoE模块、 Muon优化器、 NoPE、 Qwen3、 smollm3、 位置嵌入 发表评论

1000万上下文!新开源多模态大模型,单个GPU就能运行

2025年4月7日8时 作者 AIGC开放社区

Meta 最新开源模型 Llama 4 Scout 达到千万级上下文,拥有 1090 亿参数。其使用 NoPE 架构解决长度泛化问题,并通过优化训练流程和强化学习框架提升性能。

分类 资讯 标签 Llama、 Meta、 NoPE、 Transformer、 在线强化学习、 混合专家架构 发表评论

AGI AI AI技术 Anthropic ChatGPT Claude DeepSeek DeepSeek-R1 DeepSeek R1 GitHub GPT-4o LLM Meta OpenAI Python Sam Altman 人工智能 人形机器人 具身智能 大型语言模型 大模型 大语言模型 字节跳动 工业机器人 开源 强化学习 微软 扩散模型 技术创新 智能体 木易 机器学习 深度学习 清华大学 生成式AI 用户体验 百度 腾讯 自然语言处理 英伟达 谷歌 阿里云 阿里巴巴 马斯克 黄仁勋

分类

  • 分享
  • 国际
  • 大模型
  • 学术
  • 开源
  • 机器人
  • 资讯
  • ScienceMeter:专注于语言模型中科学知识更新的评测工具
  • Cognitive Kernel:面向通用自动驾驶的开源智能代理系统
  • ComfyUI Docker 镜像:稳定高效的节点式 Stable Diffusion 图形界面部署
  • 智能硬件控制进入新阶段,mcp2mqtt 打通物理设备与 AI 大模型的桥梁
  • 吴恩达:产品经理才是 AI 时代的最大瓶颈

2025 年 7 月
一 二 三 四 五 六 日
 123456
78910111213
14151617181920
21222324252627
28293031  
« 6 月    

归档

  • 2025 年 7 月
  • 2025 年 6 月
  • 2025 年 5 月
  • 2025 年 4 月
  • 2025 年 3 月
  • 2025 年 2 月
  • 2025 年 1 月
  • 2024 年 12 月
  • 2024 年 11 月

AI新闻 | X平台 | APK反编译 | 京ICP备2024096144号 |
© 2025 每时AI • Built with GeneratePress
 下载我们的APP,AI秒送达!  立即下载
×