通信巨头入局视频生成,直接霸榜权威评测:人物跨越多场景依然一致

中国电信人工智能研究院发布的新模型TeleAI-VAST,在16项子指标中有9项排名第一,包括物体分类、人体动作等。该模型展示了四位女主角的不同场景下的前后一致性和人物动作精准控制能力,并且实现了声音与画面的同步效果。此外,它采用了独特的两阶段生成架构,使得视频生成更加精确和可控。

谷歌邀马斯克联手做AI游戏!DeepMind版Sora是个3D游戏引擎,一张图生成无限可交互世界

谷歌发布Genie 2世界模型,支持响应键鼠操作、长期记忆及NPC交互,生成3D游戏世界。该技术可用于训练具身智能体,迈向AGI。对比前代,Genie 2在复杂环境生成上取得了进展。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解,动态调整下一步检索策略

阿里通义实验室推出OmniSearch多模态检索智能体,通过动态规划提高检索效率和生成内容准确性。OmniSearch能根据问题情境动态调整检索策略,显著优于传统方法,尤其在需要多步推理、多模态知识和快速变化答案的问题上表现优异。