AI日报:黑森林实验室放出Flux3;Claude Opus现已支持语音模式;快手入局AI互动内容赛道

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。 1、黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型 黑森林实验室发布的Flux3多模态基础模型, 首次 实现了原生音频生成,并在音视频同步、图像生成和动作控制方面表现
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
1、黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型
黑森林实验室发布的Flux3多模态基础模型, 首次 实现了原生音频生成,并在音视频同步、图像生成和动作控制方面表现出色,展现了其在人工智能领域的领先地位。
2、Claude Opus现已支持语音模式:从随口问答升级成能调工具、换语言的实时参谋
Claude 语音模式的升级显著提升了其处理复杂问题的能力,同时增加了对多种模型和工具的支持,使用户能够更高效地利用语音交互完成任务。

3、快手入局AI互动内容赛道,开放首批创作者招募
快手正式宣布推出‘AI互动内容’创作功能,标志着短视频平台竞争从传统内容时长延伸至交互式体验领域。该功能依托大模型,允许用户通过文字输入、选项选择主动参与内容走向,打破传统短视频单向传播模式。业内分析认为,这是快手在短视频存量竞争下的关键落子,旨在提升用户留存和推荐算法反哺。
4、小鹏人形机器人广州工厂开启小批量试生产 预计2026年实现量产
小鹏人形机器人广州工厂正式开启小批量试生产,标志着其量产冲刺进入倒计时。公司计划在2026年实现量产,并逐步应用于全球门店及商业场景,通过整合集团核心能力加速商业化落地。
5、腾讯混元合二为一:多模态与大语言模型部门合并,姚顺雨统管冲全模态上限
腾讯宣布将混元多模态模型部门与大语言模型部门合并,设立基础模型部,由姚顺雨统一管理。此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。
6、微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint
微软推出自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,分别面向高质量图像生成和高并发语音交互场景,强调训练数据可追踪且不依赖第三方模型蒸馏。两款模型已在多个产品中落地,并显著提升了效率和成本效益。

7、腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场
腾讯推出 WorkBuddy Bench 多领域评测套件,涵盖代码、网页、办公和安全四个领域,任务均从真实场景逆向工程而来,防止背答案。评测方式多样,强调抗污染能力,并公开数据集以提升透明度。
8、阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench
阿里开源的OvisOCR2模型在文档解析领域取得重大突破,以0.8B参数规模实现端到端解析,超越传统流水线方法,为RAG检索、智能问答和企业知识库提供高效支持。

要点速读
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技
- 欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技
- 更多细节仍在持续更新中
- 更多细节仍在持续更新中