字节跳动讨论训练超5万亿参数大模型,规模或超国内现有最大模型
6小时前1 阅读

据《晚点 LatePost》报道,字节跳动正在讨论训练一款参数规模超过5万亿的大语言模型,若最终落地,其规模将超过阿里通义千问 Qwen3.8-Max 的2.4万亿参数和月之暗面 Kimi K3的2.8万亿参数,成为目前国内已知参数规模 最大 的模型。不过,该项目仍处于早期阶段,最终是否正式发布尚未确定。 报道称,该模型计划由字节跳动 Seed Founda
据《晚点 LatePost》报道,字节跳动正在讨论训练一款参数规模超过5万亿的大语言模型,若最终落地,其规模将超过阿里通义千问 Qwen3.8-Max 的2.4万亿参数和月之暗面 Kimi K3的2.8万亿参数,成为目前国内已知参数规模 最大 的模型。不过,该项目仍处于早期阶段,最终是否正式发布尚未确定。
报道称,该模型计划由字节跳动 Seed Foundation 负责人项亮主导,并与大语言模型预训练数据负责人沈科合作推进。围绕这一项目,Seed 团队正在进行组织调整,包括重新梳理研发职责、优化资源配置,以支持超大规模模型训练。
资料显示,项亮与沈科均是字节跳动人工智能和大模型研发体系的重要成员,二人均来自字节核心“搜广推”技术体系。项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016年加入字节跳动,曾负责机器学习中台 AML 团队,后担任豆包大模型 Foundation 团队负责人。沈科于2018年清华大学毕业后加入字节,目前主要负责大语言模型预训练数据相关工作。
随着国内外AI厂商持续扩大模型参数规模,并围绕训练数据、算力和基础架构展开竞争,超大规模模型研发正在成为头部企业探索通用人工智能能力的重要方向。字节此次布局也反映出国内大模型竞争正从应用创新进一步延伸至基础模型能力建设。
要点速读
据《晚点 LatePost》报道,字节跳动正在讨论训练一款参数规模超过5万亿的大语言模型,若最终落地,其规模将超过阿里通
- 据《晚点 LatePost》报道,字节跳动正在讨论训练一款参数规模超过5万亿的大语言模型,若最终落地,其规模将超过阿里通
- 更多细节仍在持续更新中
- 更多细节仍在持续更新中