字节跳动押注超大规模基础模型:5 万亿参数起步,冲刺国内第一梯队
核心速览
一、项目基本信息
1. 参数规模:国内最大体量,对标海外第一梯队
起步版本:据《晚点 LatePost》报道,内部初步讨论的模型参数规模超 5 万亿,超过阿里通义千问 3.8-Max(2.4 万亿)、月之暗面 Kimi K3(2.8 万亿),为当前国内已知规划中的最大参数模型。

远期目标:据《金融时报》后续报道,最终训练目标最高可达10 万亿参数,接近业内估算的 Anthropic Mythos 5(约 8 万亿参数)级别,进入全球第一梯队。
当前阶段:项目仍处于预训练早期,最终参数规模、发布节奏均未完全敲定,不排除调整或暂缓的可能。
2. 研发团队与组织架构
项目由Seed Foundation 负责人项亮整体主导,大语言模型预训练数据负责人沈科协同推进,核心团队来自字节 Seed AI 实验室。
为匹配超大规模模型研发,Seed 团队正在重新梳理组织架构、划分职责与分配算力资源,团队整体规模约 2000 人,覆盖算法、数据、工程、基础设施等全链条。
二、战略背景:高层定调 “长期主义,拒绝捷径”
- 直面差距,接受短期落后CEO 梁汝波在 2026 年中全员会上明确坦言:字节在视频生成模型(Seedance)上保持了全球领先,但大语言模型与海外前沿模型的差距正在拉大。接下来会坚持自研、做好基本功,接受一段时间的落后,优先优化长期能力,而非追求短期榜单成绩。
- 张一鸣红线:禁止蒸馏,不换短期排名创始人张一鸣在近期内部会议中罕见表态:做模型要坚持长期主义、延迟满足感,禁止用其他模型的输出蒸馏来换取一时的榜单排名。这一要求直接定下了新模型 “原生训练、全栈自研” 的技术路线,不走捷径、不凑短期效果。
- 超车逻辑:一步拉满参数规模Seed 团队的核心思路是:与其在同尺寸模型上持续追赶同行,不如直接将参数规模推到国内同行的数倍,通过体量优势实现能力弯道超车,争取一步进入全球第一梯队,为长期 AGI 布局打基础。
三、技术路线与投入门槛
1. 核心原则:原生训练,全栈优化
2. 算力与成本门槛
四、国内外大模型参数规模对比
| 厂商 | 代表模型 | 参数规模 | 状态 |
|---|---|---|---|
| 字节跳动 | 新一代 Seed 大模型 | 5 万亿起步,最高 10 万亿 | 预训练早期 |
| 月之暗面 | Kimi K3 | 2.8 万亿 | 已发布 |
| 阿里巴巴 | 通义千问 3.8-Max | 2.4 万亿 | 已发布 |
| Anthropic | Mythos 5 | 约 8 万亿(业内估算) | 已商用 |
| OpenAI | GPT-5 系列 | 未公开 | 已商用 |
注:参数规模是模型能力的重要影响因素,但并非唯一标准,最终效果还取决于训练数据质量、算法架构、工程优化能力。
五、核心挑战与不确定性
工程难度极高:万亿级参数模型的训练稳定性、通信调度、故障容错都是世界级工程难题,训练周期长达 3-6 个月,过程中存在大量技术风险。
成本投入巨大:算力、数据、人才的综合投入达百亿级别,对商业化回报的要求更高。
计划仍存变数:项目目前处于早期讨论与预训练阶段,官方尚未正式官宣,最终是否发布、何时发布均未最终确定。
参数≠能力:超大参数不直接等同于强能力,数据质量、对齐效果、场景适配同样关键,最终落地效果仍需验证。
六、行业影响与展望
行业格局:若项目顺利落地,国内大模型竞争将正式进入 “5 万亿 +” 时代,头部厂商的技术门槛与算力壁垒会进一步抬高,行业集中度持续提升。
字节优势:字节拥有抖音、豆包、剪映等海量 C 端场景,以及火山引擎的 B 端商业化渠道,模型能力一旦突破,落地速度与商业化效率会显著领先纯模型厂商。
产业链带动:超大规模模型研发会持续拉动算力基建、高端芯片、AI 数据服务、先进封装等上游产业链的需求。







