字节计划打造超大规模AI模型

字节跳动押注超大规模基础模型:5 万亿参数起步,冲刺国内第一梯队

核心速览

2026 年 8 月,据多家行业媒体报道,字节跳动正启动超大规模 AI 大模型研发计划:基础参数规模超 5 万亿,最高目标冲刺 10 万亿,由旗下 Seed Foundation 团队主导,目前处于预训练早期阶段。若顺利落地,它将成为国内已知参数规模最大的大模型,接近海外 Anthropic 前沿模型的体量。
该计划是字节 AI 战略的关键转向:放弃 “小步快跑、蒸馏优化” 的短期路线,转向原生大参数、长期主义的基础模型研发,创始人张一鸣与 CEO 梁汝波均在内部明确表态,接受短期落后,拒绝用捷径换榜单排名。

一、项目基本信息

1. 参数规模:国内最大体量,对标海外第一梯队

  • 起步版本:据《晚点 LatePost》报道,内部初步讨论的模型参数规模超 5 万亿,超过阿里通义千问 3.8-Max(2.4 万亿)、月之暗面 Kimi K3(2.8 万亿),为当前国内已知规划中的最大参数模型。

  • 字节计划打造超大规模AI模型

    远期目标:据《金融时报》后续报道,最终训练目标最高可达10 万亿参数,接近业内估算的 Anthropic Mythos 5(约 8 万亿参数)级别,进入全球第一梯队。

  • 当前阶段:项目仍处于预训练早期,最终参数规模、发布节奏均未完全敲定,不排除调整或暂缓的可能。

2. 研发团队与组织架构

  • 项目由Seed Foundation 负责人项亮整体主导,大语言模型预训练数据负责人沈科协同推进,核心团队来自字节 Seed AI 实验室。

  • 为匹配超大规模模型研发,Seed 团队正在重新梳理组织架构、划分职责与分配算力资源,团队整体规模约 2000 人,覆盖算法、数据、工程、基础设施等全链条。


二、战略背景:高层定调 “长期主义,拒绝捷径”

此次超大规模模型立项,与字节内部对 AI 业务现状的判断直接相关,高层罕见统一了 “慢下来、打基础” 的路线:
  1. 直面差距,接受短期落后
    CEO 梁汝波在 2026 年中全员会上明确坦言:字节在视频生成模型(Seedance)上保持了全球领先,但大语言模型与海外前沿模型的差距正在拉大。接下来会坚持自研、做好基本功,接受一段时间的落后,优先优化长期能力,而非追求短期榜单成绩。
  2. 张一鸣红线:禁止蒸馏,不换短期排名
    创始人张一鸣在近期内部会议中罕见表态:做模型要坚持长期主义、延迟满足感,禁止用其他模型的输出蒸馏来换取一时的榜单排名。这一要求直接定下了新模型 “原生训练、全栈自研” 的技术路线,不走捷径、不凑短期效果。
  3. 超车逻辑:一步拉满参数规模
    Seed 团队的核心思路是:与其在同尺寸模型上持续追赶同行,不如直接将参数规模推到国内同行的数倍,通过体量优势实现能力弯道超车,争取一步进入全球第一梯队,为长期 AGI 布局打基础。

三、技术路线与投入门槛

1. 核心原则:原生训练,全栈优化

新模型放弃了行业常见的 “小模型 + 蒸馏” 快速迭代路线,采用完整的原生预训练方案,从数据清洗、架构设计到训练工程全链路自研,重点强化复杂推理、长文本处理、多模态融合等底层能力,目标是支撑下一代智能体(Agent)与专业场景落地。

2. 算力与成本门槛

超大规模模型对算力要求极高:业内估算,训练一个 5 万亿参数的基础模型,需要十万级以上的高端 GPU(如 H100) 协同工作,仅训练成本就达数十亿级别。字节依托火山引擎的算力基础设施,具备规模化调度的工程能力,是少数能支撑该级别训练的国内厂商。

四、国内外大模型参数规模对比

厂商代表模型参数规模状态
字节跳动新一代 Seed 大模型5 万亿起步,最高 10 万亿预训练早期
月之暗面Kimi K32.8 万亿已发布
阿里巴巴通义千问 3.8-Max2.4 万亿已发布
AnthropicMythos 5约 8 万亿(业内估算)已商用
OpenAIGPT-5 系列未公开已商用
注:参数规模是模型能力的重要影响因素,但并非唯一标准,最终效果还取决于训练数据质量、算法架构、工程优化能力。

五、核心挑战与不确定性

  1. 工程难度极高:万亿级参数模型的训练稳定性、通信调度、故障容错都是世界级工程难题,训练周期长达 3-6 个月,过程中存在大量技术风险。

  2. 成本投入巨大:算力、数据、人才的综合投入达百亿级别,对商业化回报的要求更高。

  3. 计划仍存变数:项目目前处于早期讨论与预训练阶段,官方尚未正式官宣,最终是否发布、何时发布均未最终确定。

  4. 参数≠能力:超大参数不直接等同于强能力,数据质量、对齐效果、场景适配同样关键,最终落地效果仍需验证。


六、行业影响与展望

  • 行业格局:若项目顺利落地,国内大模型竞争将正式进入 “5 万亿 +” 时代,头部厂商的技术门槛与算力壁垒会进一步抬高,行业集中度持续提升。

  • 字节优势:字节拥有抖音、豆包、剪映等海量 C 端场景,以及火山引擎的 B 端商业化渠道,模型能力一旦突破,落地速度与商业化效率会显著领先纯模型厂商。

  • 产业链带动:超大规模模型研发会持续拉动算力基建、高端芯片、AI 数据服务、先进封装等上游产业链的需求。


相关阅读

  • 美伊冲突升级,影响几何?

    美伊冲突升级,影响几何?

    美伊冲突再度升级:影响全景与情景推演核心速览当地时间2026 年 9 月 1 日,美军对伊朗南部霍尔木兹海峡周边的伊斯兰革命卫队目标发动大规模空袭,这是美军时隔一个多月后首次直接打击伊朗本土;伊朗随即展开报复,打击约旦境内美军基地、击落美军...

    2026.09.02 15:55:42作者:wanshishunyi888
  • 2026年中财报大会

    2026年中财报大会

    2026 年中财报大会|全市场复盘(8 月密集披露窗口)时间节点:A 股 8‑31 全部收官;港股 8‑31 中期业绩截止;美股二季度财报(Q2)8 月底收尾,英伟达 8‑26 盘后压轴;8.25‑8.31 是压哨披露高峰,大量业绩不及预期...

    2026.08.25 16:43:29作者:wanshishunyi888
  • 中国科技公司市值榜迎来洗牌

    中国科技公司市值榜迎来洗牌

    已完成思考,参考 12 篇资料中国科技市值榜历史性洗牌:半导体登顶,硬科技全面重构估值体系核心速览2026 年 8 月,中国科技公司市值榜迎来产业级重构:国产存储龙头长鑫科技登陆科创板后市值一路攀升,于 8 月 17 日收盘突破 4.13...

    2026.08.19 16:24:55作者:wanshishunyi888
  • Deepseek 迎来大动作

    Deepseek 迎来大动作

    DeepSeek 连发两大重磅动作:V4 Pro 正式版上线 + 开源 Agent 框架,告别性价比冲击高端核心速览2026 年 8 月 12 日 - 13 日,深度求索(DeepSeek)密集落地两大核心动作:旗舰大模型 DeepSeek...

    2026.08.14 16:08:33作者:wanshishunyi888
  • 字节计划打造超大规模AI模型

    字节计划打造超大规模AI模型

    字节跳动押注超大规模基础模型:5 万亿参数起步,冲刺国内第一梯队核心速览2026 年 8 月,据多家行业媒体报道,字节跳动正启动超大规模 AI 大模型研发计划:基础参数规模超 5 万亿,最高目标冲刺 10 万亿,由旗下 Seed Found...

    2026.08.07 16:27:30作者:wanshishunyi888
  • 美联储如期按兵不动!

    美联储如期按兵不动!

    美联储 7 月议息会议:如期按兵不动,内部分歧显著扩大核心速览北京时间 7 月 30 日凌晨,美联储公布 2026 年 7 月 FOMC 会议决议,宣布将联邦基金利率目标区间维持在3.50%-3.75%不变,为今年连续第五次按兵不动,整体符...

    2026.07.30 14:33:59作者:wanshishunyi888
  • 特朗普:考虑重启对伊朗的大规模作战行动

    特朗普:考虑重启对伊朗的大规模作战行动

    特朗普扬言重启对伊朗大规模作战:极限施压再升级,布油破百关口失守核心速览当地时间2026 年 7 月 23 日,美国总统特朗普在专访中公开表态,正 “认真考虑” 对伊朗发动规模超越此前 “史诗愤怒” 行动的大规模军事打击,称已接近做出最终决...

    2026.07.24 13:38:38作者:wanshishunyi888
  • 证监会:主动回应市场关切

    证监会:主动回应市场关切

    证监会主动回应市场关切:分层座谈 + 真金白银,打出稳预期组合拳核心速览2026 年 7 月 20 日 - 21 日,证监会连续召开多场分层专题座谈会,覆盖个人投资者、上市公司、证券基金机构及专家学者,主动下沉倾听市场诉求、回应各方关切。会...

    2026.07.22 09:54:22作者:wanshishunyi888