WeatherNext 2:Google DeepMind 开源气象预报模型家族解析
posts posts 2026-08-16T03:32:00+08:00WeatherNext 是 Google DeepMind 的全球中期大气与气旋预报模型家族,仓库收纳 WN2、GraphCast、GenCast 三代模型与预训练权重。本文梳理模型谱系、FGN 机制、四条数据通道、benchmark 含义、本地运行门槛,以及 WN3 发布后这个仓库的边界。技术笔记DeepMind, 气象预报, 机器学习, JAXWeatherNext 2:Google DeepMind 开源气象预报模型家族解析
先给判断:这个仓库的价值不在"又一个 AI 模型",而在于它是 DeepMind 气象预报三代技术路线(图神经网络、扩散模型、FGN)的合集发布口——模型代码、预训练权重、论文、免费数据通道一次性给齐。对多数读者来说,正确的打开方式甚至不是跑模型,而是直接消费它每日更新的预报数据。
google-deepmind/weathernext 是 DeepMind 官方维护的 Python(JAX)仓库,Apache 2.0(代码与 Colab)+ CC BY 4.0(其余材料)双许可。仓库明确定位为研究代码:不保证 API 稳定,建议锁定具体 release 安装。
一个时效性说明:DeepMind 已在 2026 年 9 月发布下一代 WeatherNext 3,但只开放了预报数据、没有发布权重——想研究模型本身的代码与权重,这个仓库仍是唯一的官方来源,最新一代就是本文的主角 WN2。
模型谱系:三代路线一个仓库
WeatherNext 2(WN2)是当前仓库的主力——DeepMind 与 Google Research 联合开发的全球中期大气与气旋预报模型。仓库同时收容两代前辈:
| 模型 | 发布名 | 技术路线 | 步长 / 集合成员 | 发表 |
|---|---|---|---|---|
| WeatherNext Graph | GraphCast | 图神经网络(GNN),确定性预报 | 6 小时 / 单一确定性路径 | Science,2023 |
| WeatherNext Gen | GenCast | 扩散模型,集合概率预报 | 12 小时 / 50 成员 | Nature,2024 |
| WeatherNext 2 | WN2 | FGN,从边际分布构造联合概率预报 | 6 小时 / 64 成员 | arXiv,2025 |
三者的分野是理解这个家族的钥匙。GraphCast 回答"最可能发生什么",给出一条确定性路径;GenCast 引入扩散模型回答"不确定性如何分布",能产出集合但每个样本生成代价高;WN2 的技术报告标题(Skillful joint probabilistic weather forecasting from marginals,从边际分布到可靠的联合概率预报)点明了它的路子——在已经算好的边际分布之上,一次性采样出成体系的联合概率场景。这也是它既能给大气场、又能给气旋路径和强度的概率预报的原因。WN2 与气旋专用版(WeatherNext Cyclones)共享同一套算法,仅因独立训练而权重不同。
时间线也值得记一下:技术报告 2025 年 6 月挂上 arXiv,同年 10 月起在 Google 产品端投运,11 月官方博客正式定名发布;气旋版本独立走了一条线,2026 年 8 月以 Operational tropical cyclone forecasting with AI 为题登上 Nature。
FGN:把随机性放进网络参数,而不是生成过程
理解 WN2 要先理解它换评估范式的动机。传统集合预报(如 ECMWF 的 IFS ENS,51 个成员)用"跑几十次独立模拟"来量度不确定性,代价是超级计算机上数小时的算力。Diffusion 路线的 GenCast 在生成质量上达标了,但每生成一个成员都要跑约 40 步去噪迭代,采样仍然偏贵。
FGN(Functional Generative Network,功能生成网络)的解法是把随机性从生成过程挪进网络本身。每个集合成员对应一套从学习到的分布中采样的网络权重:一个 32 维全局高斯噪声向量经条件归一化层注入,改变的是网络参数而非输入数据。于是一个成员就是一次前向传播——同样的架构,换一组参数扰动,就是一条不同的天气路径。这也是官方"快 8 倍"的机制来源:GenCast 每成员 40 次网络调用,FGN 只需 1 次。
架构上 FGN 承接了 GenCast 的骨架:GNN encoder/decoder 先把数据映射到二十面体网格上(GraphCast 一脉的球形网格表示,逐级细化六次),中间交给 graph-transformer 处理器。规模比 GenCast 大了一圈——潜变量维度从 512/16 层扩大到 768/24 层,参数量约 1.8 亿对 5,700 万。训练直接以 fair CRPS 为目标,只约束每个点位自身的边际分布,但训练完成后模型能输出空间上成体系的联合场景(比如整片高温区域的范围),这正是报告标题"from marginals"的含义。代价也不轻:深度集合用 4 个独立训练的模型支撑,单个种子训练约 4 天,总计约 560 个 TPU 日。
对业务的实际含义是:以往要在"精度"和"概率覆盖"之间取舍,现在同一份算力能同时拿到快推理和足够大的集合——气旋业务运行常规出 50 个成员,需要时可扩展到 1,000 个,论文验证了大集合对快速增强这类罕见但致命的场景捕捉得明显更好。低概率、高破坏的极端天气,恰恰是预警价值最集中的地方。
预训练模型矩阵:按年份分档,不是按版本号
仓库提供的权重按"训练数据截止年"分档,这个设计初看容易困惑,实际逻辑很清晰:
- WeatherNext2_<2025:0.25° 分辨率(约 30 km),在 ECMWF HRES 上微调、由业务 HRES 初始条件直接初始化(而非 ERA5 再分析),2024 年数据训练——这是业务运行版本,权重为
WeatherNext2_<2025_model{1,2,3,4}.npz。 - WeatherNextCyclones_<2025:2025 年大西洋飓风季实际值班过的版本(对外称 FNV3,NHC 的后处理版本叫 GDMI),复现论文结果用。论文附录包含它在 2025 年 NHC 海域的部分评估,以及 2025 年 9 月追踪器改进带来的提升。
- WeatherNextCyclones_<2024 / <2023:分别复现论文在 2024、2023 年的结果,训练数据各自截至 2023、2022 年。
- Cyclones Mini(1° 分辨率):轻量版,分
<2024、<2023两档,单个.npz权重文件,面向低显存场景(单 TPU/GPU、本地测试)。预报内容与大版本相同(含气旋),但官方明言性能不及大版本。
注意 WN2 与 Cyclones 的差别只有一点:WN2 额外预报 100 米高度风场。
大多数人该走的路:不跑模型,直接拿数据
这是本文最实用的一节。自建运行环境需要 TPU(或 H100 级 GPU)才能跑非 Mini 权重,而官方提供了四条免费数据通道,覆盖从研究到应用的各种需求:
| 通道 | 形态 | 适合 |
|---|---|---|
| Google Cloud(Earth Engine / BigQuery / Vertex AI) | 数据湖/查询 | 大规模研究、批量回算 |
| WeatherLab(含气旋路径) | 交互式可视化 | 直观看预报与不确定性 |
| Open-Meteo API(含交互式构建器) | REST API | 应用集成、轻量验证 |
GCS bucket dm_graphcast | 权重 + 样例数据 | 本地复现 |
第三条通道对应用开发者尤其友好——一个 HTTP 请求就能拿到模型输出,不必碰任何 ML 基础设施。
走 Google Cloud 通道需要注意许可的切分:实时数据适用 GDM 实验性条款,历史数据(1 小时以前)则是 CC BY 4.0;访问需要提交白名单申请,通常 5–7 个工作日获批,一次授权同时覆盖 GCS、BigQuery 和 Earth Engine。
一次气旋预报如何流经这套系统
把抽象机制串起来,看一次业务化气旋预报的完整路径:
- 业务中心拿到初始大气状态(HRES 初始场),喂给
WeatherNextCyclones模型。 - FGN 从这一单一状态出发,在 TPU 上并行采样出成员,每个成员都是一条完整的 15 天未来路径——2025 年飓风季业务运行 50 个成员,2026 年季扩到 1,000 个。
- 后处理把成员聚合成概率分布,直接气旋追踪器(cyclone tracker)在预报场里检出每一帧的风暴中心,输出路径、强度和风场结构。
- 最终产物是一组带概率的气旋轨迹,汇入官方预警流程——它给的是"什么地方以什么概率受影响",而非单一一条线。
这条链路不是纸面推演。2025 年 10 月飓风 Melissa 以五级强度登陆牙买加,成为有记录以来登陆该国的最强风暴:NHC 依据 WeatherNext 集合预报,首次实现从一级风速起点预测到五级登陆——提前 5 天给出 80% 置信度,提前 3 天升到接近 100%。NHC 当年发布的年度验证报告把 WeatherNext 评为路径与强度表现最好的单一模型。注意它的使用方式:NHC 把 WN-C 并入 TVCN/IVCN 这类共识预报工具,与其他模式和实测数据加权融合,官方警报仍由气象机构自己发布。
在本地复现这条链路的最小版就是官方 Colab 笔记本(docs/weathernext2/wn2_demo.ipynb):加载云端权重 → 读 HRES 初始场 → 初始化 WN2(FGN)架构 → 自回归(autoregressive,把上一步输出回填为下一步输入)滚动预报 → 可视化温度、风速、位势高度 → 跑气旋追踪器输出路径 → 计算损失并做一次梯度下降。它把上述"推理"与"训练一步"都演示了。
benchmark 该怎么读
官方给出的数字要分两层看。第一层是速度:官方口径比上一代快 8 倍,机制上就是前面说的每成员 1 次前向对 40 步去噪;单条 15 天轨迹在单块 TPU v5p 上不到一分钟,输出步长 6 小时,以每日数据馈送的方式发布。第二层是概率技能:官方博客称 WN2 在 0–15 天全部时效上、99.9% 的变量上超越上一代 WeatherNext 模型(GenCast)。
气旋侧的数字来自 2026 年 8 月的 Nature 论文,测试年是 2023–2024、真值是 IBTrACS:5 天路径误差 WN-C 约 230 km,ECMWF ENS 约 370 km,GenCast 约 335 km。换算成时间,ENS 要跑到 3.75 天时效才有 230 km 的水平——相当于多出约 30 小时预警时间,对 GenCast 约 24 小时。强度维度同样领先:3 天平均强度误差比 NOAA 的 HAFS 低约 3.75 kt,概率强度 CRPS 相比 ENS 与 GenCast 下降超过 50%;对快速增强(24 小时内风速骤增 35 mph 以上)这类最考验预警的场景,检出评分 CSI 从略低于 0.3 提升到 0.5;把它并入 NHC 共识预报后,路径误差再改善 18%–38%(平均 28%)。
读这些数字时先问"测的是什么":路径误差衡量风暴中心位置,强度误差衡量风速等级,二者由不同的物理尺度主导,所以分开报。能推出的结论是——这套系统把原本分属两套模型的"轨迹 + 强度"统一进了一个自回归模型,端到端优化,而且是在输入分辨率比区域模式粗一个数量级的前提下做到的(论文的原话是:高分辨率不是顶级强度预报的严格前提)。不能直接推出的结论至少有两条:一是气旋场景的领先不自动等于通用大气场对一切场景全面领先;二是官方明确说明模型未经任何气象机构合作产出或背书,预报不能替代官方预警。AI 的用途是压缩预警窗口、补集合规模,不是替换决策源。
WN3 已发布,这个仓库的边界在哪
2026 年 9 月 3 日,DeepMind 发布 WeatherNext 3:全球第一个逐小时出预报的全球天气 AI 模型,直接摄取原始静止卫星云图(绕过了传统 NWP 六小时的数据滞后),地表关键变量分辨率到 5 km(0.05°),官方称比上一代"精细约 5 倍",第三方机构 Brightband 的实时评估把它列为迄今最先进最准确的全球天气模型。
但对这个仓库来说,WN3 目前只是"隔壁的产品":权重和代码没有发布,开放的是预报数据(BigQuery、Earth Engine、GCS 的 Zarr 格式)。仓库里能读、能跑、能改的最新一代仍是 WN2。对研究者的含义很直接:想理解 Google 最新业务模型背后的机制,FGN 论文和 WN2 权重仍是最好的公开标本;WN3 何时开源、是否开源,目前没有官方承诺。
真要本地跑:门槛与路径
硬件边界(README 明示):推荐 TPU(实现针对 TPU 优化);GPU 路线必须按 demo notebook 所示切换 attention 实现,非 Mini 模型需要 H100 级显存,Mini 版(Cyclones Mini)P100 即可推理,Colab 免费 v5e-1 运行时就能开。没有 H100 的话,务实做法是从 Mini 权重起步——接口和流程与完整版一致,只是分辨率和精度打折。
本地安装锁定版本:
pip install git+https://github.com/google-deepmind/[email protected]想完整训练则要另备数据:ERA5(经 WeatherBench2 以 Zarr 提供)做基础训练,WeatherBench2 的 HRES 数据做业务微调。注意这些数据集有独立条款,使用前需自查合规。
仓库结构上,utils/ 收纳了跨模型共享的基础设施——自回归滚动、输入归一化、图构建块、损失计算、xarray 兼容层——这意味着读这个目录等于读三代模型共用的工程骨架。
边界与风险声明
仓库的免责条款值得转述:这不是 Google 官方支持的产品;模型未与任何气象机构合作产出,也未被其背书,不能替代官方预警。对要做下游应用的人,这段话是产品设计的硬约束——AI 预报可以当参考源,不能当决策源。Melissa 一节的 NHC 用法(并入共识工具、警报仍由机构发布)就是这个约束在业务侧的样子。
采用建议
按需求分三档:做应用(天气类产品、可视化、研究分析)→ 直接走 Open-Meteo API 或 WeatherLab,零基础设施成本;做研究(模型改进、极端天气分析)→ Colab + Mini 权重起步,必要时上 TPU 复现完整版;做工程(业务化部署)→ 评估 Google Cloud 数据通道订阅(现在可以一并评估 WN3 的数据源),比自运维模型便宜得多。真正需要 clone 仓库跑训练的,只剩"要在自有数据上微调"这一类需求。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。