AllenAI推出OlmoEarth平台 实现行星级卫星推理突破

1 阅读4分钟应用
AllenAI推出OlmoEarth平台 实现行星级卫星推理突破

背景与挑战

地球观测模型的推理规模与传统机器学习相差巨大。单张卫星影像往往数十兆字节,完整任务需要处理数十TB甚至上百TB的数据。数据来源分散、投影分歧、云遮挡等因素导致下载与预处理耗时远超模型前向计算。AI2 在多年运营 Skylight 与 EarthRanger 平台的经验,使其深刻认识到,只有可靠且成本可控的基础设施,才能让环境领域的组织真正落地 AI 能力。

平台架构与硬件分层

OlmoEarth 将推理流水线拆分为三大阶段,分别匹配最合适的硬件资源:

  • 数据获取与预处理(CPU + 高I/O):抓取、重投影、对齐并归一化原始影像,输出为适合快速加载的中间格式(如 Zarr)。
  • 模型前向(GPU):在 GPU 上完成大模型的推理,直接将最小化的原始预测写入对象存储。
  • 后处理(CPU):将窗口化输出拼接成完整地图,应用掩码、重标定,并导出为 Zarr、GeoTIFF 或 GeoJSON。

平台通过 OlmoEarth Run 调度层将地理区域切分为数百至数千个分区,每个分区再细分为窗口,由独立的 Docker 容器并行执行。

大规模并行案例

在一次面向北美的野火风险映射任务中,平台峰值调度约 19,600 台 CPU 与 994 块 GPU,网络吞吐超过 168 GB/s。该任务将原本需要 4,737 小时的串行计算压缩至约 30.5 小时,提速 155×,并将每平方公里的推理成本降至几分钱。

数据获取与索引体系

平台维护自建的影像元数据索引,实时同步 AWS Open Data、ESA STAC 等公共数据源的新增场景。通过 SNS 通知或定时轮询,索引能够在数分钟内捕获新影像,避免在大规模推理时对外部 API 产生突发请求。运行时,系统根据任务的时间范围与地区,从索引挑选最佳影像并采用 Cloud‑Optimized GeoTIFF(COG)或 Zarr 的范围读取,只拉取窗口所需的字节,显著降低带宽消耗。

故障恢复与可靠性

每个子任务在独立的虚拟机中运行 Docker Runner,具备 幂等可重入 特性。平台自动检测任务卡顿或异常,触发重试并在必要时切换至备用提供商。任务失败后,监控组件会重新调度容器,确保整体作业在数千节点的规模下仍能稳健完成。

路线图与展望

  • 自动化模型运行:支持基于影像索引的定时或事件驱动推理。
  • 变化检测与告警:实时监测森林砍伐、洪涝等异常,并推送可操作的警报。
  • 智能体工具:研发代理式界面,帮助非专业用户完成数据策划、特征工程和模型微调。
  • 更高效模型:与研究团队合作,探索降低 GPU 时间的架构改进。
  • 多模态扩展:加入天气数据(ERA‑5)及新卫星传感器,提升环境监测的细粒度。
  • 跨云部署:当前在 Google Cloud 运行,未来将支持多云或本地私有云部署,满足合作伙伴的合规需求。

OlmoEarth 的目标是让全球的环保、粮食安全和灾害响应团队,能够在预算与技术资源受限的情况下,直接使用开源大模型进行行星级别的地球观测分析。随着平台功能的迭代,AI 将在可持续发展领域发挥更大作用。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。