项目详情

TimesFM

Google 的时间序列基础模型——不给它看你的数据,它也能预测你的曲线

GitHub 地址 ICML 2024 论文 30.9k Stars Apache-2.0(代码) v3.0 权重非商业许可

更新于 2026-09-04

← 返回汇总
项目速览

一句话定位

时间序列的 GPT 时刻

Google Research 的预训练时间序列基础模型:把曲线切成 patch 当 token,用 decoder-only Transformer 学出「通用预测直觉」,零样本(zero-shot)就能预测没见过的序列——销量、负载、气温、股价曲线,不训练直接出未来。3.0 版原生支持多变量与协变量,在 fev-bench / TIME / GIFT-Eval 三大基准全部登顶。已内置于 BigQuery ML 和 Google Sheets。适合不想为每条曲线单独建模的预测场景。

项目速览

核心数据

30.9k
Stars
2,946
Forks
28+
贡献者
v3.0
最新版(2026-08-28)
16k
上下文长度(2.5 起)
200M
参数量(2.5 瘦身后)
3 × #1
三大基准登顶
2026-09-02
最近提交

数据来源:GitHub API,采集于 2026-09-04。2024-04 创建,ICML 2024 论文;237 open issues;Apache-2.0 代码,但 3.0 权重单独许可(非商业)。

范式

「基础模型」三个字对预测意味着什么

传统预测(ARIMA / Prophet / LSTM)
  • 每条曲线(或每类曲线)单独建模、单独调参
  • 数据少时效果差,冷启动是硬伤
  • 换业务域基本重头来过
  • 运维成本 = 序列数量 × 建模人力
TimesFM 路线
  • 预训练一次:海量公开序列(零售、能源、天气、网页流量……)学出「通用曲线直觉」
  • 零样本:新序列直接推理,不训练不调参
  • 序列再少也能预测(几十个点就能出未来)
  • 边际成本趋近一次前向推理

类比 NLP:它就是时间序列里的 GPT——把「预测下一词」换成「预测下一段曲线」。ICML 2024 论文标题即《A decoder-only foundation model for time-series forecasting》。

版本演进

两年四级跳

v1.0 · 2024-04 ICML 2024 论文 decoder-only 开山 200M 参数 · 512 上下文 v2.0 · 2025 上半年 500M 参数 · 2048 上下文 多尺寸检查点 v2.5 · 2025-09 瘦身:500M → 200M 上下文 2048 → 16k(×8) 1k 分位数视野 · 去 frequency 指示 · Flax 推理版 v3.0 · 2026-08 原生多变量 + 协变量 三大基准全部 #1 ⚠ 权重转非商业许可 演进逻辑读法 1.0 立范式 → 2.0 堆规模 → 2.5 反向瘦身换长上下文(蒸馏方向,200M 吃 16k 上下文)→ 3.0 补结构化能力(多变量/协变量)并走向产品化
Apache-2.0 权重 非商业许可权重
技术原理

曲线怎么变成「语言」

① 输入序列 patch 1 patch 2 patch 3 patch 化 ② Token 化 + 输入 Decoder 每个 patch ≈ 语言模型里的一个词 ③ 自回归生成未来 patch 「预测下一个词」→「预测下一段曲线」 为什么这个设计聪明 · patch 而非逐点:序列长度压缩数十倍,16k 点上下文只需数百 token,Transformer 吃得下 · 借用语言模型全部成熟基建(decoder 架构/训练技巧/加速推理),跨域公开序列预训练出「曲线通识」 2.5 起可选 30M 分位数头:一次输出 9 个分位(0.1-0.9)的连续预测区间,不止点估计
3.0 新能力

多变量 + 协变量:从「单曲线」到「系统」

from timesfm3 import TimesFM3Evaluator

outputs = forecaster.predict_batch(
    contexts=[target],          # (3, 128) 三条目标曲线
    horizon=24,
    past_only_covariates=[poc], # (1, 128) 仅过去已知
    past_future_covariates=[pfc], # (2, 152) 过去+未来已知
    return_quantiles=True)
# → (3, 24) 联合预测 + (3, 24, 9) 分位

典型场景:预测多门店销量(多变量),已知未来有促销日历/节假日(future covariates)——3.0 原生吃进去,无需逐任务调参。

  • 原生多变量:多通道联合预测,捕捉通道间依赖,不是「多条单变量硬拼」
  • 两类协变量:past-only(如昨日天气)与 past+future(如已知未来的促销计划)分开建模
  • 9 分位数输出:0.1-0.9 连续分位区间,库存/容量决策直接用上界下界
  • 零样本前提不变:以上全部能力不训练直接用——「通用性」没有为专业能力让路
基准

三大基准,全部登顶

fev-bench

100 个真实世界预测任务的综合榜。Rank #1 overall。

TIME Benchmark

50 个领域数据集、98 个评估任务。Rank #1 overall。

GIFT-Eval

时间序列基础模型专项榜。全部基础模型中 #1。


产品化

不只是 GitHub 仓库:Google 全家桶已内置

BigQuery ML

SQL 里直接 SELECT 预测——企业级规模化可靠性路径,数据不出仓。

Google Sheets

表格里Forecast 函数级别的接入(2026-02 上线)——最日常的预测入口。

Vertex Model Garden

Docker 化端点,专为 agentic 调用设计——Agent 想预测时直接挂。


  • 开发者侧也在跟进 Agent 生态:2026-03 仓库加入 AGENTS.md 与 SKILL.md(timesfm-forecasting/)——让编码 Agent 会用 TimesFM
  • 微调路径完整:HF Transformers + PEFT(LoRA)官方示例,领域数据不足 10k 条也能低成本适配
  • 双后端:PyTorch 为主,2.5 提供 Flax 快速推理版
快速上手
pip install timesfm[torch]
# 或直接拉 3.0 权重
google/timesfm-3.0-pytorch
# (Hugging Face)

批量变长序列一批进、分位数一批出,API 面很小。

许可转折

3.0 权重不再 Apache:最关键的商业决策

  • 代码:始终 Apache-2.0,随便改
  • ≤2.5 权重:Apache-2.0,可商用可生产——大量公司线上跑的就是 2.5
  • 3.0 权重:timesfm-non-commercial-license-v1.0——非商业、非生产限制,商用默认权重不被允许
  • Google 的算盘:开源引流 + 最强版本收权 → 商业需求导流 BigQuery ML / Vertex(1P 产品)。经典 open-core 变体
对你意味着什么
  • 研究/学习/原型:3.0 随便用,基准能力最强
  • 商业产品:要么锁 2.5(Apache),要么买 Vertex 端点,要么自己 LoRA 微调 2.5 追平需求
  • 「以后会不会放开」未知——README 措辞是 for the time being(暂时)
风险与局限

冷静看

潜力评估

打分

维度评分依据
技术价值
时间序列基础模型开创者之一,三大基准全 #1
工程质量
单元测试、LoRA 微调示例、agent skill、双后端
开放性
代码 Apache,但 3.0 权重非商业——开放性倒退
维护活跃
Google 团队 + 社区,昨日仍在提交
生产就绪
2.5 已被大量生产采用;3.0 待生态成熟

综合 8/10。预测领域的范式定义者——「每条曲线单独建模」的时代正在被它终结。扣分在 3.0 权重许可的倒退:开源社区拿到的是上一个版本的钥匙。

最终裁决

适合谁,不适合谁

用
  • 零售/运维/能源/气象等大量序列要预测,建不起模团队
  • 冷启动场景:新 SKU、新设备,历史数据只有几十个点
  • 研究时间序列基础模型(代码+论文+基准全公开)
  • 需要预测区间的库存/容量决策(9 分位数现成)
慎用
  • 商业产品要上 3.0 权重(非商业许可,锁 2.5 或走 Vertex)
  • 高频金融/极端分布外场景零验证直接上
  • 期待 Google 官方 SLA 支持(这是 research 开源)

上一个
Pretext
下一个
Coolify
在线体验

Patch 化可视化器

亲眼看曲线怎么变成「语言」:画一条序列或选预设波形,调 patch 长度与预测视野,实时看 patch 切分、自回归外推与预测区间——TimesFM 输入管线的直觉版。

进入 Playground →
1 / 14