(时间 = 可被直接访问的关系结构)

目录

一、Transformer 出现前,RNN 已经“够好”了吗?

二、Attention 的本质:打破“时间只能递归传播”

Attention 的一句话本质是:

三、Transformer 在时间序列里的第一反应

四、但问题很快暴露(这是关键)

2️⃣ 时间序列需要“归纳偏置”

3️⃣ 经验事实(你之后一定会遇到)

五、现代 TS Transformer 在“补什么课”?

六、回到现实——你到底该怎么选模型?

不同模型的“时间观”对照表

1️⃣ 如果你的数据是:

2️⃣ 如果你的数据是:

3️⃣ 如果你还需要:

最后:一个非常“老派但重要”的忠告


一、Transformer 出现前,RNN 已经“够好”了吗?

站在 2016 年左右,你如果只看时间序列领域,会发现:

  • LSTM 能学长期依赖 ✔

  • 状态空间能建模结构 ✔

  • 工业界也跑得动 ✔

那我先问你一个不那么技术的问题

如果模型必须“一步一步”走时间,
那时间本身,是不是成了计算瓶颈?

这个问题,不是时间序列内部提出来的
而是 NLP / 语音 把它逼出来的。


二、Attention 的本质:打破“时间只能递归传播”

我们先忘掉 Transformer 的所有工程细节。

Attention 的一句话本质是:

当前时刻的信息,
可以直接访问任意历史时刻的信息

数学形式(概念版):

\text{Attention}(q_t, K, V) = \sum_i \alpha_{t,i} v_i

其中:

  • \alpha_{t,i}​:相似度权重

  • 不再依赖 i \approx t

📌 这是一次对“时间因果传播”的根本性松绑


三、Transformer 在时间序列里的第一反应

时间序列研究者看到 Transformer 的第一反应是:

“太好了!
终于不用担心长程依赖了!”

于是出现了大量:

  • Transformer for TS Forecasting

  • Informer / Autoformer / FEDformer

  • Long Sequence Forecasting


四、但问题很快暴露(这是关键)

1️⃣ 时间序列 ≠ 语言

在 NLP 中:

  • token 是离散的

  • 语义关系是主导

但在时间序列中:

  • 数值是连续的

  • 时间顺序本身携带信息

📌 Attention 天生是:

顺序不敏感的


2️⃣ 时间序列需要“归纳偏置”

RNN / State Space 强在:

  • 连续性

  • 局部平滑

  • 动态系统假设

Transformer 默认假设:

“所有位置都平等”

这在时间序列里往往是错的


3️⃣ 经验事实(你之后一定会遇到)

  • Transformer 在长序列 / 多变量 / 大数据 上很强

  • 在 小样本 / 噪声大 / 强趋势的 TS 上,经常不如 LSTM / SSM

📌 所以现在的 TS Transformer 论文,几乎都在做一件事:

偷偷把“时间结构”加回来


五、现代 TS Transformer 在“补什么课”?

你会看到这些关键词反复出现:

  • Decomposition(趋势/季节分解)

  • Relative position encoding

  • Frequency domain attention

  • Hybrid RNN + Transformer

👉 本质一句话:

Attention 不懂时间,
我们得教它时间。


六、回到现实——你到底该怎么选模型?

你现在可以把所有模型,放在这一句话下:

时间序列建模 =
状态表示 + 状态如何随时间变化 + 如何利用历史

不同模型的“时间观”对照表

模型时间观
ARIMA固定阶线性滞后
Holt / HW平滑更新的趋势/季节
State Space潜在状态演化
ML(RF/XGB)时间 → 特征
RNN / LSTM非线性状态递推
Transformer任意时刻直接访问

1️⃣ 如果你的数据是:

  • 人数不多

  • 每人时间点有限

  • 噪声大

  • 有趋势 / 干预效应

👉 State Space / LSTM / GRU
通常比 Transformer 更稳


2️⃣ 如果你的数据是:

  • 长序列

  • 多变量

  • 跨个体共享模式

  • 数据量够大

👉 Hybrid Transformer
(分解 + Attention)开始有优势


3️⃣ 如果你还需要:

  • 可解释性

  • 不确定性

  • 推断而非纯预测

👉 State Space(甚至 Bayesian SSM)
仍然是王者


最后:一个非常“老派但重要”的忠告

你现在这个学习深度,我会给你一句研究者级别的建议

不要问“哪个模型最好”
要问“我对时间做了什么假设”

模型只是假设的容器

END.


回顾:

时间序列模型发展历程(第一讲:AR/MA/ARMA)-CSDN博客

时间序列模型发展历程(第二讲:平稳性危机与ARIMA诞生、SARIMA)-CSDN博客

时间序列模型发展历程(第三讲:指数平滑法 / Holt / Holt-Winters)-CSDN博客

时间序列模型发展历程(第四讲:State Space Models)-CSDN博客

时间序列模型发展历程(第五讲:第二代——机器学习时序模型 | SVR/RF/XGBoost/浅层ANN)-CSDN博客

时间序列模型发展历程(第六讲:第三代——深度学习 RNN / LSTM)-CSDN博客

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐