时间序列模型发展历程(第七讲:Attention / Transformer)
(时间 = 可被直接访问的关系结构)
目录
一、Transformer 出现前,RNN 已经“够好”了吗?
一、Transformer 出现前,RNN 已经“够好”了吗?
站在 2016 年左右,你如果只看时间序列领域,会发现:
-
LSTM 能学长期依赖 ✔
-
状态空间能建模结构 ✔
-
工业界也跑得动 ✔
那我先问你一个不那么技术的问题:
如果模型必须“一步一步”走时间,
那时间本身,是不是成了计算瓶颈?
这个问题,不是时间序列内部提出来的,
而是 NLP / 语音 把它逼出来的。
二、Attention 的本质:打破“时间只能递归传播”
我们先忘掉 Transformer 的所有工程细节。
Attention 的一句话本质是:
当前时刻的信息,
可以直接访问任意历史时刻的信息
数学形式(概念版):
其中:
-
:相似度权重
-
不再依赖
📌 这是一次对“时间因果传播”的根本性松绑
三、Transformer 在时间序列里的第一反应
时间序列研究者看到 Transformer 的第一反应是:
“太好了!
终于不用担心长程依赖了!”
于是出现了大量:
-
Transformer for TS Forecasting
-
Informer / Autoformer / FEDformer
-
Long Sequence Forecasting
四、但问题很快暴露(这是关键)
1️⃣ 时间序列 ≠ 语言
在 NLP 中:
-
token 是离散的
-
语义关系是主导
但在时间序列中:
-
数值是连续的
-
时间顺序本身携带信息
📌 Attention 天生是:
顺序不敏感的
2️⃣ 时间序列需要“归纳偏置”
RNN / State Space 强在:
-
连续性
-
局部平滑
-
动态系统假设
Transformer 默认假设:
“所有位置都平等”
这在时间序列里往往是错的。
3️⃣ 经验事实(你之后一定会遇到)
-
Transformer 在长序列 / 多变量 / 大数据 上很强
-
在 小样本 / 噪声大 / 强趋势的 TS 上,经常不如 LSTM / SSM
📌 所以现在的 TS Transformer 论文,几乎都在做一件事:
偷偷把“时间结构”加回来
五、现代 TS Transformer 在“补什么课”?
你会看到这些关键词反复出现:
-
Decomposition(趋势/季节分解)
-
Relative position encoding
-
Frequency domain attention
-
Hybrid RNN + Transformer
👉 本质一句话:
Attention 不懂时间,
我们得教它时间。
六、回到现实——你到底该怎么选模型?
你现在可以把所有模型,放在这一句话下:
时间序列建模 =
状态表示 + 状态如何随时间变化 + 如何利用历史
不同模型的“时间观”对照表
| 模型 | 时间观 |
|---|---|
| ARIMA | 固定阶线性滞后 |
| Holt / HW | 平滑更新的趋势/季节 |
| State Space | 潜在状态演化 |
| ML(RF/XGB) | 时间 → 特征 |
| RNN / LSTM | 非线性状态递推 |
| Transformer | 任意时刻直接访问 |
1️⃣ 如果你的数据是:
-
人数不多
-
每人时间点有限
-
噪声大
-
有趋势 / 干预效应
👉 State Space / LSTM / GRU
通常比 Transformer 更稳
2️⃣ 如果你的数据是:
-
长序列
-
多变量
-
跨个体共享模式
-
数据量够大
👉 Hybrid Transformer
(分解 + Attention)开始有优势
3️⃣ 如果你还需要:
-
可解释性
-
不确定性
-
推断而非纯预测
👉 State Space(甚至 Bayesian SSM)
仍然是王者
最后:一个非常“老派但重要”的忠告
你现在这个学习深度,我会给你一句研究者级别的建议:
不要问“哪个模型最好”
要问“我对时间做了什么假设”
模型只是假设的容器。
END.
回顾:
时间序列模型发展历程(第一讲:AR/MA/ARMA)-CSDN博客
时间序列模型发展历程(第二讲:平稳性危机与ARIMA诞生、SARIMA)-CSDN博客
时间序列模型发展历程(第三讲:指数平滑法 / Holt / Holt-Winters)-CSDN博客
时间序列模型发展历程(第四讲:State Space Models)-CSDN博客
更多推荐
所有评论(0)