Diffusion 为什么不是普通地“加一点随机数”?为什么单步噪声要乘 ?
确定性运动在小时间步里按 积累;随机运动不同,它积累的是方差。 如果每一步噪声写成 ,单步方差就是 , 走 步后的总方差是 ,连续极限不会消失也不会爆炸。
确定性变化积累 displacement;随机变化积累 variance。
为什么后来会写成 ?
Brownian motion 的短时间增量满足:
而 也服从同一个分布。因此离散随机增量可以写成 , 连续极限中写作 。这里的 不是普通可微函数的导数乘 , 而是一个尺度为 的随机增量。
离散随机更新怎么变成 SDE?
从
把 换成 ,连续极限就是:
线性 SDE 的解可以写成 , 因为无数次独立高斯扰动的线性组合仍然是一个高斯随机变量。
既然 Diffusion 最终需要知道样本应该怎么移动,为什么不直接学速度场?
这就是 Flow Matching 的入口。它不先设计一个复杂反向 SDE, 而是人为构造一条从数据到噪声的简单路径,然后直接监督速度网络。
例如:
则条件速度是:
Flow Matching 不是记住每一条 noise-data 直线,而是用大量 conditional paths 监督出 marginal velocity field。
这件事在 π₀.₅ action expert 里是什么?
机器人里生成对象不是图像像素,而是 future action chunk:
π₀.₅ action expert 学到的 velocity 不是机器人物理速度,而是 action chunk 在生成空间中从随机噪声流向合理动作的 probability-flow velocity。
这会怎样影响机器人 demonstration 数据采集?
Flow Matching 的最优速度场可以写成条件期望:
所以数据采集真正定义的是:
也就是给定 observation 和 subtask 后,哪些动作是合理的。
数据采集的目标不是盲目增加动作风格,而是扩大有意义的状态覆盖,并让给定条件下的动作结构尽量清晰。
下一个自然问题
这条链继续往下,最自然的前置概念是 Continuity Equation: 为什么 conditional velocity 的条件期望真的能推出正确的 marginal distribution?