7/25日记

i.i.d. 就是:每条数据都像用同一颗骰子重新掷一次。
独立:上一次掷出什么,不影响下一次。
同分布:每次使用的都是同一颗骰子,概率规则不变。
每个 mini-batch 都比较能代表整个数据集;

image.png

假设教师有两个模式:

P(A)=0.5, P(C)=0.5
学生如果只学习模式 (A),完全忽略模式 (C),前向 KL 会给它很大惩罚。

image.png

前向 KL 不会必然产生模式之间的幻觉。如果学生容量足够、优化准确,它的最优解就是完全匹配教师。模式连接通常出现在学生容量有限、两个模型结构差异较大或散度估计不准确时

image.png

需要手推一下两个kl

采样策略最多50/50是好的,全做opd也是好的,但是全sft一定是差的

OPD的三个维度:
优化哪个目标函数?
监督信号来自哪里?
使用什么机制稳定训练动态?
OPD 方法

├─ 目标函数
├─ 信号来源
│ ├─ 外部教师
│ │ ├─ 白盒
│ │ └─ 黑盒
│ └─ 自蒸馏
└─ 训练动态

image.png
image.png
image.png

地图⬆️

前向 KL 或自适应的熵感知散度可以保留输出多样性。(回头研究一下)
多步智能体任务通常需要序列级目标。这些目标还需要能够感知整条轨迹的信用分配机制(Lyu et al., 2025;Zhang et al., 2026o)。(回头研究一下,感觉可以用在lean上)

Token 级可靠性过滤可以缓解错误前缀陷阱(Xu et al., 2026c;Zheng et al., 2026a)

image.png

MiniLLM 和 KETCHUP 等序列级方法通过策略梯度定理得到无偏梯度。

如果特权信号带有系统性偏差,就可以放宽标准蒸馏中的“始终向教师分布下降”假设。

G-OPD(Yang et al., 2026e)、RLAD(Zhang et al., 2026o)和 REOPOLD(Ko et al., 2026)表明,将稠密的教师监督与稀疏的结果奖励结合起来可能十分有效。