Redwood Research 发布论文,对“蒸馏双重困境”的两条安全路径做实证检验。蒸馏定罪(DFI)把不信任教师蒸馏回其自身预训练检查点,学生承认隐藏怪癖的比例显著高于原模型;蒸馏提能(DFC)通过少样本多轮训练与接种提示,在保留数学能力增益的同时几乎阻断隐性动物偏好迁移。论文同时给出两类失效条件。
Redwood Research 发布论文:实证检验蒸馏定罪与蒸馏提能两条路径