RECAP:通过可解码性监督训练可验证的激活解释

研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖”私密代码”而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。

研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖"私密代码"而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。

信息来源:HuggingFace Daily Papers(社区热门论文)

转载请注明出处:https://www.ysthink.site/4387/
(0)
的头像
上一页 2026年7月22日
下一页 2026年7月22日

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验