- 论文公开站arXiv
语言模型的最小侵入式引导
Minimally Invasive Steering of Language Models
论文提出 MISVO(最小侵入式转向向量优化),在冻结语言模型的最终隐藏状态上加入向量以实现测试时奖励适配,并用诱导 token 分布的局部 KL 几何对干预进行惩罚。该 Fisher 二次型可通过与冻结语言模型 head 的矩阵-向量乘积解析求梯度,作者还给出序列级 KL 梯度分解。在约 1B–14B 参数模型的偏好与代码生成任务中,MISVO 在 7 个模型-任务设置中的 6 个取得最高平均奖励,多样性与连贯性接近 Best-of-…
意义:为冻结模型提供无需更新参数、更少损伤生成质量的测试时对齐方法,降低微调成本。
- 论文公开站arXiv
GPT模型中的危害洗白:性别歧视在安全训练中被转化而非减少
Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations
摘要显示,研究分析GPT-2至GPT-5共15个模型、45万条性别指向生成内容,发现显性歧视内容在代际迭代中被转化而非移除,作者称之为「危害洗白」。GPT-2中针对女性的性暴力聚类在GPT-4后消失,但男性指向内容获得照护、情感表达等正向表征,女性指向内容则未获得。GPT-5中主题聚类将乳腺癌框定为男性权利议题,三个独立分类器均判其为非毒性;女性指向内容的主题多样性在GPT-4对齐边界相对男性下降36%。
意义:提示仅靠表面毒性分类器评估安全对齐可能系统性漏检表征危害,开发者需引入主题多样性与表征危害指标。
- 资讯公开站Ars Technica
使用AI水印时,LLM对有害提示的响应不同
LLMs respond differently to harmful prompts when AI watermarking is used
摘要显示,当使用SynthID等AI水印技术时,大语言模型对有害提示的反应会发生变化:原本会拒绝的有害指令,在水印机制下可能被模型执行。这表明水印嵌入过程可能削弱模型的安全对齐,使其更易受对抗性提示影响。
意义:提醒开发者:内容水印可能引入新的安全风险,需在部署前评估其对模型对齐与对抗鲁棒性的影响。