全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「性别偏见」共 1 条

  • 论文公开站arXiv

    GPT模型中的危害洗白:性别歧视在安全训练中被转化而非减少

    Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

    摘要显示,研究分析GPT-2至GPT-5共15个模型、45万条性别指向生成内容,发现显性歧视内容在代际迭代中被转化而非移除,作者称之为「危害洗白」。GPT-2中针对女性的性暴力聚类在GPT-4后消失,但男性指向内容获得照护、情感表达等正向表征,女性指向内容则未获得。GPT-5中主题聚类将乳腺癌框定为男性权利议题,三个独立分类器均判其为非毒性;女性指向内容的主题多样性在GPT-4对齐边界相对男性下降36%。

    意义:提示仅靠表面毒性分类器评估安全对齐可能系统性漏检表征危害,开发者需引入主题多样性与表征危害指标。