- 论文公开站arXiv
DP-SGD 下权重绑定对纯解码器 LLM 是否仍有益?
Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?
DP-SGD 是大模型隐私保护微调的主流方法。许多纯解码器 LLM 采用输入输出嵌入权重绑定,本文在差分隐私设定下重新审视这一设计是否仍然有利。
- 论文公开站arXiv
面向高斯数据的无间隙差分隐私PCA
Gap-free Differentially Private PCA for Gaussian Data
摘要显示,该论文提出了一种针对高斯数据主成分分析(PCA)问题的无间隙差分隐私算法。原文仅给出简短声明,未披露具体技术细节、误差界或实验验证,因此该算法相对已有方法的改进幅度与适用条件尚不明确。
意义:隐私保护机器学习方向的新算法声明,若成立可改善隐私PCA的精度与可用性,但需关注后续全文细节。
- 论文公开站arXiv
具身强化学习中用于私有轨迹重建的时间梯度反转
Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
摘要显示,分布式具身强化学习虽只在设备端保留原始传感器数据、仅上传策略梯度,但时序结构会放大隐私泄露。作者提出 TRACE,一种摊销式时序梯度反演攻击,利用相邻梯度间的跨时间相关性以及策略头梯度中动作的闭式恢复,自回归重建私有观测-动作轨迹。在留出的具身场景中,TRACE 达到 18.8 dB PSNR,动作恢复近乎完美,每帧重建耗时 3–4.5 毫秒。
意义:表明仅上传策略梯度并不足以保护具身智能体的轨迹隐私,联邦/分布式 RL 需引入序列感知的防御机制。
- 论文公开站arXiv
FedV-KGQA:垂直分区知识图谱上的多跳问答框架
FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs
FedV-KGQA 是一种用于垂直分区知识图谱的多跳问答框架,其中各组织共享实体但拥有不相交的关系集。它结合局部图增强和知识图谱嵌入,确保原始三元组和关系参数不离开各自数据孤岛,建立结构数据边界,无需集中式图访问。引入主题实体锚定机制,在无运行时跨孤岛通信的情况下将问题定位到正确图邻域。在三个基准测试的12种配置中,性能接近集中式,可泛化至3跳推理,并对嵌入扰动具有鲁棒性。
意义:为数据治理和隐私约束下的知识图谱问答提供可行方案,实现多跳推理而无需集中数据,对联邦学习和隐私保护AI有重要价值。
- 论文公开站arXiv
从法规到实施:LLM辅助行业合规的关键评估
From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry
欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。
意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。