站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
有效的大语言模型微调是否必须依赖人类可读文本?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXiv:2609.35868v1 公告类型:新 摘要:有效微调大语言模型是否必须依赖人类可读性?我们研究模型条件化的训练表示能否在无需人类可读文本形式的情况下保持或提升适配效用。我们提出 Desired-Update-Aligned Synthetic Data(DASA),利用冻结参考模型的激活梯度反馈来指导连续合成输入嵌入的优化。受激活梯度在局部风险降低中作用的启发,DASA 针对有用的适配更新,而非源文本重建或语言流畅性。所得嵌入直接用于下游微调;离散 token 投影仅用于定性检查。在 Llama 和 Qwen 系列六个模型(1B 至 32B 参数)上的实验覆盖知识、数学推理、代码生成和常识推理六个基准。在匹配的 LoRA 适配设置下,DASA 达到与源自然语言数据相当的性能,并在多种配置中超越它,同时在大多数情况下优于 GRADMM。