扫码阅读
手机扫码阅读
如何拯救LoRA初始化?LoRA-GA:性能显著提升+收敛速度更快!
24 2024-10-25
我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。
文章来源:
AI生成未来
扫码关注公众号
亮点直击
- 提出了 LoRA-GA,一种新颖的 LoRA 初始化方法,通过近似低秩矩阵的梯度与全权重矩阵的梯度来加速收敛。
- 确定了在非零初始化下的缩放因子,确保适配器输出的方差不受适配器的秩和输入维度的影响。
- LoRA-GA 在多个数据集上比原版 LoRA 性能有显著提升,同时实现了高达 2-4 倍的收敛速度提升。
方法
介绍了 LoRA-GA,包括两个关键组件:近似全微调的梯度方向和确保初始化过程中的秩和 Scale 稳定性。LoRA-GA 结合梯度近似和 Scale 稳定性,提出了一种新颖的初始化方法,显著加快了 LoRA 的收敛速度并提升了性能。
实验
LoRA-GA 在 T5-Base 模型的 GLUE 数据集子集以及 Llama 2-7B 模型的对话、数学和代码任务上的性能得到了验证。结果显示 LoRA-GA 与完全微调相当,且在某些数据集上性能更优。此外,消融研究证明了 LoRA-GA 中的非零初始化、稳定输出和梯度近似的有效性。
结论
LoRA-GA 作为 LoRA 的新初始化方案,能够在不改变架构或训练算法的情况下,提供高效的收敛加速。实验证明其可以与完全微调相媲美,甚至在某些情况下超越全微调的性能,为未来的研究提供了新的方向。
想要了解更多内容?
文章来源:
AI生成未来
扫码关注公众号
AI生成未来的其他文章
单图创造虚拟世界只需10秒!斯坦福&MIT联合发布WonderWorld:高质量交互生成
点击下方卡片,关注“AI生成未来”>>后台回复“
9款AI营销创作平台,营销人的开挂利器!
在社交媒体成为日常生活不可或缺的一部分的今天,?
可提示 3D 分割研究里程碑!SAM2Point:SAM2加持泛化任意3D场景、任意提示!
点击下方卡片,关注“AI生成未来”作者:Ziyu Guo等 ?
图像复原的天花板在哪里?SUPIR:开创性结合文本引导先验和模型规模扩大
关注【AI生成未来】公众号,回复“GAI”,免费获取??
速度超快的单图像生成3D目标方案,创新的One-2-3-45++来了!
作者:Minghua Liu等
解读:AIGCer论文链接:https://arxiv.or
加入社区微信群
与行业大咖零距离交流学习
软件研发质量管理体系建设
白皮书上线