扫码阅读
手机扫码阅读
如何拯救LoRA初始化?LoRA-GA:性能显著提升+收敛速度更快!

我们非常重视原创文章,为尊重知识产权并避免潜在的版权问题,我们在此提供文章的摘要供您初步了解。如果您想要查阅更为详尽的内容,访问作者的公众号页面获取完整文章。

AI生成未来
扫码关注公众号
亮点直击
- 提出了 LoRA-GA,一种新颖的 LoRA 初始化方法,通过近似低秩矩阵的梯度与全权重矩阵的梯度来加速收敛。
- 确定了在非零初始化下的缩放因子,确保适配器输出的方差不受适配器的秩和输入维度的影响。
- LoRA-GA 在多个数据集上比原版 LoRA 性能有显著提升,同时实现了高达 2-4 倍的收敛速度提升。
方法
介绍了 LoRA-GA,包括两个关键组件:近似全微调的梯度方向和确保初始化过程中的秩和 Scale 稳定性。LoRA-GA 结合梯度近似和 Scale 稳定性,提出了一种新颖的初始化方法,显著加快了 LoRA 的收敛速度并提升了性能。
实验
LoRA-GA 在 T5-Base 模型的 GLUE 数据集子集以及 Llama 2-7B 模型的对话、数学和代码任务上的性能得到了验证。结果显示 LoRA-GA 与完全微调相当,且在某些数据集上性能更优。此外,消融研究证明了 LoRA-GA 中的非零初始化、稳定输出和梯度近似的有效性。
结论
LoRA-GA 作为 LoRA 的新初始化方案,能够在不改变架构或训练算法的情况下,提供高效的收敛加速。实验证明其可以与完全微调相媲美,甚至在某些情况下超越全微调的性能,为未来的研究提供了新的方向。
想要了解更多内容?

AI生成未来
扫码关注公众号
AI生成未来的其他文章
文本到3D肖像最强生成方案!DiffusionGAN3D: 3D GANs和Diffusion先验强强联合!
关注【AI生成未来】公众号,回复“GAI”,免费获取??
寥寥数笔,动画自成!阿里Tora: 首个轨迹引导的DiT创新实现精确运动控制视频生成
点击下方卡片,关注“AI生成未来”>>后台回复“
效果超越ControlNet+IP-Adapter和FreeControl!Ctrl-X:可控文生图新框架(加州大学&英伟达)
点击下方卡片,关注“AI生成未来”>>后台回复“
AI论文润色平台一览,让你的论文更加流畅易懂!
关注【AI生成未来】公众号,回复“GAI”,免费获取??
一言、一格和一念,百度的生成内容生态圈
文心一言、文心一格和百度智能云一念都是百度推出?
加入社区微信群
与行业大咖零距离交流学习


PMO实践白皮书
白皮书上线
白皮书上线