- Published on
LoRA에서 rank를 바꾸면 최적 학습률을 다시 찾아야 한다는 통념과, "1/r 스케일링을 쓰면 학습률은 rank와 무관하다"는 통념이 실무에서 동시에 돌아다닙니다. 2026년 2월 arXiv에 올라온 μA(Maximal-Update Adaptation) 논문은 이 둘이 모두 맞다고 말합니다 — 단, 당신이 어떤 α 규약과 어떤 초기화를 쓰느냐에 따라. 이 글은 μA가 유도한 두 레짐(η가 rank의 -1/2제곱에 비례하는 경우 vs rank와 무관한 경우), 그리고 LoRA에서 풀 파인튜닝으로 학습률을 그대로 옮길 수 있다고 주장하는 특정 설정(Init[B] + α=1)을 정리합니다. 동시에 그 근거의 한계도 정직하게 적습니다 — 시드는 42 하나뿐이고, 학습률 격자는 2배 간격이며, 저자들 스스로 "필요조건일 뿐 충분조건은 아니다"라고 못 박습니다. 유명한 "LoRA 학습률 = FFT의 10배" 규칙은 이 논문에서도 여전히 설명되지 않은 채 남습니다.