LoRA Speedrun의 구성과 핵심 지표

이번에 공개된 'LoRA Speedrun'은 특정 모델과 하드웨어, 과제를 고정한 상태에서 파인튜닝에 소요되는 실제 시간(Wall-clock time)을 측정하는 리더보드다. 모든 실험은 Modal(모달, 클라우드 GPU 플랫폼)의 L40S GPU 샌드박스 환경에서 수행된다. L40S는 RTX 4090과 동일한 AD102 실리콘을 사용하므로 소비자용 GPU 최적화 기법을 그대로 적용할 수 있다.

현재 리더보드는 두 개의 트랙으로 운영된다. 첫 번째 트랙은 Qwen2.5-1.5B 모델을 사용해 GSM8K 벤치마크에서 57% 이상의 정확도를 달성하는 것이 목표다. 현재 최고 기록은 @Saivineeth147이 달성한 6분 5초이며, 시퀀스 패킹(Sequence packing)과 답변 부분에만 손실 함수를 적용하는 완료-전용 손실 마스킹(Completion-only loss masking) 기법을 2에포크(Epoch) 동안 적용해 얻은 결과다.

두 번째 트랙은 SmolLM2 모델을 사용해 SQuAD 데이터셋의 처음 20,000개 예제를 1에포크 동안 학습시키는 구성이다. 해당 트랙의 베이스라인 기록은 11분 8초로, 별도의 최적화 없이 랭크(Rank) 16의 일반 LoRA를 적용하고 전체 시퀀스 손실(Full-sequence loss)을 계산했다. 모든 기록은 동일 하드웨어에서 서로 다른 시드(Seed)로 3회 반복 실행하여 검증된 결과만 인정된다.

측정 메커니즘 및 검증 파이프라인

성능 측정의 핵심 척도는 FLOPs(부동소수점 연산 수)나 학습 스텝 수가 아닌 실제 소요 시간인 '월클락 타임(Wall-clock time)'이다. 이는 커널 최적화, 데이터 로딩 효율, 알고리즘의 실제 처리 속도를 동일한 비용 단위로 비교하기 위함이다. 하드웨어를 L40S로 고정한 이유는 데이터센터 SKU의 일관성을 확보해 호스트마다 성능이 다른 소비자용 렌탈 GPU의 변수를 제거하기 위해서다.

제출된 코드는 다음과 같은 검증 파이프라인을 거친다. 먼저 학습을 진행한 후, 어댑터(Adapter)의 무결성을 감사(Audit)하고, 최종적으로 평가(Eval)를 수행해 3개의 시드에 대한 판정을 내린다. 학습 데이터는 GSM8K의 훈련 분할(Train split)만 사용할 수 있으며, 교사 모델을 이용한 증류(Distillation)나 합성 데이터 생성은 엄격히 금지된다.

모델과 과제를 고정한 이유는 PEFT(Parameter-Efficient Fine-Tuning, 매개변수 효율적 미세조정) 기법들이 서로 다른 모델과 하드웨어에서 보고되어 직접적인 비교가 불가능했던 문제를 해결하기 위해서다. 특정 모델에만 과적합(Overfitting)되는 문제를 방지하기 위해 서로 다른 모델 제품군과 과제 유형을 가진 두 개의 트랙을 운영하며, 두 트랙 모두에서 성능 향상이 증명된 기법만을 범용적인 기술로 간주한다.

개발자 관점의 최적화 변수와 도입 영향

개발자와 실무자는 이번 리더보드를 통해 LoRA/QLoRA 기반 파인튜닝 시 제어 가능한 변수들이 실제 속도에 미치는 영향을 구체적으로 판단할 수 있다. 특히 다음과 같은 기술적 레버(Lever)들이 최적화의 핵심 축으로 제시된다.

첫째, 연산 효율화 도구의 적용이다. `torch.compile`의 활용, Unsloth 커널이나 Liger 커널과 같은 최적화된 커널 도입, 융합 교차 엔트로피(Fused cross-entropy) 적용 등이 실제 지연시간을 얼마나 낮추는지 확인할 수 있다.

둘째, 학습 전략의 변경이다. 1에포크의 공격적인 학습률(Learning Rate) 스케줄링, 가장 어려운 예제만 선별하는 데이터 프루닝(Data pruning), 블록 대각선(Block-diagonal) 또는 가변 길이(Varlen) 패킹 어텐션 적용 등이 선택지다. 또한 LoRA+의 비대칭 학습률 적용이나 NEFTune의 노이즈 추가, 커리큘럼 학습 순서 배치 등이 성능과 속도의 트레이드오프를 결정한다.

셋째, 구조적 설정의 최적화다. LoRA 랭크의 크기와 배치 위치(MLP 전용 vs 어텐션 전용), QLoRA의 NF4와 bf16 간의 정밀도 선택, rsLoRA, DoRA, PiSSA와 같은 초기화 방식의 차이가 실제 벽시계 시간과 정확도에 미치는 영향을 분석해야 한다.

실무적으로는 단순한 벤치마크 수치보다 '단일 GPU에서 특정 성능 도달까지의 시간'이라는 지표가 인프라 비용 산정과 학습 파이프라인 설계에 더 직접적인 근거가 된다. 로컬 환경에서 실험하려는 개발자는 24GB 이상의 VRAM을 가진 카드에서 다음 명령어로 베이스라인을 실행해 빠르게 반복 실험을 진행할 수 있다.

bash
scripts/setup_gpu.sh
python harness/run_submission.py submissions/000-baseline --runs 1