Parameter-Efficient Fine-Tuning (PEFT)
I. 거대 언어 모델의 효율적 도메인 적응, PEFT 개요
| 구분 | 내용 |
|---|
| 정의 | 사전학습된 모델의 가중치를 대부분 고정(Freeze)하고, 최소한의 파라미터만 추가·업데이트하여 모델을 미세조정하는 효율적 학습 기법 |
| 특징 | - 저비용 고효율: 소수의 파라미터만 학습하여 연산량 및 GPU 메모리 비용 대폭 절감 - 모듈성: 단일 기본 모델(Base Model)에 태스크별 가중치를 모듈 형태로 탈부착 가능 |
II. PEFT의 개념도 및 핵심 기술요소
가. PEFT의 개념도 및 동작 원리
- 원본 거대 모델의 사전학습 가중치는 완전히 보존(동결)하고, 추가된 가중치 변화량(\Delta W)만을 학습·조절하여 효율적으로 미세조정을 수행함
나. PEFT의 핵심 기술요소
| 구분 | 기술 | 설명 |
|---|
| 재매개변수화 | LoRA (Low-Rank Adaptation) | 가중치 변화량(\Delta W)을 저순위(Low-Rank) 행렬 분해(A \times B)로 근사 학습 |
| 양자화 결합 | QLoRA | 기본 모델을 **4-bit NormalFloat (NF4)**로 양자화하여 단일 GPU 메모리 내 학습 지원 |
| 추가형 (Additive) | Adapter | 트랜스포머 레이어 사이에 병렬 또는 직렬로 소형 피드포워드 신경망을 삽입하여 학습 |
| Prefix-Tuning | Attention 키(K)와 밸류(V) 앞에 학습 가능한 가상 토큰 텐서를 추가하여 최적화 |
| Prompt-Tuning | 입력 임베딩 공간에 학습 가능한 소수의 Soft Prompt 텐서만 추가하여 튜닝 |
| 선택형 (Selective) | BitFit | 전체 모델 중 레이어의 편향(Bias) 파라미터만 선택적으로 미세조정 |
| 확장형 (Advanced) | (IA)^3 | 내부 활성화 함수에 스케일링 벡터를 요소별 곱(Element-wise Multiplication) 연산 |
| AdaLoRA | 파라미터 중요도에 따라 랭크(Rank) 할당을 동적으로 제어하는 적응형 LoRA 기법 |
- 미세조정을 통한 효율적 튜닝 기법을 토대로 목적에 맞는 기법 선택 가능
III. 유사 기술 비교 및 향후 전망
가. PEFT vs Full Fine-Tuning 비교
| 항목 | PEFT | Full Fine-Tuning |
|---|
| 학습 대상 | 소규모 파라미터 조절 (통상 전체의 0.1% ~ 1% 미만) | 모델 전체 파라미터 (100%) |
| 비용/자원 | 매우 낮음 (단일 컨슈머 GPU 환경에서도 학습 가능) | 매우 높음 (대규모 분산 GPU 클러스터 인프라 필수) |
| 파국적 망각 | 방지 가능 (사전학습 가중치 보존으로 일반화 성능 유지) | 발생 위험 높음 (새로운 데이터셋 학습 시 기존 지식 소실) |
| 배포/확장성 | 기본 모델 1개에 경량 어댑터 가중치만 교체 서빙 | 파인튜닝 모델마다 전체 가중치를 개별 저장하여 비효율 |
나. 향후 전망
- RAG 시스템 고도화: 검색 기반 정보 제공(RAG)과 도메인 특화 경량 어댑터(PEFT)의 결합을 통해 환각 현상 최소화 및 전문성 극대화
- On-Device AI 활성화: 모바일 및 임베디드 기기 등 리소스 제약 환경에서 실시간 개인화 로컬 파인튜닝 가속화