Parameter-Efficient Fine-Tuning (PEFT)

I. 거대 언어 모델의 효율적 도메인 적응, PEFT 개요

구분내용
정의사전학습된 모델의 가중치를 대부분 고정(Freeze)하고, 최소한의 파라미터만 추가·업데이트하여 모델을 미세조정하는 효율적 학습 기법
특징- 저비용 고효율: 소수의 파라미터만 학습하여 연산량 및 GPU 메모리 비용 대폭 절감 - 모듈성: 단일 기본 모델(Base Model)에 태스크별 가중치를 모듈 형태로 탈부착 가능

II. PEFT의 개념도 및 핵심 기술요소

가. PEFT의 개념도 및 동작 원리

입력 데이터 x (텍스트 / 이미지) 사전학습 가중치 (Frozen) Pre-trained Weight (W) d × k 행렬 (고정) PEFT 학습 가중치 (Trainable) PEFT Learned Weight (ΔW) 저차원 어댑터 / 파라미터 갱신 W · x ΔW · x 학습 병합 가산 (합산 출력) h = W·x + ΔW·x (W_final = W + ΔW)
  • 원본 거대 모델의 사전학습 가중치는 완전히 보존(동결)하고, 추가된 가중치 변화량(\Delta W)만을 학습·조절하여 효율적으로 미세조정을 수행함

나. PEFT의 핵심 기술요소

구분기술설명
재매개변수화LoRA (Low-Rank Adaptation)가중치 변화량(\Delta W)을 저순위(Low-Rank) 행렬 분해(A \times B)로 근사 학습
양자화 결합QLoRA기본 모델을 **4-bit NormalFloat (NF4)**로 양자화하여 단일 GPU 메모리 내 학습 지원
추가형 (Additive)Adapter트랜스포머 레이어 사이에 병렬 또는 직렬로 소형 피드포워드 신경망을 삽입하여 학습
Prefix-TuningAttention 키(K)와 밸류(V) 앞에 학습 가능한 가상 토큰 텐서를 추가하여 최적화
Prompt-Tuning입력 임베딩 공간에 학습 가능한 소수의 Soft Prompt 텐서만 추가하여 튜닝
선택형 (Selective)BitFit전체 모델 중 레이어의 편향(Bias) 파라미터만 선택적으로 미세조정
확장형 (Advanced)(IA)^3내부 활성화 함수에 스케일링 벡터를 요소별 곱(Element-wise Multiplication) 연산
AdaLoRA파라미터 중요도에 따라 랭크(Rank) 할당을 동적으로 제어하는 적응형 LoRA 기법
  • 미세조정을 통한 효율적 튜닝 기법을 토대로 목적에 맞는 기법 선택 가능

III. 유사 기술 비교 및 향후 전망

가. PEFT vs Full Fine-Tuning 비교

항목PEFTFull Fine-Tuning
학습 대상소규모 파라미터 조절 (통상 전체의 0.1% ~ 1% 미만)모델 전체 파라미터 (100%)
비용/자원매우 낮음 (단일 컨슈머 GPU 환경에서도 학습 가능)매우 높음 (대규모 분산 GPU 클러스터 인프라 필수)
파국적 망각방지 가능 (사전학습 가중치 보존으로 일반화 성능 유지)발생 위험 높음 (새로운 데이터셋 학습 시 기존 지식 소실)
배포/확장성기본 모델 1개에 경량 어댑터 가중치만 교체 서빙파인튜닝 모델마다 전체 가중치를 개별 저장하여 비효율

나. 향후 전망

  • RAG 시스템 고도화: 검색 기반 정보 제공(RAG)과 도메인 특화 경량 어댑터(PEFT)의 결합을 통해 환각 현상 최소화 및 전문성 극대화
  • On-Device AI 활성화: 모바일 및 임베디드 기기 등 리소스 제약 환경에서 실시간 개인화 로컬 파인튜닝 가속화