영어에서 번역됨

전이 학습은 하나의 작업이나 데이터셋에서 모델을 훈련하는 동안 얻은 지식을 다른 관련 작업의 모델을 위한 시작점으로 재사용하는 머신 러닝 접근 방식입니다.

전이 학습은 무작위로 초기화된 가중치에서 새 모델을 훈련하는 대신, 한 과제에서 학습한 모델 또는 그 모델이 학습한 표현을 다른 관련 과제의 시작점으로 재사용하는 관행이다. 이는 한 도메인 내의 많은 과제들 - 예를 들어 이미지에서 가장자리와 모양을 인식하거나 텍스트에서 문법과 단어 관계를 이해하는 것 - 이 공통된 기본 구조를 공유한다는 관찰에 기반하며, 이미 그 구조를 학습한 모델은 더 세분화되기 위해 비교적 적은 추가 데이터만 필요하다.

역사와 동기

전이 학습은 1990년대의 "학습을 배우기"를 탐구한 인지 과학 및 초기 기계 학습 연구에 뿌리를 두고 있지만, 2012년 100만 개의 레이블된 이미지로 훈련된 ImageNet 순간 이후 지배적인 실용적 패러다임이 되었다. 그때 AlexNet합성곱 신경망이 시각적 특징, 가장자리, 질감, 물체 부분을 학습하며, 이는 완전히 다른 이미지 분류 문제에도 소량의 과제 특정 데이터와 재훈련만으로 놀라울 만큼 잘 전이된다는 것을 보여주었다. 이로 인해 전이 학습은 수년간 컴퓨터 비전 분야의 기본 전략이 되었다. 즉, 실무자들은 처음부터 훈련하는 대신 ImageNet 사전 훈련된 네트워크를 가져와 적응시키곤 했다.

자연어 처리에서는 제레미 하워드와 세바스찬 루더의 ULMFiT 접근 방식과 같은 작업, 그리고 결정적으로 2018년 BERT에 의해 촉발된 유사한 변화가 나중에 도래하여, 일반적인 언어 모델링 목표로 사전 훈련된 단일 모델이 널리 다양한 NLP 과제에서 최첨단 성능으로 미세 조정될 수 있다는 것을 보여주었다. 이것은 현대 대규모 언어 모델을 여전히 밑받침하는 "사전 훈련 후 전이" 표준 절차를 확립했다.

사전 훈련과 미세 조정과의 관계

전이 학습은 일반적인 원리이며, 사전 훈련미세 조정은 오늘날 심층 학습에서 일반적으로 그 원리를 수행하는 구체적인 메커니즘이다. 모델은 대규모 일반 데이터 세트에서 사전 훈련되며, 종종 자기 지도 학습을 사용하여 수동 레이블을 요구하지 않으며, 이 사전 훈련된 모델은 대상 과제의 더 작은 레이블 데이터 세트로 미세 조정된다. 전이 학습의 성공은 소스와 대상 과제 또는 도메인이 얼마나 관련되었는지에 달려 있다: 자연 이미지에서 의료 X-선으로 전이하는 것은 두 자연 이미지 과제 간 전이와 같 놓을 수 없으며, 그 이유는 데이터의 저수준 통계 구조가 더 많이 다르기 때문이다.

기술

사전 훈련된 모델을 얼마나 적응하는 데 여러 전략이 존재한다. 특징 추출은 사전 훈련된 네트워크를 완전히 동결하고 그 출력 위에 새 최종층만 훈련하며, 대상 데이터 세트가 매우 작을 때 유용하다. 전체 미세 조정은 모든 매개변수를 업데이트하고 충분한 대상 도메인의 데이터가 있을 때 일반적으로 최상의 성능을 얻는다. LoRA와 같은 매개변수 효율적 방법은 이 극단 사이에 있으며, 매개변수 추가를 소량 적응하면서 사전 훈련된 매개변수 또는 수십억 개의 매개변수로 성장함에 따라 특히 중요해진 대부분 수정하지 않는 접근이다.

중요성

전이 학습은 심층 학습을 소수의 자원이 풍부한 실험실 외에도 실용적으로 만드는 주요 이유이다: 초기부터 대형 모델을 훈련할 예산이 없는 연구 팀이나 기업도 기존 사전 훈련된 모델을 적응하여 능력 있는 특화 시스템을 구축할 수 있다. 이는 또한 기반 모델 방향의 넓은 변화를 뒷받침하며, 여기서 단일 대규모 사전 훈련 모델은 각 애플리코리가 데이터 지를 요구하는 대신 여러 수행 애플리케이션의 공유 밑바탕 역할을 한다. 이 기술의 핵심 한계 - 종종 부정 전이 - 는 사전 훈련 데이터와 과도하게 다른 도메인에 모델을 적응시키면 처음부터 훈련보다 성능이 떨어질 수 있으며, 잘 결합된 베이스 모델 선택이 실용적 협신이 된다.

분류:machine-learning·deep-learning·model-training
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사