Edge AI란 인공지능 워크로드, 대부분 모델 추론을 스마트폰, 카메라, 자동차, 임베디드 센서와 같은 로컬 기기에서 직접 실행하는 것을 의미하며, 데이터를 원격 클라우드 데이터 센터로 보내 처리하는 방식과 대조된다. 이는 기기가 입력을 대규모 모델을 실행하는 서버로 보내고 네트워크를 통해 결과를 돌려받는 클라우드 AI와 대비된다.
동기
Edge AI는 클라우드 추론이 잘 해결하지 못하는 여러 실용적 제약으로 인해 추진된다. 자율주행 자동차의 카메라 기반 객체 감지나 실시간 음성 처리와 같은 지연 시간에 민감한 애플리케이션은 네트워크 호출의 왕복 지연을 견딜 수 없다. 오프라인 작동은 안정적인 연결이 없는 기기에 중요하다. 개인정보 보호는 주요 동인이다. 사진, 음성, 건강 신호와 같은 데이터를 로컬에서 처리하면 원시 개인 데이터가 기기를 떠날 필요가 없으며, 이는 휴대폰 제조사들이 점점 더 마케팅하는 속성이다. 비용과 대역폭도 엣지를 선호하는 이유인데, 모든 추론에 대해 연속적인 센서 데이터를 클라우드로 스트리밍하는 것은 규모가 커질수록 비용이 많이 들기 때문이다. 그 대가는 성능이다. 엣지 기기는 데이터 센터의 GPU 클러스터보다 훨씬 적은 연산 능력과 메모리를 가지므로, Edge AI는 작은 메모리와 전력 공간에 유능한 모델을 맞추기 위해 양자화, 모델 증류 및 기타 크기 축소 기법에 크게 의존한다.
하드웨어 및 기법
Edge AI는 특수한 저전력 칩에서 실행된다. 현대 스마트폰 시스템온칩에 내장된 신경 처리 장치, 데이터 센터 TPU의 소형 버전인 Google의 Edge TPU와 같은 전용 추론 가속기, 그리고 점점 더 강력해지는 임베디드 GPU가 그 예이다. 엣지에 배포되는 모델은 일반적으로 더 큰 모델의 압축 버전이다. 16비트 또는 32비트 대신 8비트 또는 4비트 가중치와 같은 더 낮은 수치 정밀도로 양자화되거나, 불필요한 매개변수를 제거하기 위해 가지치기되거나, 더 큰 기반 모델에서 더 작은 학생 네트워크로의 지식 증류를 통해 생성된다. TensorFlow 위에 구축된 TensorFlow Lite 및 Core ML과 같은 프레임워크는 전체 크기 모델에서 엣지 최적화 모델로의 배포 경로를 지원한다.
애플리케이션 및 전망
일반적인 Edge AI 애플리케이션에는 클라우드를 호출하기 전에 웨이크 워드를 로컬에서 처리하는 기기 내 음성 비서, 스마트폰의 컴퓨터 사진 및 얼굴 잠금 해제, 산업 장비의 예측 유지보수 센서, 그리고 네트워크 연결에 의존할 수 없는 로보틱스 및 자율주행 자동차의 인식 시스템이 포함된다. 2020년대 중반 기준으로, 공격적인 양자화와 증류로 실용화된 수십억 개의 매개변수를 가진 유능한 소형 언어 모델은 Edge AI를 좁은 인식 작업을 넘어 일반 목적의 채팅 및 추론 모델을 휴대폰과 노트북에서 직접 실행하는 방향으로 확장했으며, 이는 일부에서 클라우드 호스팅 프론티어 모델에 대한 개인정보 보호 및 비용 중심의 대응책으로 프레임되는 기기 내 생성형 AI를 향한 더 넓은 산업적 추진의 일부이다.