영어에서 번역됨

TPU v1은 신경망 추론을 위한 맞춤형 ASIC인 Google의 1세대 텐서 처리 장치입니다. 2016년에 발표되었으며, 머신러닝 워크로드에서 당시 CPU 및 GPU보다 15~30배 높은 성능과 30~80배 더 나은 성능 대비 전력 효율을 제공합니다.

TPU v1은 신경망 추론을 가속화하기 위해 Google이 개발한 주문형 집적 회로(ASIC)인 1세대 텐서 처리 장치(Tensor Processing Unit)이다. 2015년에 내부적으로 도입되었고 2016년 5월 Google I/O에서 공개적으로 발표되었으며, TensorFlow 프레임워크를 위해 특별히 설계되었다. 이 칩은 고용량, 저정밀 연산에 최적화된 시스톨릭 어레이 행렬 곱셈 엔진으로, 주로 8비트 정수를 사용하며, 검색, 스트리트 뷰, 포토와 같은 서비스를 지원하기 위해 Google의 데이터 센터 전반에 배포되었다.

범용 프로세서와 달리 TPU v1은 신경망의 특정 연산 패턴을 대규모로 처리하도록 설계되었다. WARP와 같은 초기 시스톨릭 어레이 시스템과 계보를 공유하는 이 아키텍처는 Google에서 경쟁한 세 가지 AI 가속기 설계 중에서 선택되었다. 개발은 Norman P. Jouppi가 기술 리드이자 수석 아키텍트로 이끌었으며, Amir Salek이 2013년에 Google의 맞춤형 실리콘 그룹을 설립했다. 이 칩은 설계에서 양산까지 단 15개월 만에 완성되었는데, 이는 맞춤형 ASIC으로서는 빠른 일정이다.

아키텍처 및 사양

TPU v1은 PCIe 3.0 버스를 통해 호스트 프로세서의 복합 명령어 집합 컴퓨터(CISC) 명령으로 구동되는 8비트 행렬 곱셈 엔진이다. 28nm 공정으로 제조되었으며 다이 크기는 331mm²를 넘지 않는다. 이 칩은 700MHz의 클록 속도로 작동하며 열 설계 전력이 28-40W로, 의도된 작업 부하에 대해 에너지 효율이 매우 높다.

주요 구성 요소로는 28MiB의 온칩 메모리와 256×256 시스톨릭 어레이의 8비트 곱셈기에서 결과를 수집하는 4MiB의 32비트 누산기가 있다. 패키지에는 8GiB의 듀얼 채널 2133MHz DDR3 SDRAM이 포함되어 34GB/s의 메모리 대역폭을 제공한다. 명령은 호스트와의 데이터 전송을 처리하고, 행렬 곱셈 또는 합성곱을 수행하며, 활성화 함수를 적용하여 추론에 필요한 핵심 연산을 모두 다룬다.

성능 및 배포

2017년 44회 국제 컴퓨터 아키텍처 심포지엄(ISCA 2017)에서 발표된 획기적인 논문 "In-Datacenter Performance Analysis of a Tensor Processing Unit"에서 Jouppi와 동료들은 TPU v1이 당시 CPU와 GPU보다 15-30배 높은 성능과 30-80배 높은 성능 대비 전력 효율을 달성했음을 입증했다. 이로써 이 칩은 대규모 신경망 추론의 기반 플랫폼으로 자리 잡았다.

Google은 생산 서비스 전반에 TPU를 배포했다. Google 스트리트 뷰 텍스트 처리의 경우, 이 칩은 데이터베이스의 모든 텍스트를 5일 미만 만에 찾아냈다. Google 포토에서는 단일 TPU가 하루에 1억 장 이상의 사진을 처리할 수 있었다. 이 칩은 또한 Google이 검색 결과를 개선하는 데 사용하는 RankBrain을 지원했으며, AlphaGo 대 이세돌 바둑 대국과 AlphaZero 시스템에도 사용되었다.

GPU 및 CPU와의 비교

TPU는 레스터화나 텍스처 매핑을 위한 하드웨어 없이 줄당 더 많은 입출력 연산을 제공하는 고용량, 저정밀 연산에 설계되었다. 이는 많은 추론 작업을 지배하는 합성곱 신경망(CNN)에 매우 적합하다. 반면, GPU는 일부 완전 연결 신경망에 이점이 있고, CPU는 순환 신경망(RNN)에 이점이 있을 수 있다.

서로 다른 프로세서 유형은 서로 다른 머신 러닝 모델에 적합하다. 대규모 언어 모델에 사용되는 트랜스포머 기반 신경망의 경우, TPU는 종종 추론에 사용되고 GPU는 훈련에 사용된다. TPU ASIC은 데이터 센터 랙의 하드 드라이브 슬롯에 맞출 수 있는 방열판 어셈블리에 장착되어 밀집 배포를 용이하게 한다.

유산 및 영향

TPU v1의 성공은 훈련을 위한 bfloat16 부동 소수점 지원을 도입한 TPU v2를 포함한 후속 세대와 이후 버전의 길을 열었다. Broadcom은 공동 개발자로서 Google의 아키텍처를 양산 가능한 실리콘으로 변환하고 TSMC와 같은 파운드리를 통해 제조를 관리하는 역할을 했다. 이 칩의 설계는 더 넓은 AI 가속기 환경에 영향을 미쳤으며, 다른 공급업체들이 임베디드 및 로봇 시장을 위한 유사한 제품을 개발하게 했다.

Google은 2018년 Google Cloud Platform의 Cloud TPU 서비스와 Kaggle 및 Colaboratory와 같은 노트북 기반 서비스를 통해 TPU를 제3자에게 제공했다. TPU v1은 인공 지능 하드웨어의 이정표로 남아 있으며, 머신 러닝 작업 부하를 위한 도메인 특화 프로세서의 가치를 입증했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:hardware·google·ai-accelerator·tensor-processing-unit
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사