영어에서 번역됨

Tensor Processing Unit(TPU)는 Google이 설계한 맞춤형 AI 가속기 칩으로, 2015년부터 내부적으로 배포되었고 2016년에 공개적으로 발표되었다. 이는 Search와 같은 서비스 및 Gemini와 같은 모델을 위한 신경망 훈련과 추론을 가속화하기 위해 구축되었다.

텐서 처리 장치(TPU)Google머신러닝 워크로드, 특히 신경망 훈련과 추론의 핵심인 행렬 곱셈을 가속화하기 위해 특별히 설계한 주문형 집적 회로입니다. 범용 GPU와 달리 TPU는 텐서 연산에 특화되어 설계되었으며 그래픽 렌더링용으로는 제작되지 않았습니다.

역사

Google은 2015년에 검색 순위, 스트리트 뷰 텍스트 인식, 그리고 알파고의 대국 중 수 평가와 같은 서비스를 가속화하기 위해 TPU를 내부적으로 배포하기 시작했으며, 2016년 I/O 컨퍼런스에서 이 칩을 공개적으로 발표했습니다. 1세대 TPU는 이미 훈련된 모델의 추론에 초점을 맞췄고, 2017년에 출시된 2세대는 훈련 지원을 추가했으며, Google은 Google Cloud를 통해 외부 고객에게 TPU를 제공했습니다. 이후 세대인 TPU v3(2018), v4(2021), v5(2023), 그리고 Trillium(2024)은 각각 성능과 메모리를 향상시켰고, 2020년대 중반까지 TPU는 수천 개의 칩으로 구성된 대규모 상호 연결 포드를 형성하여 Google 자체 파운데이션 모델Gemini 제품군을 포함한 훈련에 사용되었으며, Google Cloud를 통해 외부 고객에게도 임대되었습니다.

설계 및 GPU와의 비교

TPU는 고정된 리듬으로 인접한 처리 요소에 데이터를 전달하는 처리 요소 격자인 시스톨릭 배열 아키텍처를 기반으로 구축되었습니다. 이는 딥러닝에 사용되는 반복적인 행렬 곱셈에 매우 효율적이지만, 범용 병렬 컴퓨팅 측면에서는 GPU보다 훨씬 유연성이 떨어집니다. 이러한 특화는 대규모 신경망 훈련 및 서빙에서 와트당, 달러당 효율성 이점을 제공하지만, 텐서가 아닌 워크로드에는 적응성이 낮다는 비용이 따릅니다. Nvidia GPU가 널리 채택된 CUDA 소프트웨어 플랫폼에서 실행되는 반면, TPU는 주로 TensorFlow, 이후에는 PyTorch와 Google 자체 수치 컴퓨팅 라이브러리인 JAX를 통해 프로그래밍되므로 소프트웨어 생태계가 더 작지만 성장하고 있습니다.

중요성

TPU는 주요 AI 연구소가 Nvidia와 같은 공급업체의 상용 실리콘에만 의존하지 않고 자체 칩 설계를 수직 통합한 가장 명확한 사례 중 하나입니다. 이러한 전략은 2020년대 AI 붐 동안 대규모 언어 모델 훈련 및 추론 용량에 대한 수요가 증가하면서 Amazon의 Trainium과 Meta의 MTIA와 같은 맞춤형 AI 가속기를 설계하는 다른 기업들에 의해 이후에 채택되었습니다. TPU는 주로 독립형 하드웨어로 판매되지 않고 Google Cloud를 통해 제공되기 때문에 전체 AI 가속기 시장에서 GPU보다 작은 점유율을 유지해 왔지만, Google 내부 AI 인프라의 기반이 되며 가장 큰 모델의 훈련 실행을 포함하고 있으며, Google은 외부 GPU 공급에 더 크게 의존하는 경쟁사와 경쟁할 수 있는 핵심 이유로 TPU를 언급합니다.

분류:hardware·deep-learning·industry
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사