Tensor Processing Unit v5

영어에서 번역됨

텐서 처리 장치 v5는 신경망 워크로드를 위한 구글의 5세대 맞춤형 AI 가속기 ASIC으로, 대규모 언어 모델 및 기타 딥러닝 작업의 훈련과 추론을 위한 고처리량 저정밀도 연산을 제공합니다.

Tensor Processing Unit v5(TPU v5)는 Google이 머신러닝인공지능 워크로드, 특히 트랜스포머 기반 대규모 언어 모델과 같은 딥러닝 모델을 가속화하기 위해 개발한 맞춤형 주문형 집적 회로(ASIC)이다. Google TPU 제품군의 5세대 제품으로, 전임자들의 아키텍처 원칙을 기반으로 하여 고용량, 저정밀도 연산(예: 8비트 이하)과 와트당 최적화된 입출력 작업을 강조하며, 그래픽 처리 장치(GPU)에서 발견되는 래스터화 또는 텍스처 매핑 하드웨어는 포함하지 않는다. TPU v5는 TensorFlow, JAX, PyTorch와 같은 프레임워크를 지원하도록 설계되었으며, Google 데이터 센터에 배포되고 Google Cloud 서비스를 통해 제공된다. GPU와 비교할 때, v5와 같은 TPU는 트랜스포머 기반 워크플로우의 추론에 자주 사용되는 반면, GPU는 훈련에 자주 사용되지만, TPU도 훈련 작업을 지원한다.

Design and Architecture

TPU v5는 행렬 곱셈을 위한 시스톨릭 배열 아키텍처를 사용하는 Google의 전통을 이어가며, 이 설계는 초기 시스톨릭 시스템인 WARP로 거슬러 올라가고 원래 TPU에 의해 대중화되었다. 이 칩은 저정밀도로 높은 처리량을 제공하도록 설계되어 신경망 연산의 효율적인 실행을 가능하게 한다. 이전 TPU 세대와 유사하게 표준 데이터 센터 랙 슬롯에 맞는 방열판 어셈블리와 함께 패키징된다. v5 세대는 TPU v4에 비해 메모리 대역폭과 연산 밀도가 개선되었을 가능성이 높지만, 구체적인 기술적 세부 사항(예: 다이 크기, 클록 속도, 메모리 용량)은 2025년 현재 공개되지 않았다. Google의 TPU는 독점적이며, Broadcom이 공동 개발자로 참여하여 Google의 아키텍처를 제조 가능한 실리콘으로 변환하며, 제조는 TSMC와 같은 제3자 파운드리를 통해 관리된다.

History and Development

TPU 프로그램은 2013년 Google이 Amir Salek을 영입하여 맞춤형 실리콘 역량을 구축하면서 시작되었다. Salek은 원래 TPU와 TPU v2, v3, v4, Edge TPU를 포함한 후속 세대의 개발을 이끌었다. 첫 번째 TPU는 2016년 5월 Google I/O에서 발표되었으며, 2015년부터 내부적으로 사용되었다. Norman P. Jouppi가 기술 리드 및 수석 아키텍트를 맡았으며, 그의 2017년 논문은 당시 CPU 및 GPU보다 15~30배 높은 성능과 30~80배 높은 와트당 성능을 입증했다. TPU v5는 2021년에 발표된 TPU v4 이후 도입된 최신 버전이다. 2025년 현재, Google Cloud는 TPU 시스템에서 상당한 수익을 창출하고 있으며, v5 세대는 핵심 제품이 될 것으로 예상된다.

Performance and Use Cases

TPU v5는 신경망 모델, 특히 생성형 AI 애플리케이션에 사용되는 대규모 트랜스포머의 훈련과 추론 모두에 최적화되어 있다. LLM 워크플로우에서 TPU는 추론에 자주 사용되고 GPU는 훈련에 사용되지만, TPU v5는 둘 모두에서 뛰어난 성능을 목표로 한다. Google은 Google Photos(칩당 하루 1억 장 이상의 사진 처리), Google Street View 텍스트 추출, 검색 결과용 RankBrain과 같은 서비스에 TPU를 사용해 왔다. TPU v5는 이러한 추세를 이어가 클라우드에서 AI 워크로드의 더 빠르고 효율적인 처리를 가능하게 할 가능성이 높다.

Deployment and Ecosystem

TPU는 Google Cloud의 Cloud TPU 서비스를 통해 제3자에게 제공되며, Kaggle 및 Colaboratory 노트북을 통해서도 제공된다. 2025년 9월, Google은 Crusoe 및 CoreWeave와 같은 "네오클라우드"와 데이터 센터에 TPU를 배포하는 것에 대해 논의 중이었고, 2025년 11월에는 Meta가 AI 데이터 센터에 TPU를 배포하기 위해 Google과 논의 중이었다. 이는 TPU v5가 Google 자체 인프라를 넘어 배포되어 생태계를 확장할 수 있음을 시사한다. TPU의 독점적 특성은 주로 클라우드 서비스를 통한 접근을 의미하지만, 외부 제공업체의 관심 증가는 더 넓은 채택 추세를 나타낸다.

Comparison with Other AI Accelerators

TPU v5는 AWS Trainium, Cerebras의 웨이퍼 스케일 엔진, Groq의 언어 처리 장치, SambaNova의 데이터플로우 프로세서와 같은 다른 AI 가속기와 경쟁한다. NVIDIA의 GPU(목록에 없음)는 훈련에서 여전히 지배적이지만, TPU는 특정 워크로드에 대해 높은 효율성을 제공하는 특화된 대안을 제공한다. TPU와 GPU 간의 선택은 모델 아키텍처에 따라 달라진다. TPU는 CNN과 트랜스포머에 적합하고, GPU는 완전 연결 네트워크에 유리할 수 있으며, CPU는 RNN에 유리할 수 있다. TPU v5의 설계는 대규모 AI 서비스에 대한 수요가 증가함에 따라 AI 인프라에서 Google의 경쟁 우위를 유지하는 것을 목표로 한다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ai-accelerator·google·hardware·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사