Wormhole (Tenstorrent)

영어에서 번역됨

Wormhole는 Tenstorrent가 개발한 AI 가속기 카드 시리즈로, 고성능 딥러닝 및 대규모 언어 모델 추론과 훈련 작업을 위해 설계되었습니다.

Wormhole는 Tenstorrent가 제조하는 AI 가속기 카드 제품군으로, 팹리스 반도체 회사이다. 이 카드들은 인공지능머신러닝 워크로드, 특히 딥러닝 모델과 같은 대규모 언어 모델트랜스포머 기반 아키텍처를 가속화하도록 설계되었다. Wormhole 시리즈는 추론과 학습 작업을 모두 대상으로 하며, 더 큰 배포를 위해 연결할 수 있는 확장 가능한 아키텍처를 제공한다. Tenstorrent는 Wormhole을 GPU의 유연한 대안으로 포지셔닝하며, 프로그래밍 가능성과 데이터플로우 기반 연산에 중점을 둔다.

1세대인 Wormhole은 2020년에 발표되었고 2021년에 출하되기 시작했다. 그 뒤를 이어 2023년에는 단일 카드 구성인 Wormhole n150과 듀얼 카드 구성인 Wormhole n300이 출시되었다. 이 후속 카드들은 6nm 공정으로 제작되었으며 RISC-V 기반 제어 프로세서를 탑재했다. 이 아키텍처는 희소 및 밀집 텐서 연산을 효율적으로 처리하도록 설계되었으며, 기존 GPU 설계에서 흔한 메모리 병목 현상을 줄이는 데 중점을 둔다.

아키텍처 및 설계

Wormhole 가속기는 Tensix 코어 그리드를 중심으로 구축되었으며, 각 코어에는 RISC-V CPU, 행렬 곱셈 유닛, 벡터 엔진이 포함되어 있다. 이러한 이기종 설계는 다양한 신경망 연산을 유연하게 실행할 수 있게 한다. 코어들은 고대역폭, 저지연 메시 네트워크를 통해 상호 연결되어 여러 칩 간 효율적인 데이터 공유와 확장을 가능하게 한다. GPU가 SIMT(단일 명령, 다중 스레드) 모델에 의존하는 반면, Wormhole은 데이터플로우 아키텍처를 사용하여 특정 워크로드, 특히 불규칙한 메모리 액세스 패턴이 있는 작업에서 더 효율적일 수 있다.

각 Tensix 코어에는 전용 메모리가 포함되어 있어 잦은 칩 외부 메모리 액세스의 필요성을 줄인다. n150 카드는 72개의 Tensix 코어를 갖추고 있으며, n300은 두 개의 다이에 걸쳐 144개의 코어를 제공한다. 이 카드들은 FP32, FP16, BF16, INT8을 포함한 다양한 데이터 유형을 지원하여 학습 및 추론에서 정밀도 유연성을 제공한다. 또한 이 아키텍처에는 전용 이더넷 인터페이스가 포함되어 있어 카드 간 직접 메모리 액세스를 지원하는 프로토콜을 통해 다중 카드 시스템으로 확장할 수 있다.

성능 및 사양

Wormhole n150은 FP16 연산에서 최대 100테라플롭스, INT8 연산에서 200테라옵스를 제공하며, 16GB의 GDDR6 메모리와 256GB/s의 대역폭을 갖추고 있다. n300은 이러한 수치를 두 배로 늘려 FP16 200테라플롭스, INT8 400테라옵스, 32GB 메모리를 제공한다. 전력 소비는 n150의 경우 150W, n300의 경우 300W로 평가되어 일부 경쟁 가속기보다 상대적으로 전력 효율적이다. 이 카드들은 호스트 연결을 위해 PCIe Gen 4 x16 인터페이스를 사용하며, 이더넷을 통해 상호 연결되어 다중 카드 구성을 지원한다.

벤치마크 테스트에서 Wormhole은 특히 트랜스포머 기반 모델의 신경망 추론 작업에서 경쟁력 있는 성능을 보여주었다. Tenstorrent는 여러 n150 카드를 추가할 때 선형 확장 성능을 보여주는 결과를 발표했으며, 이는 대규모 배포의 핵심 기능이다. 이 카드들은 또한 모델 병렬 처리와 데이터 병렬 처리를 지원하여 여러 가속기에서 대규모 모델의 효율적인 학습을 가능하게 한다.

소프트웨어 스택

Tenstorrent는 Wormhole을 위한 포괄적인 소프트웨어 스택을 제공하며, 저수준 드라이버, 런타임 라이브러리, 고수준 프레임워크를 포함한다. 기본 프로그래밍 모델은 C++ API를 기반으로 하지만, 인기 있는 머신러닝 프레임워크도 지원한다. 회사는 PyTorch 및 ONNX와 같은 프레임워크의 모델을 Tensix 코어용 최적화 코드로 변환하는 맞춤형 컴파일러를 개발했다. 이 컴파일러는 연산자 융합 및 메모리 계획을 포함한 그래프 수준 최적화를 수행하여 성능을 극대화한다.

GPU 프로그래밍에 익숙한 사용자를 위해 Tenstorrent는 저수준 세부 사항 중 일부를 추상화하는 프로그래밍 모델을 제공하면서도 고급 사용자가 맞춤형 커널을 작성할 수 있도록 허용한다. 소프트웨어 스택에는 개발을 지원하는 디버거 및 프로파일링 도구도 포함되어 있다. 또한 Tenstorrent는 멀티헤드 어텐션잔차 블록과 같은 일반적인 신경망 계층을 위한 사전 최적화된 연산자 라이브러리를 제공하여 모델에서 직접 사용할 수 있다.

생태계 및 통합

Wormhole 카드는 워크스테이션과 서버용 독립형 PCIe 카드로 제공되며, 사전 구성된 시스템에서도 사용할 수 있다. Tenstorrent는 시스템 통합업체와 파트너십을 맺어 AI 연구 및 생산을 위한 턴키 솔루션을 제공한다. 또한 클라우드 서비스 제공업체를 통해 카드를 이용할 수 있어 사용자가 임대 방식으로 액세스할 수 있다. Tenstorrent는 예제와 튜토리얼을 포함한 소프트웨어 개발 키트(SDK)를 개발하여 새로운 사용자의 학습 곡선을 줄이는 데 중점을 두고 있다.

회사는 또한 개발자 생태계를 조성하기 위해 커뮤니티 포럼과 문서 포털을 만들었다. Wormhole은 모듈식 컴퓨팅 시스템 사양인 오픈-패널 표준을 지원하여 이기종 데이터 센터 환경으로의 통합을 가능하게 한다. 이를 통해 Wormhole 카드를 AMD 또는 Intel의 가속기와 같은 다른 가속기와 단일 시스템에서 결합할 수 있다.

사용 사례 및 응용 분야

Wormhole은 주로 AI 연구 및 개발, 특히 대규모 언어 모델의 학습과 배포를 대상으로 한다. 높은 메모리 대역폭과 효율적인 데이터플로우 아키텍처는 자연어 처리에 널리 사용되는 트랜스포머 기반 모델에 적합하다. 또한 U-Net잔차 네트워크와 같은 아키텍처를 활용하는 이미지 분류 및 객체 감지와 같은 컴퓨터 비전 작업에도 사용된다.

전통적인 AI 워크로드 외에도 Wormhole은 시뮬레이션 및 데이터 분석과 같은 과학 컴퓨팅 응용 분야에서도 탐구되고 있다. 프로그래밍 가능성 덕분에 연구자들은 표준 신경망 연산을 넘어 맞춤형 알고리즘을 구현할 수 있다. Tenstorrent는 또한 전력 효율성이 중요한 엣지 컴퓨팅 시나리오에서의 사용을 강조했다.

경쟁사와의 비교

Wormhole은 Groq, SambaNova, Graphcore와 같은 회사의 AI 가속기와 NVIDIAAMD의 GPU를 포함한 경쟁 제품과 경쟁한다. GPU와 비교할 때 Wormhole은 다른 프로그래밍 모델을 제공하며 특정 워크로드에서 잠재적으로 더 나은 효율성을 제공하지만, 소프트웨어 생태계는 더 작다. 다른 AI 전용 칩과 비교할 때 Wormhole의 주요 차별점은 많은 수의 코어를 갖춘 데이터플로우 아키텍처에 초점을 맞춘 것으로, 일부 경쟁사의 고정 기능 설계보다 더 유연할 수 있다.

원시 성능 측면에서 Wormhole의 사양은 중급 GPU와 경쟁력이 있지만 최고급 제품에는 뒤처진다. 그러나 확장성과 전력 효율성은 강점으로 꼽힌다. Tenstorrent는 또한 독점 대안과 비교하여 더 큰 맞춤화를 허용하는 소프트웨어 스택의 개방성을 강조했다.

개발 및 향후 로드맵

Tenstorrent는 지속적인 소프트웨어 업데이트와 최적화를 통해 Wormhole 시리즈를 계속 개발하고 있다. 회사는 Wormhole에서 얻은 교훈을 바탕으로 차세대 가속기 계획을 발표했다. 이러한 미래 칩은 더 고급 제조 공정을 사용하여 더 높은 성능과 향상된 효율성을 제공할 것으로 기대된다. Tenstorrent는 또한 인기 있는 프레임워크와 도구에 대한 더 나은 지원을 포함하여 소프트웨어 생태계를 확장하기 위해 노력하고 있다.

회사는 제조 및 기술 협력을 위해 Samsung ElectronicsTSMC를 포함한 다양한 조직과 파트너십을 구축하면서 상당한 자금을 확보했다. 이를 통해 Tenstorrent는 빠르게 진화하는 AI 가속기 시장에서 계속 경쟁할 수 있는 위치를 확보했다.

평가 및 영향

Wormhole은 혁신적인 아키텍처와 프로그래밍 가능성에 대한 초점으로 AI 커뮤니티에서 호평을 받았다. 초기 사용자들은 트랜스포머 모델에서의 성능과 확장 용이성을 칭찬했다. 그러나 일부 사용자들은 소프트웨어 스택이 기존 GPU 공급업체의 것보다 덜 성숙하여 모델 최적화에 더 많은 노력이 필요하다고 지적했다. 그럼에도 불구하고 일부 구성 요소의 오픈소스 특성은 개발자 커뮤니티를 끌어모았다.

Wormhole의 영향은 제품 자체를 넘어 GPU의 지배력에 도전하는 특수 AI 하드웨어의 성장 추세를 대표한다. 그 성공은 AI 가속기 생태계를 확장하는 데 기여하여 연구자와 기업에 더 많은 선택지를 제공했다.

결론

Wormhole은 성능, 효율성, 유연성의 균형을 갖춘 AI 가속기 공간에서 중요한 진입자이다. 데이터플로우 컴퓨팅과 RISC-V 기반 제어에 중점을 둔 점은 기존 GPU와 차별화된다. 소프트웨어 성숙도 측면에서 어려움에 직면했지만, 강력한 확장 능력과 성장하는 생태계는 많은 AI 워크로드에서 실행 가능한 옵션으로 만든다. Tenstorrent가 설계를 계속 발전시킴에 따라 Wormhole과 후속 제품은 AI 하드웨어의 미래에 중요한 역할을 할 가능성이 높다.

참고 문헌

Tenstorrent는 공식 웹사이트를 통해 Wormhole 시리즈에 대한 기술 문서와 성능 벤치마크를 공개했다. 회사는 또한 다양한 산업 컨퍼런스에서 아키텍처와 설계 선택에 대해 발표했다. 자세한 정보를 원하는 독자는 이러한 자료와 기술 간행물의 독립적인 리뷰 및 분석을 참조할 수 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ai-accelerator·hardware·tenstorrent·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사