NVIDIA Blackwell Ultra 아키텍처 주요 특징
NVIDIA Blackwell-architecture GPU는 208억 개의 트랜지스터를 탑재하고 TSMC 4NP 공정으로 제조되며, 10TB/s의 칩-투-칩 인터커넥트로 연결된 두 개의 리티클 제한 다이를 포함한다. 제2세대 Transformer Engine은 대형 언어 모델(LLM)과 전문가 혼합(MoE) 모델을 위한 추론 및 학습을 가속화하며, Blackwell Ultra Tensor Core는 어텐션 레이어 가속화 측면에서 2배, AI 컴퓨트 FLOPS에서 1.5배 향상을 제공한다.
Blackwell 제품군은 제5세대 NVLink Switch를 탑재하여 1.8TB/s의 상호 연결 대역폭을 제공하고, 576개 GPU까지 확장 가능하며, Decompression Engine과 Reliability, Availability, Serviceability(RAS) Engine을 통해 데이터 분석 성능 및 시스템 안정성을 크게 개선한다.