SambaNova SN40L의 핵심 기술 아키텍처
SambaNova SN40L은 TSMC의 5nm 공정으로 제조된 최신세대 Reconfigurable Dataflow Unit으로, AI 학습과 추론 작업을 위해 설계되었습니다. 각 칩은 두 개의 로직 다이와 102억 개의 트랜지스터로 구성되며, BF16 기준 640 TFLOPS의 연산 성능을 제공합니다. 독특한 3계층 메모리 아키텍처는 온칩 520MB SRAM, 64GB HBM, 1.5TB DDR DRAM을 통합하여 메모리 병목 현상을 해결하고 5조 파라미터 규모의 대규모 언어모델 실행을 가능하게 합니다.
CoWoS-S 인터포저 기술과 Dual-Die 설계를 채용하여 고대역폭 및 대용량 메모리 접근을 동시에 지원하며, Peer-to-Peer 네트워크를 통해 다중 소켓 확장성을 제공합니다. 최근 업그레이드인 SN40L-16은 노드당 RDU 개수를 8개에서 16개로 확대하여 대규모 AI 추론 엔드포인트의 가용성을 크게 향상했으며, Llama 3.1 405B 같은 초대형 모델까지 효율적으로 지원합니다.
데이터플로우 기반 컴파일러 최적화는 수백 개의 복잡한 연산을 자동으로 단일 커널 호출로 융합하여 GPU 대비 40배 이상의 면적 효율성을 달성합니다. DDR 메모리 계층을 통한 전문가 모델 오버플로우 지원으로 Mixture-of-Experts 아키텍처에 최적화된 추론 성능을 제공하며, 별도의 호스트 CPU 접근 없이 직접 메모리 접근이 가능해 레이턴시를 최소화합니다.