PyTorch 2.14의 주요 기능
컴파일러 및 성능 최적화: Inductor에 CuTeDSL 기반 NVGEMM 커널이 통합되어 에필로그 융합이 지원됩니다. 이를 통해 고성능 GPU 연산 최적화가 향상됩니다.
분산 학습 인프라: PyTorch Distributed는 새로운 nccl2 백엔드를 도입하며, c10d에서 과도 오류 허용 및 프로세스 그룹 재설정을 지원합니다. torch.switch와 CUDA 그래프 캡처가 torch.while_loop에 추가되었습니다.
동적 형태 관리 및 크로스 플랫폼 지원: 선언형 동적 형태를 위한 @dynamic_spec, 복소수 텐서에 대한 torch.compile 실험 지원이 추가됩니다. ROCm, Intel XPU, NVIDIA GPU를 포함한 확장된 플랫폼 지원이 제공되며, Apple Silicon에서 네이티브 선형대수 및 추가 Metal 커널 개선이 이루어집니다.