Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

llama.cpp 0.4.0 출시: Qwen, Nemotron 지원 및 비디오 입력 기능 추가

llama.cpp 0.4.0이 2026년 9월 4일 릴리스되어 Qwen3.8-Flash-Next와 Nemotron-3-Puzzle 모델 지원, 온디맨드 텐서 읽기, 비디오 입력 등 새로운 기능을 제공합니다. ggml 0.23.0과의 동기화로 sparse flash attention과 RDMA 최적화도 포함되어 C++ 기반 LLM 추론 성능을 대폭 향상시킵니다.

2026.09.19  ·  22회  · 

llama.cpp 0.4.0 주요 업데이트

llama.cpp 0.4.0은 2026년 9월 4일 릴리스되었으며, Qwen3.8-Flash-Next와 Nemotron-3-Puzzle에 대한 초기 지원을 추가하고, 온디맨드 텐서 읽기(lazy tensor reading), 슬롯별 서버 컨텍스트 제한, 비디오 입력 옵션, 그리고 ggml 0.23.0으로의 업그레이드를 포함합니다.

ggml 0.23.0 동기화에서는 sparse flash attention과 RDMA(원격 직접 메모리 접근) 기능이 추가되어 대규모 분산 추론 환경에서의 성능 최적화가 가능해졌습니다.

지속적인 개발 및 성능 강화

개발 속도가 2026년 상반기 이후에도 둔화되지 않았으며, 2026년 8월 27일에 새로운 --video-* CLI 인수가 추가되었고 가장 최근 커밋은 2026년 9월 11일자로 거의 매일 페이스의 백엔드 최적화 작업이 계속 진행되고 있습니다.

WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원