llama.cpp 0.4.0 주요 업데이트
llama.cpp 0.4.0은 2026년 9월 4일 릴리스되었으며, Qwen3.8-Flash-Next와 Nemotron-3-Puzzle에 대한 초기 지원을 추가하고, 온디맨드 텐서 읽기(lazy tensor reading), 슬롯별 서버 컨텍스트 제한, 비디오 입력 옵션, 그리고 ggml 0.23.0으로의 업그레이드를 포함합니다.
ggml 0.23.0 동기화에서는 sparse flash attention과 RDMA(원격 직접 메모리 접근) 기능이 추가되어 대규모 분산 추론 환경에서의 성능 최적화가 가능해졌습니다.
지속적인 개발 및 성능 강화
개발 속도가 2026년 상반기 이후에도 둔화되지 않았으며, 2026년 8월 27일에 새로운 --video-* CLI 인수가 추가되었고 가장 최근 커밋은 2026년 9월 11일자로 거의 매일 페이스의 백엔드 최적화 작업이 계속 진행되고 있습니다.