facts
OpenMDW-1.1 라이선스를 적용해 상업적 이용과 수정이 가능한 Laguna-S-2.1이 Hugging Face에 공개됐다. 이 모델은 에이전트 기반 코딩과 장기 작업 수행에 최적화되었으며, 특히 대규모 코드베이스 분석과 복잡한 추론 단계가 필요한 소프트웨어 개발 환경을 타깃으로 한다.
전체 파라미터는 1180억 개지만, 토큰당 활성화되는 파라미터는 약 80억 개로 제한하는 MoE(Mixture-of-Experts) 구조를 채택해 추론 비용을 낮췄다. 내부적으로는 256개의 라우팅 전문가와 1개의 공유 전문가를 운용하며, 소프트플러스 게이팅(Softplus Gating) 기반의 토큰 선택 라우터를 통해 정보 흐름을 조절한다.
설치와 실행은 Unsloth Studio나 llama.cpp를 통해 수행한다. macOS, Linux, WSL 환경에서는 아래 명령어로 설치할 수 있다.
curl -fsSL https://unsloth.ai/install.sh | shWindows 환경에서는 다음 명령어를 사용한다.
irm https://unsloth.ai/install.ps1 | iex다양한 하드웨어 최적화를 위해 GGUF(GPT-Generated Unified Format) 버전을 제공하며, 다음 명령어로 다운로드 가능하다.
huggingface-cli download unsloth/Laguna-S-2.1-GGUF \
--include "UD-Q4_K_XL/*" \
--local-dir Laguna-S-2.1-GGUF서버 형태로 구동할 때는 `llama-server`를, 단일 생성 작업에는 `llama-cli`를 활용한다.
./llama.cpp/build/bin/llama-server \
--model Laguna-S-2.1-GGUF/UD-Q4_K_XL/Laguna-S-2.1-UD-Q4_K_XL-00001-of-00003.gguf \
--fit on --ctx-size 16384 --port 8000how-it-works
1,048,576 토큰의 대규모 문맥 창을 구현하기 위해 GQA(Grouped-Query Attention)와 SWA(Sliding Window Attention)를 혼합했다. 총 48개 층 중 12개는 글로벌 어텐션을 사용하고, 나머지 36개 층은 512 토큰 크기의 슬라이딩 윈도우 어텐션을 적용했다. 이 구조를 통해 수십만 줄의 소스 코드를 한 번에 입력값으로 처리할 수 있다.
도구 호출 사이에 사고 과정을 끼워 넣는 인터리브 씽킹(Interleaved Thinking)을 네이티브로 지원한다. 개발자는 `enable_thinking` 옵션을 통해 요청마다 추론 과정을 제어할 수 있으며, 이를 통해 모델이 코드를 작성하기 전 계획을 세우고 검증하는 단계를 거치게 하여 출력물의 정확도를 높인다.
코딩 성능 측정 결과, SWE-bench Multilingual에서 78.5%, SWE-Bench Pro에서 59.4%를 기록해 실무 수준의 코드 수정 및 버그 해결 능력을 보였다. Toolathlon Verified 벤치마크에서는 49.7%의 성적을 거뒀다. 다만 Terminal-Bench 2.1에서는 70.2%의 정확도를 기록해, Tencent Hy3의 71.7%보다는 소폭 낮은 수치를 보였다.
implementation-impact
추론 지연 시간을 낮추는 핵심 장치는 DFlash 드래프트 모델을 활용한 추측성 디코딩(Speculative Decoding)이다. 작은 모델이 먼저 예측하고 큰 모델이 검증하는 방식을 통해, 수만 줄의 코드를 분석하고 실시간 수정안을 제시해야 하는 에이전트 워크플로우에서 응답 속도를 개선한다.
배포 환경의 하드웨어 제약을 해결하기 위해 FP8, NVFP4, INT4 등 다양한 양자화 버전을 제공한다. 이는 메모리 사용량을 줄이면서도 대규모 문맥 창을 유지해야 하는 운영 환경에서 선택지를 넓힌다.
대규모 코드베이스 분석 에이전트를 구축하는 개발자는 `enable_thinking` 옵션을 통한 추론 단계 제어와 DFlash 기반의 디코딩 속도 향상 폭을 하드웨어별 양자화 버전(FP8, INT4 등)에 따라 검증해 도입 여부를 결정해야 한다.




