facts
총 26억 9천만 개의 파라미터를 가진 텍스트 전용 모델 LFM2.5-2.6B가 공개됐다. 모델 내부 구조는 총 30개의 레이어로 설계됐으며, 이 중 22개는 연산 효율을 높이기 위한 더블 게이트 숏 컨볼루션 블록(Double-gated short convolution blocks)으로, 나머지 8개는 메모리 사용량을 줄이는 GQA(그룹 쿼리 어텐션, Grouped Query Attention) 구조로 이루어져 있다. 학습 단계에서는 34조 개의 토큰이 투입됐으며, 12만 8천 개의 단어 사전 크기를 갖춘다.
131,072 토큰에 달하는 컨텍스트 윈도우는 긴 문서 처리나 복잡한 대화 기록 유지 시 활용된다. 지원 언어는 한국어를 포함해 영어, 중국어, 일본어, 프랑스어, 독일어, 이탈리아어, 스페인어, 포르투갈어, 베트남어, 태국어, 인도네시아어, 힌디어, 러시아어, 폴란드어, 아랍어까지 총 15개 국어를 아우른다. 최적 성능을 위한 생성 파라미터는 온도 0.1, top_k 50, 반복 패널티 1.1로 권장된다.
how-it-works
연산 효율을 높이기 위해 도입된 더블 게이트 숏 컨볼루션 블록 22개가 모델의 핵심 연산을 처리한다. 여기에 여러 개의 쿼리가 하나의 키와 값 쌍을 공유하는 GQA 구조 8개 레이어를 혼합해 추론 시 발생하는 메모리 부하를 낮췄다. 이러한 하이브리드 구조는 하드웨어 제약이 심한 온디바이스 환경에서 메모리 점유율을 2.5GB 미만으로 유지하면서도 빠른 추론 속도를 내는 기반이 된다.
에이전트 강화 학습(Agentic Reinforcement Learning)을 통해 도구 사용 및 다단계 작업 수행 능력을 강화했다. 실제 에이전트 실행 환경 내에서 반복적인 피드백을 통해 최적의 행동 경로를 학습함으로써, 자신보다 파라미터 규모가 4배 더 큰 모델과 경쟁 가능한 수준의 지시 이행 성능을 확보했다는 것이 Liquid AI 측의 설명이다.
애플 M5 Max에서는 초당 220토큰, AMD 라이젠 CPU에서는 초당 113토큰의 추론 속도를 기록했다. 배포 편의성을 위해 GPU/CPU 추론 최적화 형식인 GGUF(llama.cpp용 양자화 포맷), 크로스 플랫폼 배포를 위한 ONNX(오픈 신경망 교환 표준 포맷), 애플 실리콘 전용 MLX(애플 하드웨어 최적화 프레임워크) 포맷을 모두 지원한다.
implementation-impact
RAG(검색 증강 생성, Retrieval-Augmented Generation) 시스템 구축이나 정교한 데이터 추출, 긴 문맥 유지가 필요한 자동화 워크플로우가 주요 적용 대상이다. 특히 저사양 기기에서 고성능 AI 에이전트를 구현해야 하는 환경에서 메모리 효율성과 추론 속도 사이의 균형점을 제공한다.
모델 설치와 실행은 `transformers` 라이브러리를 통해 가능하며, Hugging Face에서 가중치를 내려받아 사용할 수 있다.
pip install transformers
huggingface-cli download LiquidAI/LFM2.5-2.6B
python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)ChatML-like format 적용 예시
messages = [
{"role": "system", "content": "You are a helpful assistant trained by Liquid AI."},
{"role": "user", "content": "What is C. elegans?"}
]
inputs = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0]))
지식 집약적 작업이나 복잡한 코딩 에이전트 작업의 경우, 모델의 절대적인 파라미터 크기 제약으로 인해 성능 저하가 발생할 수 있으므로 도입 전 검증이 필요하다.


