llama.cpp(C++ 기반의 LLM 추론 라이브러리)가 API 키와 텔레메트리 없이 로컬 기기에서 프론티어 AI 모델을 실행하는 환경을 제공한다. `llama serve` 실행 후 `pi-llama` 플러그인을 설치하면 Pi가 로컬 모델을 자동으로 인식해 별도의 설정 없이 구동된다. 모든 데이터와 요청은 외부로 전송되지 않고 로컬 기기에 저장된다.

노트북부터 클러스터까지 모든 GPU와 CPU에서 동일한 바이너리와 커널로 작동한다. OpenAI가 GPT-2 이후 처음 공개한 오픈 웨이트 모델과 Google의 Gemini 3 기술 기반 오픈 모델, 알리바바의 차세대 멀티모달 추론 모델(Dense 및 MoE 변체)을 로컬에서 실행할 수 있다.

Google 모델은 140개 이상의 언어와 최대 128K 컨텍스트를 지원하며 에지부터 클라우드까지 배포 가능하다. OpenAI 모델은 함수 호출(Function Calling)과 도구 사용 능력을 갖춰 추론 및 에이전트 작업에 활용된다.