LLM AI Server with llama.cpp
7.6 MB
파일 크기
- 보안
Everyone
Android 7.0+
Android OS
LLM AI Server with llama.cpp 정보
LLM AI 서버는 API/웹 UI를 통해 고급 로컬 생성 제어 기능을 제공합니다.
무제한 AI, 클라우드 제로. 당신의 스마트폰이 서버가 됩니다.
강력한 LLM을 로컬에서, 비공개로, 무료로 실행하세요. 누구나 쉽게 사용할 수 있는 가벼운 UI와 함께요.
안드로이드 기기 하나가 개인 AI 백엔드가 되어, 같은 네트워크에 있는 PC, 태블릿 등 다른 기기에서도 접속할 수 있습니다.
---
1.개요
llama.cpp 기반 LLM AI 서버는 안드로이드용 완전 로컬 LLM 서버로, 개인 정보가 보호되는 오프라인 환경에서 텍스트 및 멀티모달 생성을 가능하게 합니다.
Hugging Face 모델 검색, GGUF 다운로드, 로컬 모델 로딩을 지원하며, 더 빠른 추론을 위해 MTP 추측 디코딩 기능도 선택적으로 제공합니다.
지원되는 모델 패밀리로는 Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai 등이 있습니다.
내장된 API 서버는 Ollama, OpenAI, Anthropic (Claude) Messages API와 호환되어 채팅, 완성(completion), 생성, 임베딩, 토큰화/토큰 수, 모델 목록 조회 엔드포인트를 제공합니다.
함께 제공되는 WebUI는 동일한 포트에서 실행되며, 모델 전환, 매개변수 편집, 로그 확인, PWA 설치를 지원합니다.
MCP 및 함수 호출 기능을 통해 도구를 활용한 워크플로우를 구현할 수 있으며, GBNF 및 JSON 스키마를 통한 구조화된 출력도 지원합니다.
프로필 백업 및 복원 기능으로 설정 구성을 저장하고 다른 기기로 옮길 수 있습니다.
---
2. 대상 사용자 및 지원 기기
개인 정보가 보호되는 완전 로컬 LLM 환경을 원하는 사용자를 위해 설계되었습니다:
- 오프라인 환경을 주로 사용하는 사용자
- 로컬 백엔드를 통합하려는 개발자
- 샘플링 및 성능 튜닝에 관심 있는 고급 사용자
- 추론 동작을 테스트하는 연구자
- 개인 정보 보호를 중요하게 생각하는 사용자
컨텍스트 크기, 스레드, 배치 크기, GPU 오프로드, KV 캐시 양자화, 선택적 MTP 디코딩 등을 통해 성능을 최적화할 수 있습니다.
---
3. 주요 기능
- Hugging Face GGUF 모델 검색 및 다운로드
- Qwen3‑VL 비전 모델(기본 내장)과 프로젝터(mmproj) 자동 감지
- 큰 이미지·긴 프롬프트를 위한 컨텍스트(n_ctx) 자동 확장
- GPU 초기화 실패 시 GPU→CPU 자동 폴백
- 더 똑똑해진 Hugging Face 검색: 모델/크기/양자화 가이드, 기기 적합도 평가, mmproj 원터치 다운로드
- 업그레이드된 llama.cpp 엔진(b10621, v0.3.0) — 최신 모델 및 Adreno OpenCL GPU
- GET /api/diagnostics 로 기기 로그 가져오기
- 로컬 GGUF 파일 로딩
- 완전 오프라인 LLM 서버 기능
- Gemma‑4 Vision 및 Qwen Vision 프로젝터 감지
- MTP 추측 디코딩 지원
- 상세 매개변수 제어 (Mirostat, DRY, XTC, Min‑p, Typical‑p, 페널티, 동적 온도 등)
- 확장된 KV 캐시 양자화 옵션
- 개선된 nPredict 처리 방식
- Ollama / OpenAI / Anthropic (Claude) Messages 호환 API 서버 내장
- Claude 호환 /v1/messages (+ 토큰 수 계산) — Anthropic SDK 클라이언트용 drop‑in
- 임베딩 API 제공
- 토크나이저 API 제공
- 자동 프롬프트 템플릿 선택
- 스트리밍 / 비스트리밍 출력 지원
- 타임스탬프가 포함된 로그
- 다국어 지원이 강화된 WebUI
- PWA 지원
- MCP 및 함수 호출 기능
- GPU 부하 안정성 개선
- 프로필 백업 및 복원 기능
사용 가능한 엔드포인트 — Ollama: /api/chat, /api/generate, /api/embed(dings), /api/tokenize, /api/tags, /api/diagnostics · OpenAI: /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/models · Anthropic (Claude): /v1/messages, /v1/messages/count_tokens.
API 상세 정보, 예제, 인터랙티브 테스터: https://micklab.web.app/llama-tester-en.html
---
4. 시작 방법
다음 방법 중 하나로 앱을 바로 사용할 수 있습니다:
A) API/WebUI 시작 후 브라우저에서 열기
1. 메인 화면에서 'API/WebUI 시작'을 탭합니다. 2. '브라우저에서 열기'를 탭하여 내장된 WebUI를 실행합니다. 3. WebUI에서 직접 채팅하며 모델을 실행할 수 있습니다.
- 참고: 처음 사용할 때 모델이 다운로드되지 않은 경우, 첫 메시지를 보내면 WebUI가 자동으로 다운로드합니다.
B) 직접 실행
1. 메인 화면에서 '직접 실행' 섹션을 엽니다. 2. 프롬프트를 입력하고 '보내기'를 탭하면 앱 내에서 바로 모델이 실행됩니다.
- 모델이 다운로드되지 않은 경우, 다운로드 전에 알림이 표시됩니다.
C) 또는 설정을 통해 먼저 모델 준비
1. '설정'을 엽니다. 2. Hugging Face에서 GGUF 모델을 검색하거나, 직접 URL을 입력하거나, 로컬 GGUF 파일을 가져옵니다. 3. 매개변수 (컨텍스트 크기, 온도, 페널티, MTP, GPU 오프로드 등)를 조정합니다.
4. '구성 저장'을 탭한 후 '저장 및 닫기'를 탭하여 모델을 로드합니다.
5. 필요하다면 나중에 복원할 수 있도록 프로필 백업을 생성합니다.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.






