LLM AI Server with llama.cpp
7.6 MB
Rozmiar Pliku
- Bezpieczeństwo
Everyone
Android 7.0+
Android OS
O LLM AI Server with llama.cpp
Serwer LLM AI zapewniający zaawansowaną lokalną kontrolę generacji z interfejsem API/WebUI.
Nieograniczona sztuczna inteligencja, zero chmury. Twój telefon to serwer.
Uruchamiaj zaawansowane modele LLM lokalnie, prywatnie i swobodnie — z lekkim interfejsem użytkownika, z którego może korzystać każdy.
Jedno urządzenie z Androidem staje się Twoim osobistym zapleczem AI, dostępnym z komputerów PC, tabletów i innych urządzeń w tej samej sieci.
---
1. Omówienie
Serwer LLM AI z llama.cpp to w pełni lokalny serwer LLM dla systemu Android, umożliwiający prywatne generowanie tekstu offline i danych multimodalnych.
Obsługuje wyszukiwanie modeli Hugging Face, pobieranie GGUF, ładowanie modeli lokalnych oraz opcjonalne dekodowanie spekulatywne MTP dla szybszego wnioskowania.
Obsługiwane rodziny modeli obejmują Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai i inne.
Wbudowany serwer API jest zgodny z interfejsami API wiadomości Ollama, OpenAI i Anthropic (Claude) — zapewniając punkty końcowe czatu, uzupełniania, generowania, osadzania, tokenizacji/zliczania tokenów i listowania modeli, dzięki czemu istniejący klienci i zestawy SDK OpenAI, Ollama i Claude mogą być bezpośrednio podłączone do telefonu.
Dołączony interfejs WebUI działa na tym samym porcie i obsługuje przełączanie modeli, edycję parametrów, przeglądanie logów oraz instalację aplikacji PWA.
MCP i wywoływanie funkcji umożliwiają rozszerzone przepływy pracy, a strukturalne dane wyjściowe są obsługiwane za pośrednictwem GBNF i schematu JSON.
---
2. Docelowi użytkownicy i obsługiwane urządzenia
Zaprojektowane dla użytkowników, którzy potrzebują prywatnego, w pełni lokalnego środowiska LLM:
- Użytkownicy offline
- Deweloperzy integrujący lokalne zaplecze
- Zaawansowani użytkownicy dostrajający próbkowanie i wydajność
- Badacze testujący zachowanie wnioskowania
- Użytkownicy nastawieni na prywatność
Wydajność można dostroić za pomocą rozmiaru kontekstu, wątków, rozmiaru partii, odciążenia GPU, kwantyzacji pamięci podręcznej KV oraz opcjonalnego dekodowania MTP.
---
3. Najważniejsze funkcje
- Wyszukiwanie i pobieranie GGUF w Hugging Face
- Model wizji Qwen3-VL (domyślnie w pakiecie) z automatycznym wykrywaniem projektora (mmproj)
- Automatyczne rozszerzanie kontekstu (n_ctx) dla dużych obrazów i długich monitów
- Automatyczne przełączanie GPU na CPU w przypadku niepowodzenia inicjalizacji GPU
- Inteligentniejsze wyszukiwanie Hugging Face: wskazówki dotyczące modelu/rozmiaru/kwantyzacji, ocena przydatności urządzenia i pobieranie mmproj jednym dotknięciem
- Ulepszony silnik llama.cpp (b10621, v0.3.0) — nowsze modele i procesor graficzny Adreno OpenCL
- Pobieranie logów na urządzeniu za pomocą GET /api/diagnostics
- Lokalne ładowanie GGUF
- Dekodowanie spekulatywne MTP
- Szczegółowa kontrola parametrów (Mirostat, DRY, XTC, Min‑p, Typowy‑p, kary, dynamiczna temperatura)
- Zintegrowane Ollama / OpenAI / Anthropic Serwer API zgodny z (Claude) Messages
- Osadzanie API
- Automatyczny wybór szablonu komunikatu
- Ulepszony WebUI z obsługą wielu języków
- Obsługa PWA
- MCP i wywoływanie funkcji
- Obsługa tworzenia kopii zapasowych i przywracania profili
Punkty końcowe zgodne z Ollama, OpenAI i Anthropic (Claude); pełna lista na stronie testera poniżej.
Pełna dokumentacja API, przykłady i interaktywny tester:
https://micklab.web.app/llama-tester-en.html
---
4. Rozpoczęcie pracy
Możesz natychmiast rozpocząć korzystanie z aplikacji w jeden z następujących sposobów:
A) Uruchom API/WebUI → Otwórz w przeglądarce
1. Dotknij Uruchom API/WebUI na ekranie głównym.
2. Dotknij Otwórz w przeglądarce, aby uruchomić dołączony WebUI.
3. Możesz rozmawiać i uruchamiać model bezpośrednio z WebUI.
- Uwaga: Przy pierwszym użyciu, jeśli model nie został jeszcze pobrany, WebUI pobierze go po wysłaniu pierwszej wiadomości.
Pobieranie dużych modeli może zająć trochę czasu.
B) Uruchomienie bezpośrednie
1. Otwórz sekcję Uruchomienie bezpośrednie na ekranie głównym.
2. Wprowadź monit i dotknij Wyślij, aby uruchomić model bezpośrednio w aplikacji.
- Jeśli model nie został jeszcze pobrany, aplikacja wyświetli powiadomienie przed pobraniem.
C) Lub użyj Ustawień, aby najpierw przygotować model
1. Otwórz Ustawienia.
2. Wyszukaj w Hugging Face model GGUF, wprowadź bezpośredni adres URL lub zaimportuj lokalny plik GGUF.
3. Dostosuj parametry (rozmiar kontekstu, temperaturę, kary, MTP, odciążenie GPU itp.).
4. Dotknij Zapisz konfigurację, a następnie ZAPISZ I ZAMKNIJ, aby załadować model.
5. Opcjonalnie utwórz kopię zapasową profilu w celu późniejszego przywrócenia.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Informacje LLM AI Server with llama.cpp APK
Stare wersje LLM AI Server with llama.cpp
Superszybkie i bezpieczne pobieranie za pośrednictwem aplikacji APKPure
Jedno kliknięcie, aby zainstalować pliki XAPK/APK na Androidzie!







