LLM AI Server with llama.cpp
7.6 MB
Bestandsgrootte
- Beveiliging
Everyone
Android 7.0+
Android OS
Over LLM AI Server with llama.cpp
LLM AI-server met geavanceerde lokale generatiebesturingselementen via API/webinterface.
Onbeperkte AI, geen cloud. Je telefoon is de server.
Voer krachtige LLM's lokaal, privé en gratis uit — met een lichte gebruikersinterface die iedereen kan gebruiken.
Eén Android-apparaat wordt je persoonlijke AI-backend, toegankelijk vanaf pc's, tablets en andere apparaten in hetzelfde netwerk.
---
1. Overzicht
LLM AI Server met llama.cpp is een volledig lokale LLM-server voor Android, waarmee je privé en offline tekst en multimodale generatie mogelijk maakt.
Het ondersteunt Hugging Face-modelzoekopdrachten, GGUF-downloads, het laden van lokale modellen en optionele MTP-speculatieve decodering voor snellere inferentie.
Ondersteunde modelfamilies zijn onder andere Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai en andere.
Een ingebouwde API-server is compatibel met de API's van Ollama, OpenAI en Anthropic (Claude) Messages. Deze biedt eindpunten voor chat, automatisch aanvullen, genereren, insluiten, tokeniseren/tokentellen en modellijsten, zodat bestaande OpenAI-, Ollama- en Claude-clients en SDK's rechtstreeks naar uw telefoon kunnen verwijzen.
De meegeleverde webinterface draait op dezelfde poort en ondersteunt het wisselen van modellen, het bewerken van parameters, het bekijken van logboeken en de installatie van PWA's.
MCP en functieaanroepen maken workflows met toolondersteuning mogelijk, en gestructureerde uitvoer wordt ondersteund via GBNF en JSON Schema.
---
2. Doelgroep en ondersteunde apparaten
Ontworpen voor gebruikers die een privé, volledig lokale LLM-omgeving willen:
- Gebruikers die primair offline werken
- Ontwikkelaars die een lokale backend integreren
- Gevorderde gebruikers die sampling en prestaties optimaliseren
- Onderzoekers die inferentiegedrag testen
- Gebruikers die privacy belangrijk vinden
De prestaties kunnen worden geoptimaliseerd via contextgrootte, threads, batchgrootte, GPU-offload, KV-cachequantisatie en optionele MTP-decodering.
---
3. Belangrijkste functies
- Zoeken en downloaden van Hugging Face GGUF's
- Qwen3-VL-visiemodel (standaard meegeleverd) met automatische projectordetectie (mmproj)
- Automatische contextuitbreiding (n_ctx) voor grote afbeeldingen en lange prompts
- Automatische terugval van GPU naar CPU bij mislukte GPU-initialisatie
- Slimmere Hugging Face-zoekfunctie: begeleiding bij model/grootte/kwantisering, beoordeling van de geschiktheid van het apparaat en downloaden van mmproj's met één tik
- Verbeterde llama.cpp-engine (b10621, v0.3.0) — nieuwere modellen en Adreno OpenCL GPU
- Logboekopvraging op het apparaat via GET /api/diagnostics
- Lokaal laden van GGUF's
- Speculatieve MTP-decodering
- Gedetailleerde parametercontrole (Mirostat, DRY, XTC, Min-p, Typical-p, straffen, dynamische temperatuur)
- Geïntegreerde Ollama / OpenAI / Anthropic (Claude) API-server compatibel met berichten
- API insluiten
- Automatische selectie van promptsjablonen
- Verbeterde webinterface met ondersteuning voor meerdere talen
- PWA-ondersteuning
- MCP en functieaanroepen
- Ondersteuning voor back-up en herstel van profielen
Ollama-, OpenAI- en Anthropic-(Claude-)compatibele eindpunten; volledige lijst op de testerpagina hieronder.
Volledige API-documentatie, voorbeelden en een interactieve tester:
https://micklab.web.app/llama-tester-en.html
---
4. Aan de slag
U kunt de app direct gebruiken op een van de volgende manieren:
A) API/Webinterface starten → Openen in browser
1. Tik op API/Webinterface starten op het hoofdscherm.
2. Tik op Openen in browser om de meegeleverde webinterface te starten.
3. U kunt rechtstreeks vanuit de webinterface chatten en het model uitvoeren.
- Opmerking: Bij het eerste gebruik, als het model nog niet is gedownload, zal de webinterface het downloaden wanneer u het eerste bericht verzendt.
Het downloaden van grote modellen kan enige tijd in beslag nemen.
B) Direct uitvoeren
1. Open het gedeelte 'Direct uitvoeren' op het hoofdscherm.
2. Voer een prompt in en tik op 'Verzenden' om het model direct in de app uit te voeren.
- Als het model nog niet is gedownload, geeft de app een melding weer voordat het downloaden begint.
C) Of gebruik de instellingen om eerst een model voor te bereiden
1. Open de instellingen.
2. Zoek naar 'Hugging Face' voor een GGUF-model, voer een directe URL in of importeer een lokaal GGUF-bestand.
3. Pas de parameters aan (contextgrootte, temperatuur, straffen, MTP, GPU-offload, enz.).
4. Tik op 'Configuratie opslaan' en vervolgens op 'Opslaan en sluiten' om het model te laden.
5. Maak optioneel een back-up van uw profiel voor later herstel.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
LLM AI Server with llama.cpp APK -informatie
Oude versies van LLM AI Server with llama.cpp
Supersnel en veilig downloaden via de APKPure-app
Eén klik om XAPK/APK-bestanden op Android te installeren!







