LLM AI Server with llama.cpp
7.6 MB
Dimensione
- Sicurezza
Everyone
Android 7.0+
Android OS
Informazioni su LLM AI Server with llama.cpp
Server AI LLM che offre controlli avanzati per la generazione locale tramite API
AI illimitata, zero cloud. Il tuo telefono è il server.
Esegui potenti LLM in locale, in modo privato e gratuito — con un'interfaccia leggera e accessibile a tutti.
Un dispositivo Android diventa il tuo backend AI personale, accessibile da PC, tablet e altri dispositivi sulla stessa rete.
---
1. Panoramica
LLM AI Server con llama.cpp è un server LLM completamente locale per Android: generazione di testo e multimodale, privata e offline.
Supporta ricerca modelli su Hugging Face, download GGUF, caricamento locale e decodifica speculativa MTP opzionale.
Famiglie di modelli supportate: Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai e altre.
Un server API integrato, compatibile con Ollama, OpenAI e Anthropic (Claude) Messages, offre endpoint per chat, completamento, generazione, embedding, tokenizzazione/conteggio token e listato modelli.
La WebUI inclusa funziona sulla stessa porta: cambio modello, modifica parametri, log e installazione come PWA.
MCP e Function Calling abilitano flussi con strumenti; output strutturato via GBNF e JSON Schema.
---
2. Utenti e Dispositivi Supportati
Per chi desidera un ambiente LLM privato e completamente locale:
- Utenti che privilegiano l'uso offline
- Sviluppatori che integrano un backend locale
- Utenti esperti che ottimizzano campionamento e prestazioni
- Ricercatori che testano l'inferenza
- Utenti attenti alla privacy
Prestazioni regolabili: dimensione del contesto, thread, batch, offload GPU, quantizzazione KV e MTP opzionale.
---
3. Caratteristiche Principali
- Ricerca e download GGUF da Hugging Face
- Modello di visione Qwen3‑VL (predefinito) con rilevamento automatico del proiettore (mmproj)
- Espansione automatica del contesto (n_ctx) per immagini grandi e prompt lunghi
- Fallback automatico GPU→CPU in caso di errore di inizializzazione della GPU
- Ricerca Hugging Face migliorata: guida per modello/dimensione/quantizzazione, valutazione di idoneità del dispositivo e download mmproj con un tocco
- Motore llama.cpp aggiornato (b10621, v0.3.0) — modelli più recenti e GPU Adreno OpenCL
- Recupero dei log sul dispositivo tramite GET /api/diagnostics
- Caricamento GGUF locale
- Decodifica speculativa MTP
- Controllo dettagliato dei parametri (Mirostat, DRY, XTC, Min‑p, Typical‑p, penalità, temperatura dinamica)
- Server API integrato compatibile con Ollama / OpenAI / Anthropic (Claude) Messages
- API per embedding
- Selezione automatica del template di prompt
- WebUI migliorata con supporto multilingua
- Supporto PWA
- MCP e Function Calling
- Backup e ripristino del profilo
Endpoint compatibili con Ollama, OpenAI e Anthropic (Claude); elenco completo nella pagina di test qui sotto.
Dettagli completi, esempi e tester interattivo: https://micklab.web.app/llama-tester-en.html
---
4. Come Iniziare
Puoi iniziare subito in uno dei seguenti modi:
A) Avvia API/WebUI → Apri nel browser
1. Tocca "Avvia API/WebUI" nella schermata principale.
2. Tocca "Apri nel browser" per lanciare la WebUI integrata.
3. Puoi chattare ed eseguire il modello dalla WebUI.
- Nota: se il modello non è ancora scaricato, la WebUI lo scarica al primo messaggio (i modelli grandi richiedono tempo).
B) Esecuzione Diretta
1. Apri la sezione "Esecuzione Diretta".
2. Inserisci un prompt e tocca "Invia" per eseguire il modello nell'app.
- Se non ancora scaricato, l'app avvisa prima del download.
C) Oppure prepara prima un modello dalle Impostazioni
1. Apri le Impostazioni.
2. Cerca un GGUF su Hugging Face, inserisci un URL o importa un file locale.
3. Regola i parametri (contesto, temperatura, penalità, MTP, offload GPU, ecc.).
4. Tocca "Salva Configurazione", quindi "SALVA E CHIUDI" per caricare il modello.
5. Opzionalmente, crea un backup del profilo per un ripristino futuro.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Informazioni sull'APK LLM AI Server with llama.cpp
Vecchie versioni di LLM AI Server with llama.cpp
Download super veloce e sicuro tramite l'app APKPure
Basta un clic per installare i file XAPK/APK su Android!






