LLM AI Server with llama.cpp

LLM AI Server with llama.cpp

  • 7.6 MB

    Dimensione

  • Sicurezza
  • Everyone

  • Android 7.0+

    Android OS

Informazioni su LLM AI Server with llama.cpp

Server AI LLM che offre controlli avanzati per la generazione locale tramite API

AI illimitata, zero cloud. Il tuo telefono è il server.

Esegui potenti LLM in locale, in modo privato e gratuito — con un'interfaccia leggera e accessibile a tutti.

Un dispositivo Android diventa il tuo backend AI personale, accessibile da PC, tablet e altri dispositivi sulla stessa rete.

---

1. Panoramica

LLM AI Server con llama.cpp è un server LLM completamente locale per Android: generazione di testo e multimodale, privata e offline.

Supporta ricerca modelli su Hugging Face, download GGUF, caricamento locale e decodifica speculativa MTP opzionale.

Famiglie di modelli supportate: Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai e altre.

Un server API integrato, compatibile con Ollama, OpenAI e Anthropic (Claude) Messages, offre endpoint per chat, completamento, generazione, embedding, tokenizzazione/conteggio token e listato modelli.

La WebUI inclusa funziona sulla stessa porta: cambio modello, modifica parametri, log e installazione come PWA.

MCP e Function Calling abilitano flussi con strumenti; output strutturato via GBNF e JSON Schema.

---

2. Utenti e Dispositivi Supportati

Per chi desidera un ambiente LLM privato e completamente locale:

- Utenti che privilegiano l'uso offline

- Sviluppatori che integrano un backend locale

- Utenti esperti che ottimizzano campionamento e prestazioni

- Ricercatori che testano l'inferenza

- Utenti attenti alla privacy

Prestazioni regolabili: dimensione del contesto, thread, batch, offload GPU, quantizzazione KV e MTP opzionale.

---

3. Caratteristiche Principali

- Ricerca e download GGUF da Hugging Face

- Modello di visione Qwen3‑VL (predefinito) con rilevamento automatico del proiettore (mmproj)

- Espansione automatica del contesto (n_ctx) per immagini grandi e prompt lunghi

- Fallback automatico GPU→CPU in caso di errore di inizializzazione della GPU

- Ricerca Hugging Face migliorata: guida per modello/dimensione/quantizzazione, valutazione di idoneità del dispositivo e download mmproj con un tocco

- Motore llama.cpp aggiornato (b10621, v0.3.0) — modelli più recenti e GPU Adreno OpenCL

- Recupero dei log sul dispositivo tramite GET /api/diagnostics

- Caricamento GGUF locale

- Decodifica speculativa MTP

- Controllo dettagliato dei parametri (Mirostat, DRY, XTC, Min‑p, Typical‑p, penalità, temperatura dinamica)

- Server API integrato compatibile con Ollama / OpenAI / Anthropic (Claude) Messages

- API per embedding

- Selezione automatica del template di prompt

- WebUI migliorata con supporto multilingua

- Supporto PWA

- MCP e Function Calling

- Backup e ripristino del profilo

Endpoint compatibili con Ollama, OpenAI e Anthropic (Claude); elenco completo nella pagina di test qui sotto.

Dettagli completi, esempi e tester interattivo: https://micklab.web.app/llama-tester-en.html

---

4. Come Iniziare

Puoi iniziare subito in uno dei seguenti modi:

A) Avvia API/WebUI → Apri nel browser

1. Tocca "Avvia API/WebUI" nella schermata principale.

2. Tocca "Apri nel browser" per lanciare la WebUI integrata.

3. Puoi chattare ed eseguire il modello dalla WebUI.

- Nota: se il modello non è ancora scaricato, la WebUI lo scarica al primo messaggio (i modelli grandi richiedono tempo).

B) Esecuzione Diretta

1. Apri la sezione "Esecuzione Diretta".

2. Inserisci un prompt e tocca "Invia" per eseguire il modello nell'app.

- Se non ancora scaricato, l'app avvisa prima del download.

C) Oppure prepara prima un modello dalle Impostazioni

1. Apri le Impostazioni.

2. Cerca un GGUF su Hugging Face, inserisci un URL o importa un file locale.

3. Regola i parametri (contesto, temperatura, penalità, MTP, offload GPU, ecc.).

4. Tocca "Salva Configurazione", quindi "SALVA E CHIUDI" per caricare il modello.

5. Opzionalmente, crea un backup del profilo per un ripristino futuro.

Mostra Altro

What's new in the latest 1.620

Last updated on 2026-09-06
• Vision: Qwen3‑VL now default; GPU→CPU fallback; improved model search + one‑tap mmproj.
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Mostra Altro

Video e screenshot

  • Poster LLM AI Server with llama.cpp
  • 1 Schermata LLM AI Server with llama.cpp
  • 2 Schermata LLM AI Server with llama.cpp
  • 3 Schermata LLM AI Server with llama.cpp
  • 4 Schermata LLM AI Server with llama.cpp
  • 5 Schermata LLM AI Server with llama.cpp
  • 6 Schermata LLM AI Server with llama.cpp

Informazioni sull'APK LLM AI Server with llama.cpp

Ultima versione
1.620
Categoria
Affari
Android OS
Android 7.0+
Dimensione
7.6 MB
Available on
Classificazione dei contenuti
Everyone
Rapporto di sicurezza
Controlla ora
Controllo di sicurezza completato
Nessun virus
Nessuno spyware
Nessun malware
Nessun virus
Nessuno spyware
Nessun malware
Nome del pacchetto:com.micklab.llama
SHA-256:9cc8c04831321cb2cf813b42ce60f4173ee5564175b2c38d4314936d9eeee70a
SHA-1:2f4e28841b71f4665eb94e30a95437995f158470
Mostra di più
Verificato da: APKPURE
Icona APKPure

Download super veloce e sicuro tramite l'app APKPure

Basta un clic per installare i file XAPK/APK su Android!

Scarica APKPure
thank icon
We use cookies and other technologies on this website to enhance your user experience.
By clicking any link on this page you are giving your consent to our Privacy Policy and Cookies Policy.
Learn More about Policies