LLM AI Server with llama.cpp
7.6 MB
Taille de fichier
- Sécurité
Everyone
Android 7.0+
Android OS
À propos de LLM AI Server with llama.cpp
Serveur LLM AI offrant des commandes de génération locale avancées avec API/Web.
IA illimitée, zéro cloud. Votre téléphone est le serveur.
Exécutez de puissants LLM en local, en toute confidentialité et gratuitement, avec une interface légère et accessible à tous.
Un appareil Android devient votre backend IA personnel, accessible depuis PC, tablettes et autres appareils du même réseau.
---
1. Présentation
LLM AI Server avec llama.cpp est un serveur LLM entièrement local pour Android : génération de texte et multimodale, privée et hors ligne.
Prend en charge la recherche de modèles Hugging Face, les téléchargements GGUF, le chargement local et le décodage spéculatif MTP en option.
Familles de modèles prises en charge : Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai, etc.
Un serveur API intégré est compatible avec les API Ollama, OpenAI et Anthropic (Claude) Messages, avec des endpoints chat, complétion, génération, embedding, tokenisation/comptage de tokens et liste des modèles.
La WebUI incluse fonctionne sur le même port : changement de modèle, édition des paramètres, journaux et installation en PWA.
MCP et Function Calling permettent des workflows outillés ; sortie structurée via GBNF et JSON Schema.
---
2. Utilisateurs et appareils pris en charge
Pour qui veut un environnement LLM privé et entièrement local :
- Utilisateurs privilégiant le hors ligne
- Développeurs intégrant un backend local
- Utilisateurs avancés réglant échantillonnage et performances
- Chercheurs testant le comportement d'inférence
- Utilisateurs soucieux de la confidentialité
Performances réglables : contexte, threads, batch, offload GPU, quantification KV et MTP.
---
3. Fonctionnalités clés
- Recherche et téléchargement GGUF depuis Hugging Face
- Modèle de vision Qwen3‑VL (par défaut) avec détection automatique du projecteur (mmproj)
- Expansion automatique du contexte (n_ctx) pour les grandes images et les longues invites
- Repli automatique GPU→CPU en cas d'échec d'initialisation du GPU
- Recherche Hugging Face améliorée : conseils par modèle/taille/quantification, indice d'adéquation à l'appareil et téléchargement mmproj en un geste
- Moteur llama.cpp mis à jour (b10621, v0.3.0) — nouveaux modèles et GPU Adreno OpenCL
- Récupération des journaux sur l'appareil via GET /api/diagnostics
- Chargement GGUF local
- Décodage spéculatif MTP
- Contrôle détaillé des paramètres (Mirostat, DRY, XTC, Min‑p, Typical‑p, pénalités, température dynamique)
- Serveur API intégré compatible Ollama / OpenAI / Anthropic (Claude) Messages
- API d'embedding
- Sélection automatique du modèle de prompt
- WebUI améliorée multilingue
- Prise en charge PWA
- MCP et Function Calling
- Sauvegarde et restauration de profils
Endpoints compatibles Ollama, OpenAI et Anthropic (Claude) ; liste complète sur la page de test ci-dessous.
Documentation complète de l'API, exemples et testeur interactif : https://micklab.web.app/llama-tester-en.html
---
4. Pour commencer
Vous pouvez démarrer immédiatement de l'une de ces façons :
A) Démarrer l'API/WebUI → Ouvrir dans le navigateur
1. Touchez « Démarrer l'API/WebUI » sur l'écran principal.
2. Touchez « Ouvrir dans le navigateur » pour lancer la WebUI intégrée.
3. Discutez et exécutez le modèle depuis la WebUI.
- Remarque : si le modèle n'est pas encore téléchargé, la WebUI le télécharge au premier message.
B) Exécution directe
1. Ouvrez la section « Exécution directe ».
2. Saisissez un prompt et touchez « Envoyer ».
- S'il n'est pas encore téléchargé, l'app prévient avant le téléchargement.
C) Ou préparez d'abord un modèle dans les Paramètres
1. Ouvrez les Paramètres.
2. Recherchez un GGUF sur Hugging Face, saisissez une URL ou importez un fichier local.
3. Réglez les paramètres (contexte, température, pénalités, MTP, offload GPU, etc.).
4. Touchez « Enregistrer la configuration », puis « ENREGISTRER ET FERMER » pour charger le modèle.
5. Créez éventuellement une sauvegarde de profil.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Informations LLM AI Server with llama.cpp APK
Vieilles versions de LLM AI Server with llama.cpp
Téléchargement super rapide et sûr via l'application APKPure
Un clic pour installer les fichiers XAPK/APK sur Android!






