LLM AI Server with llama.cpp

LLM AI Server with llama.cpp

  • 7.6 MB

    Tamaño de archivo

  • Seguridad
  • Everyone

  • Android 7.0+

    Android OS

Acerca del LLM AI Server with llama.cpp

Servidor de IA LLM que controles avanzados de generación local con API/web.

IA ilimitada, cero nube. Tu teléfono es el servidor.

Ejecuta potentes LLM en local, de forma privada y gratuita, con una interfaz ligera y accesible para todos.

Un dispositivo Android se convierte en tu backend de IA personal, accesible desde PC, tablets y otros dispositivos de la misma red.

---

1. Descripción general

LLM AI Server con llama.cpp es un servidor LLM totalmente local para Android: generación de texto y multimodal, privada y sin conexión.

Admite búsqueda de modelos en Hugging Face, descargas GGUF, carga local y decodificación especulativa MTP opcional.

Familias de modelos compatibles: Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai y más.

Un servidor API integrado es compatible con las API de Ollama, OpenAI y Anthropic (Claude) Messages, y ofrece endpoints para chat, compleción, generación, embeddings, tokenización/recuento de tokens y listado de modelos.

La WebUI incluida funciona en el mismo puerto: cambio de modelo, edición de parámetros, registros e instalación como PWA.

MCP y Function Calling permiten flujos con herramientas; salida estructurada mediante GBNF y JSON Schema.

---

2. Usuarios y dispositivos compatibles

Para quienes desean un entorno LLM privado y totalmente local:

- Usuarios que priorizan el uso sin conexión

- Desarrolladores que integran un backend local

- Usuarios avanzados que ajustan muestreo y rendimiento

- Investigadores que prueban el comportamiento de inferencia

- Usuarios preocupados por la privacidad

Rendimiento ajustable: tamaño de contexto, hilos, lote, offload de GPU, cuantización de caché KV y MTP opcional.

---

3. Funciones principales

- Búsqueda y descarga de GGUF desde Hugging Face

- Modelo de visión Qwen3‑VL (predeterminado) con detección automática del proyector (mmproj)

- Expansión automática del contexto (n_ctx) para imágenes grandes y prompts largos

- Cambio automático GPU→CPU si falla la inicialización de la GPU

- Búsqueda de Hugging Face mejorada: guía por modelo/tamaño/cuantización, valoración de idoneidad del dispositivo y descarga de mmproj con un toque

- Motor llama.cpp actualizado (b10621, v0.3.0): modelos más nuevos y GPU Adreno OpenCL

- Obtención de registros en el dispositivo mediante GET /api/diagnostics

- Carga local de GGUF

- Decodificación especulativa MTP

- Control detallado de parámetros (Mirostat, DRY, XTC, Min‑p, Typical‑p, penalizaciones, temperatura dinámica)

- Servidor API integrado compatible con Ollama / OpenAI / Anthropic (Claude) Messages

- API de embeddings

- Selección automática de plantilla de prompt

- WebUI mejorada con soporte multilingüe

- Compatibilidad con PWA

- MCP y Function Calling

- Copia de seguridad y restauración de perfiles

Endpoints compatibles con Ollama, OpenAI y Anthropic (Claude); lista completa en la página de prueba de abajo.

Documentación completa de la API, ejemplos y probador interactivo: https://micklab.web.app/llama-tester-en.html

---

4. Primeros pasos

Puedes empezar de inmediato de una de estas formas:

A) Iniciar API/WebUI → Abrir en el navegador

1. Toca "Iniciar API/WebUI" en la pantalla principal.

2. Toca "Abrir en el navegador" para lanzar la WebUI integrada.

3. Puedes chatear y ejecutar el modelo directamente desde la WebUI.

- Nota: si el modelo aún no está descargado, la WebUI lo descargará con el primer mensaje.

B) Ejecución directa

1. Abre la sección "Ejecución directa".

2. Escribe un prompt y toca "Enviar" para ejecutar el modelo en la app.

- Si aún no está descargado, la app avisa antes de descargar.

C) O prepara antes un modelo en Ajustes

1. Abre Ajustes.

2. Busca un GGUF en Hugging Face, introduce una URL o importa un archivo local.

3. Ajusta los parámetros (contexto, temperatura, penalizaciones, MTP, offload de GPU, etc.).

4. Toca "Guardar configuración" y luego "GUARDAR Y CERRAR" para cargar el modelo.

5. Opcionalmente, crea una copia de seguridad del perfil para restaurarla más tarde.

Mostrar más

Novedades más recientes 1.620

Last updated on 2026-09-06
• Vision: Qwen3‑VL now default; GPU→CPU fallback; improved model search + one‑tap mmproj.
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Mostrar más

Vídeos y capturas de pantalla

  • LLM AI Server with llama.cpp Poster
  • LLM AI Server with llama.cpp captura de pantalla 1
  • LLM AI Server with llama.cpp captura de pantalla 2
  • LLM AI Server with llama.cpp captura de pantalla 3
  • LLM AI Server with llama.cpp captura de pantalla 4
  • LLM AI Server with llama.cpp captura de pantalla 5
  • LLM AI Server with llama.cpp captura de pantalla 6

Información de LLM AI Server with llama.cpp APK

Última Versión
1.620
Categoría
Empresa
Android OS
Android 7.0+
Tamaño de archivo
7.6 MB
Disponible en
Clasificación de contenido
Everyone
Informe de seguridad
Comprobar ahora
Verificación de seguridad completada
Sin virus
Sin spyware
Sin malware
Sin virus
Sin spyware
Sin malware
Nombre del paquete:com.micklab.llama
SHA-256:9cc8c04831321cb2cf813b42ce60f4173ee5564175b2c38d4314936d9eeee70a
SHA-1:2f4e28841b71f4665eb94e30a95437995f158470
Mostrar más
Verificado por: APKPURE
APKPure icono

Descarga rápida y segura a través de APKPure App

¡Un clic para instalar archivos XAPK/APK en Android!

Descargar APKPure
thank icon
We use cookies and other technologies on this website to enhance your user experience.
By clicking any link on this page you are giving your consent to our Privacy Policy and Cookies Policy.
Learn More about Policies