LLM AI Server with llama.cpp
7.6 MB
Размер файла
- Безопасность
Everyone
Android 7.0+
Android OS
Oписание LLM AI Server with llama.cpp
Сервер LLM AI предоставляет расширенные возможности управления локальной генерацией с помощью API/веб-интерфейса.
Безграничные возможности ИИ, нулевое облако. Ваш телефон — сервер.
Запускайте мощные LLM-модели локально, конфиденциально и бесплатно — с легким пользовательским интерфейсом, доступным каждому.
Одно устройство Android становится вашим персональным бэкендом ИИ, доступным с ПК, планшетов и других устройств в той же сети.
--
1. Обзор
LLM AI Server с llama.cpp — это полностью локальный LLM-сервер для Android, обеспечивающий конфиденциальную, автономную генерацию текста и мультимодальных моделей.
Он поддерживает поиск модели Hugging Face, загрузку GGUF, локальную загрузку модели и опциональное спекулятивное декодирование MTP для более быстрого вывода.
Поддерживаемые семейства моделей включают Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai и другие.
Встроенный API-сервер совместим с API Ollama, OpenAI и Anthropic (Claude) Messages — он предоставляет конечные точки для чата, автодополнения, генерации, встраивания, токенизации/подсчета токенов и отображения списка моделей, поэтому существующие клиенты и SDK OpenAI, Ollama и Claude могут напрямую подключаться к вашему телефону.
Встроенный веб-интерфейс работает на том же порту и поддерживает переключение моделей, редактирование параметров, просмотр логов и установку PWA.
MCP и вызов функций позволяют создавать рабочие процессы с расширенными возможностями, а структурированный вывод поддерживается через GBNF и JSON Schema.
---
2. Целевые пользователи и поддерживаемые устройства
Разработано для пользователей, которым нужна частная, полностью локальная среда LLM:
- Пользователи, для которых офлайн-режим является приоритетным
- Разработчики, интегрирующие локальный бэкэнд
- Опытные пользователи, настраивающие выборку и производительность
- Исследователи, тестирующие поведение при выводе данных
- Пользователи, ориентированные на конфиденциальность
Производительность можно настроить с помощью размера контекста, потоков, размера пакета, разгрузки GPU, квантования кэша ключ-значение и опционального декодирования MTP.
---
3. Ключевые особенности
- Поиск и загрузка GGUF-файлов с эффектом «Обнимающее лицо»
- Модель зрения Qwen3-VL (по умолчанию входит в комплект) с автоматическим определением проектора (mmproj)
- Автоматическое расширение контекста (n_ctx) для больших изображений и длинных запросов
- Автоматическое переключение с GPU на CPU при сбое инициализации GPU
- Более интеллектуальный поиск «Обнимающее лицо»: рекомендации по модели/размеру/квантованию, оценка пригодности устройства и загрузка mmproj одним касанием
- Обновленный движок llama.cpp (b10621, v0.3.0) — для более новых моделей и графического процессора Adreno OpenCL
- Получение логов на устройстве через GET /api/diagnostics
- Локальная загрузка GGUF
- Спекулятивное декодирование MTP
- Детальный контроль параметров (Mirostat, DRY, XTC, Min‑p, Typical‑p, штрафы, динамическая температура)
- Интегрированная Ollama / Сервер API, совместимый с OpenAI / Anthropic (Claude) Messages
- API для встраивания
- Автоматический выбор шаблона запроса
- Расширенный веб-интерфейс с поддержкой нескольких языков
- Поддержка PWA
- MCP и вызов функций
- Поддержка резервного копирования и восстановления профиля
Конечные точки, совместимые с Ollama, OpenAI и Anthropic (Claude); полный список на странице тестера ниже.
Полная документация по API, примеры и интерактивный тестер:
https://micklab.web.app/llama-tester-en.html
---
4. Начало работы
Вы можете начать использовать приложение сразу же одним из следующих способов:
A) Запуск API/WebUI → Открыть в браузере
1. Нажмите «Запустить API/WebUI» на главном экране.
2. Нажмите «Открыть в браузере», чтобы запустить встроенный веб-интерфейс.
3. Вы можете общаться и запускать модель непосредственно из веб-интерфейса.
- Примечание: При первом использовании, если модель еще не загружена, веб-интерфейс загрузит ее при отправке первого сообщения.
Загрузка больших моделей может занять некоторое время.
B) Прямой запуск
1. Откройте раздел «Прямой запуск» на главном экране.
2. Введите запрос и нажмите «Отправить», чтобы запустить модель непосредственно в приложении.
- Если модель еще не загружена, приложение покажет уведомление перед загрузкой.
C) или Используйте настройки для предварительной подготовки модели
1. Откройте «Настройки».
2. Найдите модель GGUF в Hugging Face, введите прямой URL-адрес или импортируйте локальный файл GGUF.
3. Настройте параметры (размер контекста, температура, штрафы, MTP, разгрузка GPU и т. д.).
4. Нажмите «Сохранить конфигурацию», затем «СОХРАНИТЬ И ЗАКРЫТЬ», чтобы загрузить модель.
5. При желании создайте резервную копию профиля для последующего восстановления.
Что нового в последней версии 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Информация LLM AI Server with llama.cpp APK
Старые Версии LLM AI Server with llama.cpp
Супер Быстрая и Безопасная Загрузка через Приложение APKPure
Один клик для установки XAPK/APK файлов на Android!







