LLM AI Server with llama.cpp
7.6 MB
文件大小
- 安全
Everyone
Android 7.0+
Android OS
關於LLM AI Server with llama.cpp
LLM AI 伺服器提供具有 API/WebUI 的高級本地生成控制。
無限AI,零雲。你的手機就是伺服器。
在本地、私密且免費地運行強大的LLM(邏輯邏輯模型)——輕量級使用者介面,人人都能輕鬆上手。
一台安卓設備即可成為你的個人AI後端,可透過同一網路上的PC、平板電腦和其他裝置存取。
---
1. 概述
llama.cpp 是一款完全在地化的安卓LLM伺服器,支援私密、離線文字和多模態生成。
它支援Hugging Face模型搜尋、GGUF下載、本地模型加載,以及可選的MTP推測解碼,以實現更快的推理速度。
支援的模型系列包括Gemma-4 / Gemma-4 Vision、Qwen / Qwen Vision、Mistral、LLaMA、Phi、Bonsai等。
內建的 API 伺服器相容於 Ollama、OpenAI 和 Anthropic (Claude) Messages API,提供聊天、自動補全、訊息產生、嵌入、分詞/分詞計數和模型清單等接口,因此現有的 OpenAI、Ollama 和 Claude 客戶端和 SDK 可以直接連接到您的手機。
捆綁的 WebUI 運行在同一連接埠上,支援模型切換、參數編輯、日誌檢視和 PWA 安裝。
MCP 和函數呼叫支援工具增強型工作流程,並透過 GBNF 和 JSON Schema 支援結構化輸出。
---
2. 目標使用者和支援的設備
專為希望擁有私密、完全在地化的 LLM 環境的使用者而設計:
- 離線優先用戶
- 整合本地後端的開發者
- 需要調整採樣和效能的高級用戶
- 測試推理行為的研究人員
- 注重隱私的用戶
效能可透過上下文大小、執行緒數、批次大小、GPU 卸載、鍵值快取量化以及可選的 MTP 解碼進行調整。
---
3. 主要特性
- Hugging Face GGUF 搜尋與下載
- Qwen3-VL 視覺模型(預設捆綁),支援自動投影機 (mmproj) 偵測
- 針對大圖像和長提示資訊自動擴展上下文 (n_ctx)
- GPU 初始化失敗時自動回退到 CPU
- 更聰明的 Hugging Face 搜尋:模型/尺寸/量化指導、設備適用性評級以及一鍵下載 mmproj
- 升級的 llama.cpp 引擎 (b10621, v0.3.0) — 支援更新的模型和 Adreno OpenCL GPU
- 透過 GET /api/diagnostics 取得設備端日誌
- 本地 GGUF 加載
- MTP 推測解碼
- 詳細的參數控制(Mirostat、DRY、XTC、Min-p、Typicalties、懲罰項、動態溫度)
- 整合 Ollama / OpenAI / Anthropic (Claude) Messages 相容 API伺服器
- 嵌入式 API
- 自動提示範本選擇
- 增強型 WebUI,支援多語言
- PWA 支持
- MCP 和函數調用
- 設定檔備份和復原支持
相容 Ollama、OpenAI 和 Anthropic(Claude)的端點;完整清單請參閱下方的測試器頁面。
完整的 API 文件、範例和互動式測試器:
https://micklab.web.app/llama-tester-en.html
---
4. 入門指南
您可以透過以下兩種方式立即開始使用應用程式:
A) 啟動 API/WebUI → 在瀏覽器中開啟
1. 在主畫面上點選「啟動 API/WebUI」。
2. 點選「在瀏覽器中開啟」以啟動內建的 WebUI。
3. 您可以直接在 WebUI 中聊天和執行模型。
- 注意:首次使用時,如果模型尚未下載,WebUI 會在您傳送第一則訊息時自動下載。大型模型可能需要一些時間下載。
B) 直接運行
1. 開啟主畫面上的「直接運轉」部分。
2. 輸入提示訊息並點選「傳送」按鈕,即可在應用程式內直接執行模型。
- 如果模型尚未下載,應用程式會在下載前顯示提示訊息。
C) 或先使用「設定」準備模型
1. 開啟“設定”。
2. 搜尋「Hugging Face」尋找 GGUF 模型,或輸入模型 URL 或匯入本機 GGUF 檔案。
3. 調整參數(上下文大小、溫度、懲罰項、MTP、GPU 卸載等)。
4. 點擊“儲存配置”,然後點擊“儲存並關閉”以載入模型。
5. (選用)建立設定檔備份以便日後復原。
最新版本1.620的更新日誌
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.







