LLM AI Server with llama.cpp

LLM AI Server with llama.cpp

Mick Lab - Mitsuo Kuroda
2026年09月06日
  • 7.6 MB

    文件大小

  • 安全
  • Everyone

  • Android 7.0+

    Android OS

關於LLM AI Server with llama.cpp

LLM AI 伺服器提供具有 API/WebUI 的高級本地生成控制。

無限AI,零雲。你的手機就是伺服器。

在本地、私密且免費地運行強大的LLM(邏輯邏輯模型)——輕量級使用者介面,人人都能輕鬆上手。

一台安卓設備即可成為你的個人AI後端,可透過同一網路上的PC、平板電腦和其他裝置存取。

---

1. 概述

llama.cpp 是一款完全在地化的安卓LLM伺服器,支援私密、離線文字和多模態生成。

它支援Hugging Face模型搜尋、GGUF下載、本地模型加載,以及可選的MTP推測解碼,以實現更快的推理速度。

支援的模型系列包括Gemma-4 / Gemma-4 Vision、Qwen / Qwen Vision、Mistral、LLaMA、Phi、Bonsai等。

內建的 API 伺服器相容於 Ollama、OpenAI 和 Anthropic (Claude) Messages API,提供聊天、自動補全、訊息產生、嵌入、分詞/分詞計數和模型清單等接口,因此現有的 OpenAI、Ollama 和 Claude 客戶端和 SDK 可以直接連接到您的手機。

捆綁的 WebUI 運行在同一連接埠上,支援模型切換、參數編輯、日誌檢視和 PWA 安裝。

MCP 和函數呼叫支援工具增強型工作流程,並透過 GBNF 和 JSON Schema 支援結構化輸出。

---

2. 目標使用者和支援的設備

專為希望擁有私密、完全在地化的 LLM 環境的使用者而設計:

- 離線優先用戶

- 整合本地後端的開發者

- 需要調整採樣和效能的高級用戶

- 測試推理行為的研究人員

- 注重隱私的用戶

效能可透過上下文大小、執行緒數、批次大小、GPU 卸載、鍵值快取量化以及可選的 MTP 解碼進行調整。

---

3. 主要特性

- Hugging Face GGUF 搜尋與下載

- Qwen3-VL 視覺模型(預設捆綁),支援自動投影機 (mmproj) 偵測

- 針對大圖像和長提示資訊自動擴展上下文 (n_ctx)

- GPU 初始化失敗時自動回退到 CPU

- 更聰明的 Hugging Face 搜尋:模型/尺寸/量化指導、設備適用性評級以及一鍵下載 mmproj

- 升級的 llama.cpp 引擎 (b10621, v0.3.0) — 支援更新的模型和 Adreno OpenCL GPU

- 透過 GET /api/diagnostics 取得設備端日誌

- 本地 GGUF 加載

- MTP 推測解碼

- 詳細的參數控制(Mirostat、DRY、XTC、Min-p、Typicalties、懲罰項、動態溫度)

- 整合 Ollama / OpenAI / Anthropic (Claude) Messages 相容 API伺服器

- 嵌入式 API

- 自動提示範本選擇

- 增強型 WebUI,支援多語言

- PWA 支持

- MCP 和函數調用

- 設定檔備份和復原支持

相容 Ollama、OpenAI 和 Anthropic(Claude)的端點;完整清單請參閱下方的測試器頁面。

完整的 API 文件、範例和互動式測試器:

https://micklab.web.app/llama-tester-en.html

---

4. 入門指南

您可以透過以下兩種方式立即開始使用應用程式:

A) 啟動 API/WebUI → 在瀏覽器中開啟

1. 在主畫面上點選「啟動 API/WebUI」。

2. 點選「在瀏覽器中開啟」以啟動內建的 WebUI。

3. 您可以直接在 WebUI 中聊天和執行模型。

- 注意:首次使用時,如果模型尚未下載,WebUI 會在您傳送第一則訊息時自動下載。大型模型可能需要一些時間下載。

B) 直接運行

1. 開啟主畫面上的「直接運轉」部分。

2. 輸入提示訊息並點選「傳送」按鈕,即可在應用程式內直接執行模型。

- 如果模型尚未下載,應用程式會在下載前顯示提示訊息。

C) 或先使用「設定」準備模型

1. 開啟“設定”。

2. 搜尋「Hugging Face」尋找 GGUF 模型,或輸入模型 URL 或匯入本機 GGUF 檔案。

3. 調整參數(上下文大小、溫度、懲罰項、MTP、GPU 卸載等)。

4. 點擊“儲存配置”,然後點擊“儲存並關閉”以載入模型。

5. (選用)建立設定檔備份以便日後復原。

更多

最新版本1.620的更新日誌

Last updated on 2026年09月06日
• Vision: Qwen3‑VL now default; GPU→CPU fallback; improved model search + one‑tap mmproj.
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
更多

視頻和屏幕截圖

  • LLM AI Server with llama.cpp 海報
  • LLM AI Server with llama.cpp 截圖 1
  • LLM AI Server with llama.cpp 截圖 2
  • LLM AI Server with llama.cpp 截圖 3
  • LLM AI Server with llama.cpp 截圖 4
  • LLM AI Server with llama.cpp 截圖 5
  • LLM AI Server with llama.cpp 截圖 6
  • LLM AI Server with llama.cpp 截圖 7

LLM AI Server with llama.cpp APK信息

最新版本
1.620
類別
商業
Android OS
Android 7.0+
文件大小
7.6 MB
Available on
內容分級
Everyone
安全報告
立即檢查
安全檢查已完成
無病毒
無間諜軟體
無惡意軟體
無病毒
無間諜軟體
無惡意軟體
套件名稱:com.micklab.llama
SHA-256:9cc8c04831321cb2cf813b42ce60f4173ee5564175b2c38d4314936d9eeee70a
SHA-1:2f4e28841b71f4665eb94e30a95437995f158470
顯示更多
驗證者: APKPURE

LLM AI Server with llama.cpp歷史版本

APKPure 圖標

在APKPure極速安全下載應用程式

一鍵安裝安卓XAPK/APK文件!

下載 APKPure
thank icon
We use cookies and other technologies on this website to enhance your user experience.
By clicking any link on this page you are giving your consent to our Privacy Policy and Cookies Policy.
Learn More about Policies