LLM AI Server with llama.cpp
7.6 MB
Saiz Fail
- Keselamatan
Everyone
Android 7.0+
Android OS
Mengenai LLM AI Server with llama.cpp
Pelayan LLM AI menyediakan kawalan penjanaan setempat lanjutan dengan API/WebUI.
AI tanpa had, awan sifar. Telefon anda adalah pelayannya.
Jalankan LLM yang berkuasa secara setempat, persendirian dan bebas — dengan UI ringan yang boleh digunakan oleh sesiapa sahaja.
Satu peranti Android menjadi bahagian belakang AI peribadi anda, boleh diakses daripada PC, tablet dan peranti lain pada rangkaian yang sama.
---
1. Gambaran Keseluruhan
Pelayan AI LLM dengan llama.cpp ialah pelayan LLM setempat sepenuhnya untuk Android, yang membolehkan penjanaan teks dan multimodal peribadi, luar talian.
Ia menyokong carian model Hugging Face, muat turun GGUF, pemuatan model setempat dan penyahkodan spekulatif MTP pilihan untuk inferens yang lebih pantas.
Famili model yang disokong termasuk Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai dan lain-lain.
Pelayan API terbina dalam serasi dengan API Mesej Ollama, OpenAI dan Anthropic (Claude) — menyediakan titik akhir sembang, penyiapan, penjanaan, pembenaman, tokenisasi/kiraan token dan penyenaraian model, supaya klien dan SDK OpenAI, Ollama dan Claude sedia ada boleh menghala terus ke telefon anda.
WebUI yang dibundel berjalan pada port yang sama dan menyokong penukaran model, penyuntingan parameter, paparan log dan pemasangan PWA.
MCP dan Function Calling membolehkan aliran kerja yang ditambah alat dan output berstruktur disokong melalui GBNF dan Skema JSON.
Sandaran & pemulihan profil membolehkan penyimpanan dan pemindahan set konfigurasi.
---
2. Pengguna yang Ditujukan dan Peranti yang Disokong
Direka untuk pengguna yang mahukan persekitaran LLM persendirian dan setempat sepenuhnya:
- Pengguna luar talian dahulu
- Pembangun yang mengintegrasikan bahagian belakang setempat
- Pengguna lanjutan yang menala persampelan dan prestasi
- Penyelidik menguji tingkah laku inferens
- Pengguna yang berfokus pada privasi
Prestasi boleh ditala melalui saiz konteks, thread, saiz kelompok, penyingkiran GPU, pengkuantuman cache KV dan penyahkodan MTP pilihan.
---
3. Ciri-ciri Utama
- Carian & muat turun GGUF Wajah Peluk
- Pemuatan GGUF Tempatan
- Pelayan LLM Luar Talian Sepenuhnya
- Pengesanan Projektor Gemma‑4 Vision & Qwen Vision
- Penyahkodan Spekulatif MTP
- Kawalan Parameter Terperinci (Mirostat, DRY, XTC, Min‑p, Typical‑p, penalti, suhu dinamik)
- Pilihan Pengkuantuman Cache KV yang Diperluas
- Pengendalian nPredict yang Dipertingkat
- Pelayan API Bersepadu yang Serasi dengan Mesej Ollama / OpenAI / Anthropic (Claude)
- Mesej /v1/yang Serasi dengan Claude (+ pengiraan token) — daftar masuk untuk klien SDK Anthropic
- API Penyematan
- API Tokenizer
- Pemilihan Templat Gesaan Automatik
- Output Penstriman / Bukan Penstriman
- Log Bercap Masa
- WebUI yang Dipertingkatkan dengan Sokongan Pelbagai Bahasa
- Sokongan PWA
- MCP dan Panggilan Fungsi
- Penambahbaikan Kestabilan Beban GPU
- Sokongan Sandaran & Pemulihan Profil
Tersedia titik akhir — Ollama: /api/chat, /api/generate, /api/embed(dings), /api/tokenize, /api/tags · OpenAI: /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/models, /v1/responses/input_tokens · Anthropic (Claude): /v1/messages, /v1/messages/count_tokens.
Dokumen API penuh, contoh & penguji interaktif:
https://micklab.web.app/llama-tester-en.html
---
4. Bermula
Anda boleh mula menggunakan aplikasi dengan segera melalui salah satu cara berikut:
A) Mulakan API/WebUI → Buka dalam pelayar
1. Ketik Mulakan API/WebUI pada skrin utama.
2. Ketik Buka dalam pelayar untuk melancarkan WebUI yang dibundel.
3. Anda boleh bersembang dan menjalankan model terus daripada WebUI.
- Nota: Pada penggunaan pertama, jika model belum dimuat turun lagi, WebUI akan memuat turunnya apabila anda menghantar mesej pertama.
Model besar mungkin mengambil masa untuk dimuat turun.
B) Jalankan Terus
1. Buka bahagian Jalankan Terus pada skrin utama.
2. Masukkan gesaan dan ketik Hantar untuk menjalankan model terus di dalam aplikasi.
- Jika model belum dimuat turun lagi, aplikasi akan memaparkan notis sebelum memuat turun.
C) atau Gunakan Tetapan untuk menyediakan model terlebih dahulu
1. Buka Tetapan.
2. Cari Hugging Face untuk model GGUF atau masukkan URL langsung atau import fail GGUF tempatan.
3. Laraskan parameter (saiz konteks, suhu, penalti, MTP, pemunggahan GPU, dsb.).
4. Ketik Simpan Konfigurasi, kemudian SIMPAN & TUTUP untuk memuatkan model.
5. Secara pilihan, cipta sandaran profil untuk pemulihan kemudian.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Maklumat APK LLM AI Server with llama.cpp
Versi lama LLM AI Server with llama.cpp
Muat Turun Super Pantas dan Selamat melalui Apl APKPure
Satu klik untuk memasang fail XAPK/APK pada Android!







