LLM AI Server with llama.cpp
7.6 MB
Ukuran file
- Keamanan
Everyone
Android 7.0+
Android OS
Tentang LLM AI Server with llama.cpp
Server AI LLM menyediakan kontrol generasi lokal tingkat lanjut dengan API/WebUI.
AI tak terbatas, tanpa cloud. Ponsel Anda adalah servernya.
Jalankan LLM yang canggih secara lokal, pribadi, dan gratis — dengan UI ringan yang dapat digunakan siapa pun.
Satu perangkat Android menjadi backend AI pribadi Anda, dapat diakses dari PC, tablet, dan perangkat lain di jaringan yang sama.
---
1. Gambaran Umum
LLM AI Server dengan llama.cpp adalah server LLM lokal sepenuhnya untuk Android, yang memungkinkan pembuatan teks dan multimodal secara pribadi dan offline.
Server ini mendukung pencarian model Hugging Face, unduhan GGUF, pemuatan model lokal, dan decoding spekulatif MTP opsional untuk inferensi yang lebih cepat.
Keluarga model yang didukung meliputi Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai, dan lainnya.
Server API bawaan kompatibel dengan API Ollama, OpenAI, dan Anthropic (Claude) Messages — menyediakan endpoint obrolan, penyelesaian otomatis, pembuatan, penyematan, tokenisasi/penghitungan token, dan daftar model, sehingga klien dan SDK OpenAI, Ollama, dan Claude yang ada dapat langsung terhubung ke ponsel Anda.
WebUI yang disertakan berjalan pada port yang sama dan mendukung pergantian model, pengeditan parameter, tampilan log, dan instalasi PWA.
MCP dan Pemanggilan Fungsi memungkinkan alur kerja yang diperkaya alat, dan output terstruktur didukung melalui GBNF dan Skema JSON.
---
2. Pengguna yang Dituju dan Perangkat yang Didukung
Dirancang untuk pengguna yang menginginkan lingkungan LLM lokal sepenuhnya dan privat:
- Pengguna yang mengutamakan offline
- Pengembang yang mengintegrasikan backend lokal
- Pengguna tingkat lanjut yang menyetel pengambilan sampel dan kinerja
- Peneliti yang menguji perilaku inferensi
- Pengguna yang berfokus pada privasi
Kinerja dapat disetel melalui ukuran konteks, thread, ukuran batch, offload GPU, kuantisasi cache KV, dan decoding MTP opsional.
---
3. Fitur Utama
- Pencarian & pengunduhan Hugging Face GGUF
- Model visi Qwen3-VL (default terbundel) dengan deteksi proyektor otomatis (mmproj)
- Ekspansi konteks otomatis (n_ctx) untuk gambar besar dan prompt panjang
- Fallback GPU→CPU otomatis saat inisialisasi GPU gagal
- Pencarian Hugging Face yang lebih cerdas: panduan model / ukuran / kuantisasi, peringkat kesesuaian perangkat, dan pengunduhan mmproj sekali ketuk
- Mesin llama.cpp yang ditingkatkan (b10621, v0.3.0) — model yang lebih baru dan GPU Adreno OpenCL
- Pengambilan log di perangkat melalui GET /api/diagnostics
- Pemuatan GGUF lokal
- Dekode spekulatif MTP
- Kontrol parameter terperinci (Mirostat, DRY, XTC, Min‑p, Typical‑p, penalti, suhu dinamis)
- Terintegrasi dengan Ollama / OpenAI / Anthropic (Claude) Server API yang kompatibel dengan pesan
- API penyematan
- Pemilihan templat prompt otomatis
- WebUI yang disempurnakan dengan dukungan multibahasa
- Dukungan PWA
- MCP dan Pemanggilan Fungsi
- Dukungan pencadangan & pemulihan profil
Endpoint yang kompatibel dengan Ollama, OpenAI, dan Anthropic (Claude); daftar lengkap di halaman penguji di bawah ini.
Dokumentasi API lengkap, contoh & penguji interaktif:
https://micklab.web.app/llama-tester-en.html
---
4. Memulai
Anda dapat langsung menggunakan aplikasi dengan salah satu cara berikut:
A) Mulai API/WebUI → Buka di browser
1. Ketuk Mulai API/WebUI di layar utama.
2. Ketuk Buka di browser untuk meluncurkan WebUI yang disertakan.
3. Anda dapat mengobrol dan menjalankan model langsung dari WebUI.
- Catatan: Pada penggunaan pertama, jika model belum diunduh, WebUI akan mengunduhnya saat Anda mengirim pesan pertama.
Model berukuran besar mungkin membutuhkan waktu untuk diunduh.
B) Jalankan Langsung
1. Buka bagian Jalankan Langsung di layar utama.
2. Masukkan perintah dan ketuk Kirim untuk menjalankan model langsung di dalam aplikasi.
- Jika model belum diunduh, aplikasi akan menampilkan pemberitahuan sebelum mengunduh.
C) atau Gunakan Pengaturan untuk mempersiapkan model terlebih dahulu
1. Buka Pengaturan.
2. Cari Hugging Face untuk model GGUF atau masukkan URL langsung atau impor file GGUF lokal.
3. Sesuaikan parameter (ukuran konteks, suhu, penalti, MTP, offload GPU, dll.).
4. Ketuk Simpan Konfigurasi, lalu SIMPAN & TUTUP untuk memuat model.
5. Secara opsional, buat cadangan profil untuk pemulihan di kemudian hari.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
Informasi APK LLM AI Server with llama.cpp
Versi lama LLM AI Server with llama.cpp
Pengunduhan Super cepat dan aman melalui aplikasi APKPure
Sekali klik untuk menginstal file XAPK/APK di Android!







