LLM AI Server with llama.cpp
7.6 MB
Dosya Boyutu
- Güvenlik
Everyone
Android 7.0+
Android OS
LLM AI Server with llama.cpp hakkında
LLM AI sunucusu, API/WebUI ile gelişmiş yerel üretim kontrolleri sağlıyor.
Sınırsız yapay zeka, sıfır bulut. Telefonunuz sunucu.
Güçlü LLM'leri yerel, özel ve özgürce çalıştırın — herkesin kullanabileceği hafif bir kullanıcı arayüzü ile.
Tek bir Android cihaz, aynı ağdaki PC'lerden, tabletlerden ve diğer cihazlardan erişilebilen kişisel yapay zeka arka ucunuz olur.
---
1. Genel Bakış
llama.cpp ile LLM Yapay Zeka Sunucusu, özel, çevrimdışı metin ve çok modlu üretim sağlayan, Android için tamamen yerel bir LLM sunucusudur.
Hugging Face model aramasını, GGUF indirmelerini, yerel model yüklemeyi ve daha hızlı çıkarım için isteğe bağlı MTP spekülatif kod çözmeyi destekler.
Desteklenen model aileleri arasında Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai ve diğerleri bulunur.
Dahili bir API sunucusu, Ollama, OpenAI ve Anthropic (Claude) Mesaj API'leriyle uyumludur ve sohbet, tamamlama, oluşturma, yerleştirme, tokenleştirme/token sayımı ve model listeleme uç noktaları sağlar; böylece mevcut OpenAI, Ollama ve Claude istemcileri ve SDK'ları doğrudan telefonunuza yönlendirilebilir.
Paketlenmiş WebUI aynı portta çalışır ve model değiştirme, parametre düzenleme, günlük görüntüleme ve PWA kurulumunu destekler.
MCP ve Fonksiyon Çağrısı, araç destekli iş akışlarını mümkün kılar ve yapılandırılmış çıktı GBNF ve JSON Şeması aracılığıyla desteklenir.
---
2. Hedef Kullanıcılar ve Desteklenen Cihazlar
Özel, tamamen yerel bir LLM ortamı isteyen kullanıcılar için tasarlanmıştır:
- Çevrimdışı öncelikli kullanıcılar
- Yerel bir arka uç entegre eden geliştiriciler
- Örnekleme ve performansı ayarlayan ileri düzey kullanıcılar
- Çıkarım davranışını test eden araştırmacılar
- Gizliliğe odaklı kullanıcılar
Performans, bağlam boyutu, iş parçacığı sayısı, toplu işlem boyutu, GPU boşaltma, KV önbellek nicelemesi ve isteğe bağlı MTP kod çözme yoluyla ayarlanabilir.
---
3. Temel Özellikler
- Hugging Face GGUF arama ve indirme
- Otomatik projektör (mmproj) algılama özelliğine sahip Qwen3-VL görüntü işleme modeli (varsayılan olarak paketlenmiştir)
- Büyük görüntüler ve uzun komut istemleri için otomatik bağlam (n_ctx) genişletme
- GPU başlatma başarısız olduğunda otomatik GPU→CPU geri dönüşü
- Daha akıllı Hugging Face araması: model / boyut / niceleme kılavuzu, cihaz uygunluk derecelendirmesi ve tek dokunuşla mmproj indirme
- Yükseltilmiş llama.cpp motoru (b10621, v0.3.0) — daha yeni modeller ve Adreno OpenCL GPU
- GET /api/diagnostics aracılığıyla cihaz içi günlük alma
- Yerel GGUF yükleme
- MTP spekülatif kod çözme
- Ayrıntılı parametre kontrolü (Mirostat, DRY, XTC, Min-p, Typical-p, cezalar, dinamik sıcaklık)
- Entegre Ollama / OpenAI / Anthropic (Claude) Mesajlarla uyumlu API sunucusu
- Gömülü API
- Otomatik istem şablonu seçimi
- Çok dilli desteğe sahip gelişmiş Web arayüzü
- PWA desteği
- MCP ve Fonksiyon Çağrısı
- Profil yedekleme ve geri yükleme desteği
Ollama, OpenAI ve Anthropic (Claude) uyumlu uç noktalar; tam liste aşağıdaki testçi sayfasında.
Tam API dokümanları, örnekler ve etkileşimli bir testçi:
https://micklab.web.app/llama-tester-en.html
---
4. Başlamak
Uygulamayı aşağıdaki yollardan herhangi biriyle hemen kullanmaya başlayabilirsiniz:
A) API/Web Arayüzünü Başlat → Tarayıcıda Aç
1. Ana ekranda API/Web Arayüzünü Başlat'a dokunun.
2. Paketlenmiş Web arayüzünü başlatmak için Tarayıcıda Aç'a dokunun.
3. Web arayüzünden doğrudan sohbet edebilir ve modeli çalıştırabilirsiniz.
- Not: İlk kullanımda, model henüz indirilmemişse, ilk mesajı gönderdiğinizde Web arayüzü modeli indirecektir.
Büyük modellerin indirilmesi zaman alabilir.
B) Doğrudan Çalıştırma
1. Ana ekranda Doğrudan Çalıştırma bölümünü açın.
2. Bir komut girin ve modeli doğrudan uygulama içinde çalıştırmak için Gönder'e dokunun.
- Model henüz indirilmemişse, uygulama indirmeden önce bir uyarı gösterecektir.
C) veya Önce Ayarlar'ı Kullanarak Bir Model Hazırlama
1. Ayarlar'ı açın.
2. Bir GGUF modeli için Hugging Face'i arayın veya doğrudan bir URL girin veya yerel bir GGUF dosyasını içe aktarın.
3. Parametreleri ayarlayın (bağlam boyutu, sıcaklık, cezalar, MTP, GPU boşaltma vb.).
4. Modeli yüklemek için Yapılandırmayı Kaydet'e, ardından KAYDET & KAPAT'a dokunun.
5. İsteğe bağlı olarak, daha sonra geri yüklemek için bir profil yedeklemesi oluşturun.
What's new in the latest 1.620
• n_ctx auto‑expands; over‑limit inputs return a clean server error.
• Engine: llama.cpp b10621 / ggml 0.22 with broader model/GPU support.
• Defaults: Chat = Qwen3.5‑2B, Vision = Qwen3‑VL.
• Fixes: missing BOS; streaming continues.
LLM AI Server with llama.cpp APK Bilgileri
LLM AI Server with llama.cpp'in eski sürümleri
APK Uygulaması ile Süper Hızlı ve Güvenli İndirme
XAPK/APK dosyalarını Android'e yüklemek için tek tıkla!







