LLM AI Server with llama.cpp
7.6 MB
फाइल का आकार
- सुरक्षा
Everyone
Android 7.0+
Android OS
LLM AI Server with llama.cpp के बारे में
एलएलएम एआई सर्वर एपीआई/वेबयूआई के साथ उन्नत स्थानीय जनरेशन नियंत्रण प्रदान करता है।
असीमित एआई, क्लाउड का उपयोग नहीं। आपका फ़ोन ही सर्वर है।
शक्तिशाली एलएलएम को स्थानीय रूप से, निजी तौर पर और मुफ्त में चलाएँ — एक हल्के-फुल्के यूआई के साथ जिसे कोई भी उपयोग कर सकता है।
एक एंड्रॉइड डिवाइस आपका व्यक्तिगत एआई बैकएंड बन जाता है, जिसे पीसी, टैबलेट और उसी नेटवर्क पर मौजूद अन्य डिवाइस से एक्सेस किया जा सकता है।
---
1. अवलोकन
LLM AI Server with llama.cpp एंड्रॉइड के लिए एक पूरी तरह से स्थानीय एलएलएम सर्वर है, जो निजी, ऑफ़लाइन टेक्स्ट और मल्टीमॉडल जनरेशन को सक्षम बनाता है।
यह हगिंग फेस मॉडल सर्च, GGUF डाउनलोड, स्थानीय मॉडल लोडिंग और तेज़ इन्फ़रेंस के लिए वैकल्पिक MTP स्पेक्युलेटिव डिकोडिंग का समर्थन करता है।
समर्थित मॉडल परिवारों में Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai और अन्य शामिल हैं।
एक अंतर्निर्मित API सर्वर Ollama, OpenAI, Anthropic (Claude) Messages और Google Gemini API के साथ संगत है — यह चैट, पूर्णता, जनरेशन, एम्बेडिंग, टोकनाइज़/टोकन-काउंट और मॉडल-लिस्टिंग एंडपॉइंट प्रदान करता है, जिससे मौजूदा OpenAI, Ollama, Claude और Gemini क्लाइंट और SDK सीधे आपके फ़ोन से कनेक्ट हो सकते हैं।
बंडल किया गया WebUI उसी पोर्ट पर चलता है और मॉडल स्विचिंग, पैरामीटर संपादन, लॉग व्यूइंग और PWA इंस्टॉलेशन का समर्थन करता है।
MCP और फ़ंक्शन कॉलिंग टूल-संवर्धित वर्कफ़्लो को सक्षम बनाते हैं, और GBNF और JSON स्कीमा के माध्यम से संरचित आउटपुट समर्थित है।
---
2. लक्षित उपयोगकर्ता और समर्थित उपकरण
निजी, पूरी तरह से स्थानीय एलएलएम वातावरण चाहने वाले उपयोगकर्ताओं के लिए डिज़ाइन किया गया:
- ऑफ़लाइन-प्रथम उपयोगकर्ता
- स्थानीय बैकएंड को एकीकृत करने वाले डेवलपर
- सैंपलिंग और प्रदर्शन को ट्यून करने वाले उन्नत उपयोगकर्ता
- अनुमान व्यवहार का परीक्षण करने वाले शोधकर्ता
- गोपनीयता पर केंद्रित उपयोगकर्ता
प्रदर्शन को संदर्भ आकार, थ्रेड्स, बैच आकार, जीपीयू ऑफलोड, केवी कैश क्वांटाइजेशन और वैकल्पिक एमटीपी डिकोडिंग के माध्यम से ट्यून किया जा सकता है।
---
3. मुख्य विशेषताएं
- हगिंग फेस GGUF खोज और डाउनलोड
- स्वचालित प्रोजेक्टर (mmproj) पहचान के साथ Qwen3-VL विज़न मॉडल (डिफ़ॉल्ट रूप से शामिल)
- बड़ी छवियों और लंबे प्रॉम्प्ट के लिए स्वचालित संदर्भ (n_ctx) विस्तार
- GPU आरंभ विफल होने पर स्वचालित GPU→CPU फ़ॉलबैक
- स्मार्ट हगिंग फेस खोज: मॉडल/आकार/क्वांटाइजेशन मार्गदर्शन, डिवाइस उपयुक्तता रेटिंग और एक टैप में mmproj डाउनलोड
- GET /api/diagnostics के माध्यम से डिवाइस पर लॉग पुनर्प्राप्ति
- स्थानीय GGUF लोडिंग
- LoRA एडाप्टर समर्थन: रनटाइम पर बेस मॉडल पर LoRA GGUF लागू करें; सेटिंग्स से एडेप्टर चुनें, सेव करें और प्रबंधित करें
- एमटीपी स्पेकुलेटिव डिकोडिंग
- विस्तृत पैरामीटर नियंत्रण (मिरोस्टैट, DRY, XTC, न्यूनतम तापमान, सामान्य तापमान, पेनल्टी, गतिशील तापमान)
- एकीकृत Ollama / OpenAI / Anthropic (Claude) संदेश / Google Gemini-संगत API सर्वर
- एम्बेडिंग API
- स्वचालित प्रॉम्प्ट टेम्पलेट चयन
- बहु-भाषा समर्थन के साथ उन्नत वेबयूआई
- PWA समर्थन
- MCP और फ़ंक्शन कॉलिंग
- प्रोफ़ाइल बैकअप और पुनर्स्थापना समर्थन
Ollama, OpenAI, Anthropic (Claude) और Google Gemini-संगत एंडपॉइंट; पूरी सूची नीचे दिए गए परीक्षक पृष्ठ पर उपलब्ध है।
पूर्ण API दस्तावेज़, उदाहरण और एक इंटरैक्टिव टेस्टर:
https://micklab.web.app/llama-tester-en.html
---
4. आरंभ करना
आप निम्नलिखित में से किसी भी तरीके से ऐप का उपयोग तुरंत शुरू कर सकते हैं:
A) API/WebUI प्रारंभ करें → ब्राउज़र में खोलें
1. मुख्य स्क्रीन पर API/WebUI प्रारंभ करें पर टैप करें।
2. बंडल किए गए WebUI को लॉन्च करने के लिए ब्राउज़र में खोलें पर टैप करें।
3. आप WebUI से सीधे चैट कर सकते हैं और मॉडल चला सकते हैं।
- नोट: पहली बार उपयोग करने पर, यदि मॉडल अभी तक डाउनलोड नहीं हुआ है, तो पहला संदेश भेजने पर WebUI इसे डाउनलोड कर लेगा।
बड़े मॉडल डाउनलोड होने में समय लग सकता है।
B) सीधा चलाएँ
1. मुख्य स्क्रीन पर सीधा चलाएँ अनुभाग खोलें।
2. एक प्रॉम्प्ट दर्ज करें और ऐप के अंदर सीधे मॉडल चलाने के लिए भेजें पर टैप करें।
- यदि मॉडल अभी तक डाउनलोड नहीं हुआ है, तो डाउनलोड करने से पहले ऐप एक सूचना दिखाएगा।
C) या पहले मॉडल तैयार करने के लिए सेटिंग्स का उपयोग करें
1. सेटिंग्स खोलें।
2. Hugging Face में GGUF मॉडल खोजें या सीधा URL दर्ज करें या स्थानीय GGUF फ़ाइल आयात करें।
3. पैरामीटर समायोजित करें (संदर्भ आकार, तापमान, पेनल्टी, MTP, GPU ऑफ़लोड आदि)।
4. मॉडल लोड करने के लिए Save Config पर टैप करें, फिर SAVE & CLOSE पर क्लिक करें।
5. चाहें तो बाद में पुनर्स्थापित करने के लिए प्रोफ़ाइल का बैकअप बना लें।
What's new in the latest 2026.09.23.0954
• Gemini API: Google‑compatible endpoints — /v1beta/models/:generateContent and :streamGenerateContent (v1 alias included).
• MCP integration: resolved handshake failures and stabilized tool registration across sessions.
LLM AI Server with llama.cpp APK जानकारी
LLM AI Server with llama.cpp के पुराने संस्करण
APKPure ऐप के माध्यम से सुपर तेज़ और सुरक्षित डाउनलोडिंग
एंड्रॉइड पर XAPK/APK फ़ाइलें इंस्टॉल करने के लिए एक-क्लिक करें!







