LLM AI Server with llama.cpp

LLM AI Server with llama.cpp

LLM AI Server with llama.cpp के बारे में

एलएलएम एआई सर्वर एपीआई/वेबयूआई के साथ उन्नत स्थानीय जनरेशन नियंत्रण प्रदान करता है।

असीमित एआई, क्लाउड का उपयोग नहीं। आपका फ़ोन ही सर्वर है।

शक्तिशाली एलएलएम को स्थानीय रूप से, निजी तौर पर और मुफ्त में चलाएँ — एक हल्के-फुल्के यूआई के साथ जिसे कोई भी उपयोग कर सकता है।

एक एंड्रॉइड डिवाइस आपका व्यक्तिगत एआई बैकएंड बन जाता है, जिसे पीसी, टैबलेट और उसी नेटवर्क पर मौजूद अन्य डिवाइस से एक्सेस किया जा सकता है।

---

1. अवलोकन

LLM AI Server with llama.cpp एंड्रॉइड के लिए एक पूरी तरह से स्थानीय एलएलएम सर्वर है, जो निजी, ऑफ़लाइन टेक्स्ट और मल्टीमॉडल जनरेशन को सक्षम बनाता है।

यह हगिंग फेस मॉडल सर्च, GGUF डाउनलोड, स्थानीय मॉडल लोडिंग और तेज़ इन्फ़रेंस के लिए वैकल्पिक MTP स्पेक्युलेटिव डिकोडिंग का समर्थन करता है।

समर्थित मॉडल परिवारों में Gemma-4 / Gemma-4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai और अन्य शामिल हैं।

एक अंतर्निर्मित API सर्वर Ollama, OpenAI, Anthropic (Claude) Messages और Google Gemini API के साथ संगत है — यह चैट, पूर्णता, जनरेशन, एम्बेडिंग, टोकनाइज़/टोकन-काउंट और मॉडल-लिस्टिंग एंडपॉइंट प्रदान करता है, जिससे मौजूदा OpenAI, Ollama, Claude और Gemini क्लाइंट और SDK सीधे आपके फ़ोन से कनेक्ट हो सकते हैं।

बंडल किया गया WebUI उसी पोर्ट पर चलता है और मॉडल स्विचिंग, पैरामीटर संपादन, लॉग व्यूइंग और PWA इंस्टॉलेशन का समर्थन करता है।

MCP और फ़ंक्शन कॉलिंग टूल-संवर्धित वर्कफ़्लो को सक्षम बनाते हैं, और GBNF और JSON स्कीमा के माध्यम से संरचित आउटपुट समर्थित है।

---

2. लक्षित उपयोगकर्ता और समर्थित उपकरण

निजी, पूरी तरह से स्थानीय एलएलएम वातावरण चाहने वाले उपयोगकर्ताओं के लिए डिज़ाइन किया गया:

- ऑफ़लाइन-प्रथम उपयोगकर्ता

- स्थानीय बैकएंड को एकीकृत करने वाले डेवलपर

- सैंपलिंग और प्रदर्शन को ट्यून करने वाले उन्नत उपयोगकर्ता

- अनुमान व्यवहार का परीक्षण करने वाले शोधकर्ता

- गोपनीयता पर केंद्रित उपयोगकर्ता

प्रदर्शन को संदर्भ आकार, थ्रेड्स, बैच आकार, जीपीयू ऑफलोड, केवी कैश क्वांटाइजेशन और वैकल्पिक एमटीपी डिकोडिंग के माध्यम से ट्यून किया जा सकता है।

---

3. मुख्य विशेषताएं

- हगिंग फेस GGUF खोज और डाउनलोड

- स्वचालित प्रोजेक्टर (mmproj) पहचान के साथ Qwen3-VL विज़न मॉडल (डिफ़ॉल्ट रूप से शामिल)

- बड़ी छवियों और लंबे प्रॉम्प्ट के लिए स्वचालित संदर्भ (n_ctx) विस्तार

- GPU आरंभ विफल होने पर स्वचालित GPU→CPU फ़ॉलबैक

- स्मार्ट हगिंग फेस खोज: मॉडल/आकार/क्वांटाइजेशन मार्गदर्शन, डिवाइस उपयुक्तता रेटिंग और एक टैप में mmproj डाउनलोड

- GET /api/diagnostics के माध्यम से डिवाइस पर लॉग पुनर्प्राप्ति

- स्थानीय GGUF लोडिंग

- LoRA एडाप्टर समर्थन: रनटाइम पर बेस मॉडल पर LoRA GGUF लागू करें; सेटिंग्स से एडेप्टर चुनें, सेव करें और प्रबंधित करें

- एमटीपी स्पेकुलेटिव डिकोडिंग

- विस्तृत पैरामीटर नियंत्रण (मिरोस्टैट, DRY, XTC, न्यूनतम तापमान, सामान्य तापमान, पेनल्टी, गतिशील तापमान)

- एकीकृत Ollama / OpenAI / Anthropic (Claude) संदेश / Google Gemini-संगत API सर्वर

- एम्बेडिंग API

- स्वचालित प्रॉम्प्ट टेम्पलेट चयन

- बहु-भाषा समर्थन के साथ उन्नत वेबयूआई

- PWA समर्थन

- MCP और फ़ंक्शन कॉलिंग

- प्रोफ़ाइल बैकअप और पुनर्स्थापना समर्थन

Ollama, OpenAI, Anthropic (Claude) और Google Gemini-संगत एंडपॉइंट; पूरी सूची नीचे दिए गए परीक्षक पृष्ठ पर उपलब्ध है।

पूर्ण API दस्तावेज़, उदाहरण और एक इंटरैक्टिव टेस्टर:

https://micklab.web.app/llama-tester-en.html

---

4. आरंभ करना

आप निम्नलिखित में से किसी भी तरीके से ऐप का उपयोग तुरंत शुरू कर सकते हैं:

A) API/WebUI प्रारंभ करें → ब्राउज़र में खोलें

1. मुख्य स्क्रीन पर API/WebUI प्रारंभ करें पर टैप करें।

2. बंडल किए गए WebUI को लॉन्च करने के लिए ब्राउज़र में खोलें पर टैप करें।

3. आप WebUI से सीधे चैट कर सकते हैं और मॉडल चला सकते हैं।

- नोट: पहली बार उपयोग करने पर, यदि मॉडल अभी तक डाउनलोड नहीं हुआ है, तो पहला संदेश भेजने पर WebUI इसे डाउनलोड कर लेगा।

बड़े मॉडल डाउनलोड होने में समय लग सकता है।

B) सीधा चलाएँ

1. मुख्य स्क्रीन पर सीधा चलाएँ अनुभाग खोलें।

2. एक प्रॉम्प्ट दर्ज करें और ऐप के अंदर सीधे मॉडल चलाने के लिए भेजें पर टैप करें।

- यदि मॉडल अभी तक डाउनलोड नहीं हुआ है, तो डाउनलोड करने से पहले ऐप एक सूचना दिखाएगा।

C) या पहले मॉडल तैयार करने के लिए सेटिंग्स का उपयोग करें

1. सेटिंग्स खोलें।

2. Hugging Face में GGUF मॉडल खोजें या सीधा URL दर्ज करें या स्थानीय GGUF फ़ाइल आयात करें।

3. पैरामीटर समायोजित करें (संदर्भ आकार, तापमान, पेनल्टी, MTP, GPU ऑफ़लोड आदि)।

4. मॉडल लोड करने के लिए Save Config पर टैप करें, फिर SAVE & CLOSE पर क्लिक करें।

5. चाहें तो बाद में पुनर्स्थापित करने के लिए प्रोफ़ाइल का बैकअप बना लें।

अधिक दिखाएं

What's new in the latest 2026.09.23.0954

Last updated on 2026-09-23
• LoRA adapters: apply LoRA GGUF at runtime; manage adapters in Settings.
• Gemini API: Google‑compatible endpoints — /v1beta/models/:generateContent and :streamGenerateContent (v1 alias included).
• MCP integration: resolved handshake failures and stabilized tool registration across sessions.
अधिक दिखाएं

वीडियो और स्क्रीनशॉट

  • LLM AI Server with llama.cpp पोस्टर
  • LLM AI Server with llama.cpp स्क्रीनशॉट 1
  • LLM AI Server with llama.cpp स्क्रीनशॉट 2
  • LLM AI Server with llama.cpp स्क्रीनशॉट 3
  • LLM AI Server with llama.cpp स्क्रीनशॉट 4
  • LLM AI Server with llama.cpp स्क्रीनशॉट 5
  • LLM AI Server with llama.cpp स्क्रीनशॉट 6
  • LLM AI Server with llama.cpp स्क्रीनशॉट 7

LLM AI Server with llama.cpp APK जानकारी

नवीनतम संस्करण
2026.09.23.0954
श्रेणी
व्यवसाय
Android OS
Android 7.0+
फाइल का आकार
7.6 MB
विकासकार
Mick Lab - Mitsuo Kuroda
Available on
कॉन्टेंट रेटिंग
Everyone
सुरक्षा रिपोर्ट
अभी जांचें
सुरक्षा जांच पूर्ण
कोई वायरस नहीं
कोई स्पाइवेयर नहीं
कोई मैलवेयर नहीं
कोई वायरस नहीं
कोई स्पाइवेयर नहीं
कोई मैलवेयर नहीं
पैकेज का नाम:com.micklab.llama
SHA-256:d3d642bbb3efe9b725c5738ea6958b4ac27e88efdaa1bf3ae47c70548614894a
SHA-1:48950ef9de0172fd37c7436f92d4ad553e89bd83
और दिखाएं
सत्यापित द्वारा: APKPURE
APKPure आइकन

APKPure ऐप के माध्यम से सुपर तेज़ और सुरक्षित डाउनलोडिंग

एंड्रॉइड पर XAPK/APK फ़ाइलें इंस्टॉल करने के लिए एक-क्लिक करें!

डाउनलोड APKPure
thank icon
We use cookies and other technologies on this website to enhance your user experience.
By clicking any link on this page you are giving your consent to our Privacy Policy and Cookies Policy.
Learn More about Policies