LLM AI Server with llama.cpp
7.6 MB
ফাইলের আকার
- নিরাপত্তা
Everyone
Android 7.0+
Android OS
LLM AI Server with llama.cpp সম্পর্কে
এলএলএম এআই সার্ভার এপিআই/ওয়েবইউআই সহ উন্নত স্থানীয় জেনারেশন নিয়ন্ত্রণ প্রদান করে।
সীমাহীন এআই, কোনো ক্লাউড নেই। আপনার ফোনই সার্ভার।
শক্তিশালী এলএলএম (LLM) স্থানীয়ভাবে, ব্যক্তিগতভাবে এবং অবাধে চালান — একটি হালকা ইউজার ইন্টারফেসের মাধ্যমে যা যে কেউ ব্যবহার করতে পারে।
একটি অ্যান্ড্রয়েড ডিভাইস আপনার ব্যক্তিগত এআই ব্যাকএন্ড হয়ে ওঠে, যা একই নেটওয়ার্কে থাকা পিসি, ট্যাবলেট এবং অন্যান্য ডিভাইস থেকে অ্যাক্সেস করা যায়।
---
১. সংক্ষিপ্ত বিবরণ
llama.cpp সহ এলএলএম এআই সার্ভার হলো অ্যান্ড্রয়েডের জন্য একটি সম্পূর্ণ স্থানীয় এলএলএম সার্ভার, যা ব্যক্তিগত, অফলাইন টেক্সট এবং মাল্টিমোডাল জেনারেশন সক্ষম করে।
এটি হাগিং ফেস (Hugging Face) মডেল সার্চ, জিজিইউএফ (GGUF) ডাউনলোড, স্থানীয় মডেল লোডিং এবং দ্রুততর ইনফারেন্সের জন্য ঐচ্ছিক এমটিপি (MTP) স্পেকুলেটিভ ডিকোডিং সমর্থন করে।
সমর্থিত মডেল ফ্যামিলিগুলোর মধ্যে রয়েছে Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai এবং অন্যান্য। একটি বিল্ট-ইন এপিআই সার্ভার Ollama, OpenAI, Anthropic (Claude) Messages, এবং Google Gemini এপিআই-এর সাথে সামঞ্জস্যপূর্ণ — যা চ্যাট, কমপ্লিশন, জেনারেশন, এমবেডিং, টোকেনাইজ/টোকেন-কাউন্ট, এবং মডেল-লিস্টিং এন্ডপয়েন্ট সরবরাহ করে, ফলে বিদ্যমান OpenAI, Ollama, Claude, এবং Gemini ক্লায়েন্ট ও এসডিকে সরাসরি আপনার ফোনকে নির্দেশ করতে পারে।
এর সাথে থাকা WebUI একই পোর্টে চলে এবং মডেল সুইচিং, প্যারামিটার এডিটিং, লগ দেখা, এবং PWA ইনস্টলেশন সমর্থন করে।
MCP এবং ফাংশন কলিং টুল-অগমেন্টেড ওয়ার্কফ্লো সক্ষম করে, এবং GBNF ও JSON Schema-এর মাধ্যমে স্ট্রাকচার্ড আউটপুট সমর্থিত হয়।
---
২. উদ্দিষ্ট ব্যবহারকারী এবং সমর্থিত ডিভাইস
যারা একটি ব্যক্তিগত, সম্পূর্ণ স্থানীয় LLM পরিবেশ চান, তাদের জন্য ডিজাইন করা হয়েছে:
- অফলাইন-ফার্স্ট ব্যবহারকারী
- স্থানীয় ব্যাকএন্ড ইন্টিগ্রেটকারী ডেভেলপার
- স্যাম্পলিং এবং পারফরম্যান্স টিউনকারী অ্যাডভান্সড ব্যবহারকারী
- ইনফারেন্স আচরণ পরীক্ষাকারী গবেষক
- গোপনীয়তা-সচেতন ব্যবহারকারী
কন্টেক্সট সাইজ, থ্রেড, ব্যাচ সাইজ, GPU অফলোড, KV ক্যাশে কোয়ান্টাইজেশন, এবং ঐচ্ছিক MTP ডিকোডিং-এর মাধ্যমে পারফরম্যান্স টিউন করা যায়।
---
৩. মূল বৈশিষ্ট্যসমূহ
- হাগিং ফেস GGUF অনুসন্ধান ও ডাউনলোড
- স্বয়ংক্রিয় প্রজেক্টর (mmproj) সনাক্তকরণ সহ Qwen3-VL ভিশন মডেল (ডিফল্টরূপে অন্তর্ভুক্ত)
- বড় ছবি এবং দীর্ঘ প্রম্পটের জন্য স্বয়ংক্রিয় কনটেক্সট (n_ctx) সম্প্রসারণ
- GPU ইনিট ব্যর্থ হলে স্বয়ংক্রিয় GPU→CPU ফলব্যাক
- আরও উন্নত হাগিং ফেস অনুসন্ধান: মডেল / আকার / কোয়ান্টাইজেশন নির্দেশনা, ডিভাইস-উপযুক্ততা রেটিং, এবং এক-ট্যাপে mmproj ডাউনলোড
- GET /api/diagnostics এর মাধ্যমে ডিভাইসে লগ পুনরুদ্ধার
- স্থানীয়ভাবে GGUF লোডিং
- LoRA অ্যাডাপ্টার সমর্থন: রানটাইমে বেস মডেলে একটি LoRA GGUF প্রয়োগ করা; সেটিংস থেকে অ্যাডাপ্টার নির্বাচন, সংরক্ষণ এবং পরিচালনা করুন
- MTP স্পেকুলেটিভ ডিকোডিং
- বিস্তারিত প্যারামিটার নিয়ন্ত্রণ (মিরোস্ট্যাট, DRY, XTC, Min‑p, Typical‑p, পেনাল্টি, ডাইনামিক টেম্পারেচার)
- ইন্টিগ্রেটেড Ollama / OpenAI / Anthropic (Claude) Messages / Google Gemini-কম্প্যাটিবল API সার্ভার
- এমবেডিং API
- স্বয়ংক্রিয় প্রম্পট টেমপ্লেট নির্বাচন
- বহুভাষিক সমর্থন সহ উন্নত WebUI
- PWA সমর্থন
MCP এবং ফাংশন কলিং
- প্রোফাইল ব্যাকআপ ও রিস্টোর সমর্থন
Ollama-, OpenAI-, Anthropic-(Claude-), এবং Google-Gemini-কম্প্যাটিবল এন্ডপয়েন্ট; সম্পূর্ণ তালিকা নিচের টেস্টার পেজে দেওয়া আছে।
সম্পূর্ণ এপিআই ডকুমেন্টেশন, উদাহরণ এবং একটি ইন্টারেক্টিভ টেস্টার:
https://micklab.web.app/llama-tester-en.html
---
৪. শুরু করা
আপনি নিম্নলিখিত যেকোনো একটি উপায়ে অবিলম্বে অ্যাপটি ব্যবহার শুরু করতে পারেন:
ক) এপিআই/ওয়েবইউআই শুরু করুন → ব্রাউজারে খুলুন
১. মূল স্ক্রিনে 'এপিআই/ওয়েবইউআই শুরু করুন' (Start API/WebUI) ট্যাপ করুন।
২. বান্ডেল করা ওয়েবইউআই চালু করতে 'ব্রাউজারে খুলুন' (Open in browser) ট্যাপ করুন।
৩. আপনি সরাসরি ওয়েবইউআই থেকে চ্যাট করতে এবং মডেলটি চালাতে পারবেন।
- দ্রষ্টব্য: প্রথমবার ব্যবহারের সময়, যদি মডেলটি এখনও ডাউনলোড করা না থাকে, তবে আপনি প্রথম বার্তা পাঠানোর সময় ওয়েবইউআই এটি ডাউনলোড করবে।
বড় মডেল ডাউনলোড হতে সময় লাগতে পারে।
খ) সরাসরি চালান (Direct Run)
১. মূল স্ক্রিনে 'সরাসরি চালান' (Direct Run) বিভাগটি খুলুন।
২. একটি প্রম্পট লিখুন এবং অ্যাপের ভিতরে সরাসরি মডেলটি চালানোর জন্য 'পাঠান' (Send) ট্যাপ করুন।
- যদি মডেলটি এখনও ডাউনলোড করা না থাকে, তবে ডাউনলোড করার আগে অ্যাপটি একটি বিজ্ঞপ্তি দেখাবে।
গ) অথবা প্রথমে একটি মডেল প্রস্তুত করতে সেটিংস ব্যবহার করুন
১. সেটিংস খুলুন। ২. হাগিং ফেস (Hugging Face)-এ একটি GGUF মডেল অনুসন্ধান করুন অথবা সরাসরি URL দিন বা আপনার স্থানীয় GGUF ফাইল ইম্পোর্ট করুন।
৩. প্যারামিটারগুলো (কন্টেক্সট সাইজ, টেম্পারেচার, পেনাল্টি, MTP, GPU অফলোড, ইত্যাদি) অ্যাডজাস্ট করুন।
৪. মডেলটি লোড করার জন্য সেভ কনফিগ (Save Config)-এ ট্যাপ করুন, তারপর সেভ অ্যান্ড ক্লোজ (SAVE & CLOSE)-এ ট্যাপ করুন।
৫. পরবর্তীতে পুনরুদ্ধারের জন্য ঐচ্ছিকভাবে একটি প্রোফাইল ব্যাকআপ তৈরি করুন।
What's new in the latest 2026.09.23.0954
• Gemini API: Google‑compatible endpoints — /v1beta/models/:generateContent and :streamGenerateContent (v1 alias included).
• MCP integration: resolved handshake failures and stabilized tool registration across sessions.
LLM AI Server with llama.cpp APK Information
LLM AI Server with llama.cpp এর পুরানো সংস্করণ
APKPure অ্যাপের মাধ্যমে অতি দ্রুত এবং নিরাপদ ডাউনলোড করা হচ্ছে
Android-এ XAPK/APK ফাইল ইনস্টল করতে এক-ক্লিক করুন!







