LLM AI Server with llama.cpp
7.3 MB
اندازه فایل
- امنیت
Everyone
Android 7.0+
Android OS
دربارهی LLM AI Server with llama.cpp
سرور هوش مصنوعی LLM که کنترلهای تولید محلی پیشرفته را با API/WebUI ارائه میدهد.
هوش مصنوعی نامحدود، فضای ابری صفر. گوشی شما سرور است.
LLM های قدرتمند را به صورت محلی، خصوصی و آزادانه اجرا کنید - با یک رابط کاربری سبک که هر کسی میتواند از آن استفاده کند.
یک دستگاه اندروید به بکاند هوش مصنوعی شخصی شما تبدیل میشود که از رایانههای شخصی، تبلتها و سایر دستگاههای موجود در همان شبکه قابل دسترسی است.
--
1. بررسی اجمالی
سرور هوش مصنوعی LLM با llama.cpp یک سرور LLM کاملاً محلی برای اندروید است که امکان تولید متن خصوصی، آفلاین و چندوجهی را فراهم میکند.
این سرور از جستجوی مدل چهره در آغوش گرفته، دانلودهای GGUF، بارگذاری مدل محلی و رمزگشایی حدسی MTP اختیاری برای استنتاج سریعتر پشتیبانی میکند.
خانوادههای مدل پشتیبانی شده شامل Gemma‑4 / Gemma‑4 Vision، Qwen / Qwen Vision، Mistral، LLaMA، Phi، Bonsai و موارد دیگر هستند. یک سرور API داخلی با APIهای پیامهای Ollama، OpenAI و Anthropic (Claude) سازگار است - نقاط پایانی چت، تکمیل، تولید، جاسازی، توکنسازی/شمارش توکن و فهرستبندی مدل را ارائه میدهد، بنابراین کلاینتها و SDKهای موجود OpenAI، Ollama و Claude میتوانند مستقیماً به تلفن شما اشاره کنند.
WebUI همراه با آن روی همان پورت اجرا میشود و از تعویض مدل، ویرایش پارامتر، مشاهده گزارش و نصب PWA پشتیبانی میکند.
MCP و فراخوانی تابع، گردشهای کاری ابزار-افزوده را فعال میکنند و خروجی ساختاریافته از طریق GBNF و JSON Schema پشتیبانی میشود.
پشتیبانگیری و بازیابی پروفایل امکان ذخیره و انتقال مجموعههای پیکربندی را فراهم میکند.
---
۲. کاربران مورد نظر و دستگاههای پشتیبانیشده
طراحیشده برای کاربرانی که یک محیط LLM خصوصی و کاملاً محلی میخواهند:
- کاربران آفلاین
- توسعهدهندگانی که یک backend محلی را ادغام میکنند
- کاربران پیشرفته نمونهبرداری و عملکرد را تنظیم میکنند
- محققان رفتار استنتاج را آزمایش میکنند
- کاربران متمرکز بر حریم خصوصی
عملکرد را میتوان از طریق اندازه زمینه، رشتهها، اندازه دسته، تخلیه بار GPU، کوانتیزاسیون حافظه نهان KV و رمزگشایی اختیاری MTP تنظیم کرد.
---
۳. ویژگیهای کلیدی
- جستجو و دانلود GGUF چهره در آغوش گرفته
- بارگذاری محلی GGUF
- سرور LLM کاملاً آفلاین
- تشخیص پروژکتور Gemma‑4 Vision و Qwen Vision
- رمزگشایی حدسی MTP
- کنترل دقیق پارامترها (Mirostat، DRY، XTC، Min‑p، Typical‑p، penaltys، دمای پویا)
- گزینههای کوانتیزاسیون کش KV گسترش یافته
- مدیریت nPredict بهبود یافته
- سرور API سازگار با پیامهای Ollama / OpenAI / Anthropic (Claude) یکپارچه
- پیامهای سازگار با Claude /v1/messages (+ شمارش توکن) - برای کلاینتهای SDK Anthropic در دسترس هستند
- API جاسازی
- API توکنساز
- انتخاب خودکار قالب اعلان
- خروجی استریمینگ/غیر استریمینگ
- لاگهای دارای مهر زمانی
- رابط کاربری وب بهبود یافته با پشتیبانی چندزبانه
- پشتیبانی از PWA
- MCP و فراخوانی تابع
- بهبود پایداری بار پردازنده گرافیکی
- پشتیبانی از پشتیبانگیری و بازیابی پروفایل
نقاط پایانی موجود - Ollama: /api/chat، /api/generate، /api/embed(dings)، /api/tokenize، /api/tags · OpenAI: /v1/chat/completions، /v1/completions، /v1/embeddings، /v1/models، /v1/responses/input_tokens · Anthropic (Claude): /v1/messages، /v1/messages/count_tokens.
اسناد کامل API، مثالها و یک تستر تعاملی:
https://micklab.web.app/llama-tester-en.html
---
۴. شروع به کار
شما میتوانید بلافاصله از طریق یکی از روشهای زیر شروع به استفاده از برنامه کنید:
الف) شروع API/WebUI → باز کردن در مرورگر
۱. در صفحه اصلی روی Start API/WebUI ضربه بزنید.
۲. برای راهاندازی WebUI همراه، روی Open in browser ضربه بزنید.
۳. میتوانید مدل را مستقیماً از WebUI چت و اجرا کنید.
- توجه: در اولین استفاده، اگر مدل هنوز دانلود نشده باشد، WebUI هنگام ارسال اولین پیام آن را دانلود میکند.
مدلهای بزرگ ممکن است برای دانلود زمان ببرند.
ب) اجرای مستقیم
۱. بخش اجرای مستقیم را در صفحه اصلی باز کنید.
۲. یک اعلان وارد کنید و برای اجرای مستقیم مدل در داخل برنامه، روی Send ضربه بزنید.
- اگر مدل هنوز دانلود نشده باشد، برنامه قبل از دانلود، اعلانی را نشان میدهد.
ج) یا ابتدا از تنظیمات برای آمادهسازی مدل استفاده کنید
۱. تنظیمات را باز کنید. ۲. مدل GGUF را در Hugging Face جستجو کنید یا یک URL مستقیم وارد کنید یا یک فایل GGUF محلی را وارد کنید.
۳. پارامترها (اندازه زمینه، دما، جریمهها، MTP، تخلیه GPU و غیره) را تنظیم کنید.
۴. برای بارگذاری مدل، روی ذخیره پیکربندی و سپس ذخیره و بستن ضربه بزنید.
۵. در صورت تمایل، یک نسخه پشتیبان از پروفایل برای بازیابی بعدی ایجاد کنید.
جدیدترین 1.590 چه خبر است
- API server keeps running during screen-off / low-power state, with auto-restart and preserved state
- Fixed shutdown-related issues; more stable large-model loading (mmap), clearer crash messages, new profiles: default / Chat / Vision
اطلاعات LLM AI Server with llama.cpp APK
نسخههای قدیمی LLM AI Server with llama.cpp
دانلود فوق سریع و ایمن از طریق برنامه APKPure
برای نصب فایل های XAPK/APK در اندروید با یک کلیک!






