LLM AI Server with llama.cpp
7.3 MB
ขนาดไฟล์
- ความปลอดภัย
Everyone
Android 7.0+
Android OS
เกี่ยวกับ LLM AI Server with llama.cpp
เซิร์ฟเวอร์ LLM AI ให้การควบคุมการสร้างข้อมูลในพื้นที่ขั้นสูงด้วย API/WebUI
AI ไร้ขีดจำกัด ไม่ต้องพึ่งคลาวด์ โทรศัพท์ของคุณคือเซิร์ฟเวอร์
เรียกใช้ LLM ที่ทรงพลังได้ในเครื่องของคุณเอง เป็นส่วนตัว และฟรี — ด้วย UI ที่ใช้งานง่าย ใครๆ ก็ใช้ได้
อุปกรณ์ Android เพียงเครื่องเดียวก็กลายเป็นแบ็กเอนด์ AI ส่วนตัวของคุณ สามารถเข้าถึงได้จากพีซี แท็บเล็ต และอุปกรณ์อื่นๆ บนเครือข่ายเดียวกัน
---
1. ภาพรวม
LLM AI Server พร้อม llama.cpp เป็นเซิร์ฟเวอร์ LLM แบบโลคอลสำหรับ Android อย่างสมบูรณ์ ช่วยให้สร้างข้อความและมัลติโมดอลแบบส่วนตัวและออฟไลน์ได้
รองรับการค้นหาโมเดล Hugging Face การดาวน์โหลด GGUF การโหลดโมเดลแบบโลคอล และการถอดรหัสแบบคาดการณ์ MTP ที่เป็นตัวเลือกสำหรับการประมวลผลที่เร็วขึ้น
ตระกูลโมเดลที่รองรับ ได้แก่ Gemma‑4 / Gemma‑4 Vision, Qwen / Qwen Vision, Mistral, LLaMA, Phi, Bonsai และอื่นๆ
เซิร์ฟเวอร์ API ในตัวสามารถใช้งานร่วมกับ API ข้อความของ Ollama, OpenAI และ Anthropic (Claude) ได้ โดยมีเอนด์พอยต์สำหรับการแชท การเติมข้อความอัตโนมัติ การสร้างข้อความ การฝังข้อความ การแยกโทเค็น/การนับโทเค็น และการแสดงรายการโมเดล ทำให้ไคลเอนต์และ SDK ของ OpenAI, Ollama และ Claude ที่มีอยู่สามารถเชื่อมต่อกับโทรศัพท์ของคุณได้โดยตรง
ส่วนติดต่อผู้ใช้บนเว็บ (WebUI) ที่รวมมาด้วยทำงานบนพอร์ตเดียวกันและรองรับการสลับโมเดล การแก้ไขพารามิเตอร์ การดูบันทึก และการติดตั้ง PWA
MCP และการเรียกฟังก์ชันช่วยให้เวิร์กโฟลว์ที่เสริมด้วยเครื่องมือทำงานได้ และรองรับเอาต์พุตที่มีโครงสร้างผ่าน GBNF และ JSON Schema
การสำรองและกู้คืนโปรไฟล์ช่วยให้สามารถบันทึกและถ่ายโอนชุดการกำหนดค่าได้
---
2. กลุ่มเป้าหมายและอุปกรณ์ที่รองรับ
ออกแบบมาสำหรับผู้ใช้ที่ต้องการสภาพแวดล้อม LLM ส่วนตัวแบบโลคอลอย่างสมบูรณ์:
- ผู้ใช้ที่เน้นการใช้งานแบบออฟไลน์เป็นหลัก
- นักพัฒนาที่ต้องการผสานรวมแบ็กเอนด์แบบโลคอล
- ผู้ใช้ขั้นสูงที่ต้องการปรับแต่งการสุ่มตัวอย่างและประสิทธิภาพ
- นักวิจัยที่ทดสอบพฤติกรรมการอนุมาน
- ผู้ใช้ที่เน้นความเป็นส่วนตัว
สามารถปรับแต่งประสิทธิภาพได้ผ่านขนาดบริบท จำนวนเธรด ขนาดแบทช์ การถ่ายโอนข้อมูลไปยัง GPU การควอนไทเซชันแคช KV และการถอดรหัส MTP ที่เป็นตัวเลือก
---
3. คุณสมบัติหลัก
- ค้นหาและดาวน์โหลด Hugging Face GGUF
- การโหลด GGUF ในเครื่อง
- เซิร์ฟเวอร์ LLM แบบออฟไลน์โดยสมบูรณ์
- การตรวจจับโปรเจคเตอร์ Gemma-4 Vision และ Qwen Vision
- การถอดรหัสแบบคาดการณ์ MTP
- การควบคุมพารามิเตอร์โดยละเอียด (Mirostat, DRY, XTC, Min-p, Typical-p, penalties, อุณหภูมิแบบไดนามิก)
- ตัวเลือกการควอนไทเซชันแคช KV ที่ขยายเพิ่มเติม
- การจัดการ nPredict ที่ได้รับการปรับปรุง
- เซิร์ฟเวอร์ API ที่เข้ากันได้กับ Ollama / OpenAI / Anthropic (Claude) Messages
- /v1/messages ที่เข้ากันได้กับ Claude (+ การนับโทเค็น) — สามารถใช้งานได้ทันทีสำหรับไคลเอ็นต์ Anthropic SDK
- API สำหรับการฝังข้อมูล
- API สำหรับการแยกโทเค็น
- การเลือกเทมเพลตข้อความแจ้งเตือนอัตโนมัติ
- เอาต์พุตแบบสตรีมมิ่ง / ไม่ใช่สตรีมมิ่ง
- บันทึกที่มีการประทับเวลา
- WebUI ที่ได้รับการปรับปรุงพร้อมรองรับหลายภาษา
- รองรับ PWA - การประมวลผล MCP และการเรียกฟังก์ชัน
- ปรับปรุงความเสถียรในการโหลด GPU
- รองรับการสำรองและกู้คืนโปรไฟล์
เอนด์พอยต์ที่ใช้งานได้ — Ollama: /api/chat, /api/generate, /api/embed(dings), /api/tokenize, /api/tags · OpenAI: /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/models, /v1/responses/input_tokens · Anthropic (Claude): /v1/messages, /v1/messages/count_tokens
เอกสาร API ฉบับเต็ม ตัวอย่าง และเครื่องมือทดสอบแบบโต้ตอบ:
https://micklab.web.app/llama-tester-en.html
---
4. การเริ่มต้นใช้งาน
คุณสามารถเริ่มใช้งานแอปได้ทันทีด้วยวิธีใดวิธีหนึ่งต่อไปนี้:
A) เริ่ม API/WebUI → เปิดในเบราว์เซอร์
1. แตะ เริ่ม API/WebUI บนหน้าจอหลัก
2. แตะ เปิดในเบราว์เซอร์ เพื่อเปิด WebUI ที่มาพร้อมกับแอป
3. คุณสามารถแชทและเรียกใช้โมเดลได้โดยตรงจาก WebUI
- หมายเหตุ: ในการใช้งานครั้งแรก หากยังไม่ได้ดาวน์โหลดโมเดล WebUI จะดาวน์โหลดเมื่อคุณส่งข้อความแรก
โมเดลขนาดใหญ่อาจใช้เวลาในการดาวน์โหลด
B) เรียกใช้โดยตรง
1. เปิดส่วน เรียกใช้โดยตรง บนหน้าจอหลัก
2. ป้อนข้อความแจ้งเตือนและแตะ ส่ง เพื่อเรียกใช้โมเดลโดยตรงภายในแอป
- หากยังไม่ได้ดาวน์โหลดโมเดล แอปจะแสดงข้อความแจ้งเตือนก่อนดาวน์โหลด
C) หรือใช้การตั้งค่าเพื่อเตรียมโมเดลก่อน
1. เปิดการตั้งค่า
2. ค้นหาโมเดล GGUF ใน Hugging Face หรือป้อน URL โดยตรง หรือนำเข้าไฟล์ GGUF จากเครื่องของคุณ
3. ปรับพารามิเตอร์ (ขนาดบริบท อุณหภูมิ ค่าปรับ MTP การถ่ายโอน GPU ฯลฯ)
4. แตะ บันทึกการตั้งค่า จากนั้น แตะ บันทึกและปิด เพื่อโหลดโมเดล
5. คุณสามารถสร้างสำเนาสำรองโปรไฟล์เพื่อกู้คืนในภายหลังได้ (ไม่บังคับ)
What's new in the latest 1.590
- API server keeps running during screen-off / low-power state, with auto-restart and preserved state
- Fixed shutdown-related issues; more stable large-model loading (mmap), clearer crash messages, new profiles: default / Chat / Vision
ข้อมูล LLM AI Server with llama.cpp APK
LLM AI Server with llama.cpp รุ่นเก่า
การดาวน์โหลดที่รวดเร็วและปลอดภัยเป็นพิเศษผ่านแอป APKPure
คลิกเพียงครั้งเดียวเพื่อติดตั้งไฟล์ XAPK/APK บน Android!






