
llama.cpp
Georgi Gerganov, Diego Devesa
ภาพรวม
เมื่อวันที่ 10 มีนาคม 2023 Georgi Gerganov ได้พุชคอมมิตแรกของ llama.cpp ไปยัง GitHub ไลบรารีที่เขียนด้วยภาษา C และ C++ นี้มีเป้าหมายเดียวคือ รันโมเดล LLaMA ของ Meta บน CPU ของแล็ปท็อปโดยไม่ต้องใช้ GPU ภายในไม่กี่สัปดาห์ มันได้รับดาวนับพันและชุมชนนักพัฒนาที่กำลังขยายขีดความสามารถของมันต่อไป
นวัตกรรมหลักคือ quantization โดยการบีบอัดน้ำหนักของโมเดลจาก floating point 32 บิตเป็นจำนวนเต็ม 4 หรือ 8 บิตโดยใช้รูปแบบ GGUF ทำให้ llama.cpp ลดความต้องการหน่วยความจำลง 75 เปอร์เซ็นต์หรือมากกว่า โมเดลที่มีพารามิเตอร์ 7 พันล้านตัวที่ต้องใช้ VRAM 28 GB บน GPU สามารถรันได้ใน RAM ระบบต่ำกว่า 6 GB รูปแบบ GGUF ยังรวม tokenizer, vocabulary และ chat template ไว้ในไฟล์เดียว ทำให้การแจกจ่ายโมเดลง่ายขึ้น
llama.cpp รองรับฮาร์ดแวร์ที่หลากหลายผิดปกติ: CPU x86 พร้อม AVX2, Apple Silicon ผ่าน Metal, GPU NVIDIA พร้อม CUDA, GPU AMD พร้อม hipBLAS, GPU Intel พร้อม SYCL และแม้แต่ Vulkan โปรเจกต์นี้มาพร้อมกับเครื่องมือบรรทัดคำสั่งสำหรับการสร้าง การวัดประสิทธิภาพ และการแปลงโมเดล รวมถึงเซิร์ฟเวอร์ HTTP น้ำหนักเบา ในปี 2025 มีผู้มีส่วนร่วมกว่า 900 คนและ 69,000 ดาวบน GitHub เครื่องมืออย่าง Ollama และ LM Studio สร้างขึ้นบน llama.cpp โดยตรง ทำให้การอนุมาน LLM ในเครื่องเข้าถึงได้สำหรับผู้ใช้ที่ไม่เชี่ยวชาญด้านเทคนิค ไลบรารีนี้ได้กลายเป็นมาตรฐานโดยพฤตินัยสำหรับการรันโมเดลภาษาขนาดใหญ่บนฮาร์ดแวร์สำหรับผู้บริโภค ทำให้สามารถทดลอง AI แบบส่วนตัวและคุ้มค่าโดยไม่ต้องพึ่งพาคลาวด์
คำสำคัญ
ข้อมูลหนังสือ
- ผู้แต่ง
- Georgi Gerganov, Diego Devesa
- ตีพิมพ์
- 2023-03-10
- ผู้แต่ง
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
เข้าร่วมชุมชน
แฟนกำลังพูดคุย