Last updated
    llama.cpp
    หนังสือ

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023
    ชุมชน

    ภาพรวม

    เมื่อวันที่ 10 มีนาคม 2023 Georgi Gerganov ได้พุชคอมมิตแรกของ llama.cpp ไปยัง GitHub ไลบรารีที่เขียนด้วยภาษา C และ C++ นี้มีเป้าหมายเดียวคือ รันโมเดล LLaMA ของ Meta บน CPU ของแล็ปท็อปโดยไม่ต้องใช้ GPU ภายในไม่กี่สัปดาห์ มันได้รับดาวนับพันและชุมชนนักพัฒนาที่กำลังขยายขีดความสามารถของมันต่อไป

    นวัตกรรมหลักคือ quantization โดยการบีบอัดน้ำหนักของโมเดลจาก floating point 32 บิตเป็นจำนวนเต็ม 4 หรือ 8 บิตโดยใช้รูปแบบ GGUF ทำให้ llama.cpp ลดความต้องการหน่วยความจำลง 75 เปอร์เซ็นต์หรือมากกว่า โมเดลที่มีพารามิเตอร์ 7 พันล้านตัวที่ต้องใช้ VRAM 28 GB บน GPU สามารถรันได้ใน RAM ระบบต่ำกว่า 6 GB รูปแบบ GGUF ยังรวม tokenizer, vocabulary และ chat template ไว้ในไฟล์เดียว ทำให้การแจกจ่ายโมเดลง่ายขึ้น

    llama.cpp รองรับฮาร์ดแวร์ที่หลากหลายผิดปกติ: CPU x86 พร้อม AVX2, Apple Silicon ผ่าน Metal, GPU NVIDIA พร้อม CUDA, GPU AMD พร้อม hipBLAS, GPU Intel พร้อม SYCL และแม้แต่ Vulkan โปรเจกต์นี้มาพร้อมกับเครื่องมือบรรทัดคำสั่งสำหรับการสร้าง การวัดประสิทธิภาพ และการแปลงโมเดล รวมถึงเซิร์ฟเวอร์ HTTP น้ำหนักเบา ในปี 2025 มีผู้มีส่วนร่วมกว่า 900 คนและ 69,000 ดาวบน GitHub เครื่องมืออย่าง Ollama และ LM Studio สร้างขึ้นบน llama.cpp โดยตรง ทำให้การอนุมาน LLM ในเครื่องเข้าถึงได้สำหรับผู้ใช้ที่ไม่เชี่ยวชาญด้านเทคนิค ไลบรารีนี้ได้กลายเป็นมาตรฐานโดยพฤตินัยสำหรับการรันโมเดลภาษาขนาดใหญ่บนฮาร์ดแวร์สำหรับผู้บริโภค ทำให้สามารถทดลอง AI แบบส่วนตัวและคุ้มค่าโดยไม่ต้องพึ่งพาคลาวด์

    คำสำคัญ

    llama.cppGGUFการหาปริมาณLLM ในเครื่องการอนุมานโอเพนซอร์สGeorgi Gerganovการอนุมานบน CPUการเรียนรู้ของเครื่อง

    ข้อมูลหนังสือ

    ผู้แต่ง
    Georgi Gerganov, Diego Devesa
    ตีพิมพ์
    2023-03-10
    ผู้แต่ง
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    ลิงก์

    เข้าร่วมชุมชน

    แฟนกำลังพูดคุย