llama.cpp
Pi, llama.cpp yönlendirici sunucusunu destekler. Yönlendirici birden fazla GGUF modeli keşfeder ve bunları isteğe bağlı olarak yükler veya kaldırır.
Yönlendirici desteğine sahip güncel bir llama.cpp yapı kullanın. build instructions'yi takip edin veya platformunuz için bir prebuilt release yükleyin.
Yönlendiriciyi başlat
llama-server'yi --model veya -m olmadan başlatın. Bir modelin iletilmesi, yönlendirici modu yerine tek model modunu başlatır.
llama-server \
--models-dir ~/models \
--no-models-autoload \
--jinja \
--host 127.0.0.1 \
--port 8080 \
-ngl 999 \
-c 32768Önemli seçenekler:
--models-dir ~/modelsyerel GGUF dosyalarını keşfeder.--no-models-autoload/llamaaracılığıyla açık bir şekilde yüklenmeye devam ediyor.--jinjauyumlu sohbet şablonlarını ve araç aramayı etkinleştirir.-ngl 999GPU'ya mümkün olduğu kadar çok katmanı aktarır.-c 32768yüklü her model için bağlam penceresini ayarlar. Önemli ölçüde daha fazla bellek gerektirebilecek modelin yerel bağlamını kullanmak için bunu atlayın.
Tek dosyalı bir model doğrudan model dizininde bulunabilir. Çok modlu ve çok parçalı modelleri ayrı alt dizinlere yerleştirin:
~/models/
├── llama-3.2-1b-Q4_K_M.gguf
├── gemma-3-4b-it-Q4_K_M/
│ ├── gemma-3-4b-it-Q4_K_M.gguf
│ └── mmproj-F16.gguf
└── large-model-Q4_K_M/
├── large-model-Q4_K_M-00001-of-00003.gguf
├── large-model-Q4_K_M-00002-of-00003.gguf
└── large-model-Q4_K_M-00003-of-00003.ggufDosyaları manuel olarak ekledikten sonra yönlendiriciyi yeniden başlatın. Model başına bağlam boyutları ve diğer seçenekler için llama.cpp model presets kullanın.
Yapılandır Pi
Pi uygulamasını başlatın ve sağlayıcıyı yapılandırın:
/login llama.cppYönlendiricinin URL'sini ve isteğe bağlı olarak API key girin. Varsayılan URL http://127.0.0.1:8080'dir.
Ortam değişkenleri aynı değerleri /login olmadan yapılandırabilir:
export LLAMA_BASE_URL=http://127.0.0.1:8080
export LLAMA_API_KEY=optional-secret
piSunucu API key kullanıyorsa, llama-server'yi eşleşen --api-key değeriyle başlatın. Yalnızca yerel erişim için --host 127.0.0.1'yi saklayın.
Modelleri yönet
Koşmak:
/llama- Yüklemek için yüklenmemiş bir model seçin.
- Kaldırmak için yüklü bir modeli seçin.
- Modeli indir…'i seçin, Hugging Face'yi arayın, ardından bir depo ve niceleme seçin. Tam
owner/repository[:quant]değerleri de işe yarar. - İptal işlemini onaylamak için yükleme veya indirme sırasında Escape tuşuna basın.
Hugging Face arama, ayarlandığında HF_TOKEN'yi kullanır, ardından $HF_TOKEN_PATH, $HF_HOME/token, $XDG_CACHE_HOME/huggingface/token ve ~/.cache/huggingface/token'yi kontrol eder. Arama, daha düşük hız sınırlarına tabi olarak kimlik doğrulaması olmadan da çalışır. Pi kapılı depoları indirmeden önce uyarır ve erişim sayfalarına bağlantılar verir. İndirmeyi llama.cpp sunucusu gerçekleştirir, bu nedenle seçilen depo erişim gerektirdiğinde işleminde de HF_TOKEN bulunmalıdır.
Başka modeller yüklüyse Pi önce bunları mı boşaltacağınızı yoksa yüklü halde mi tutacağınızı sorar. Pi modelleri sessizce boşaltmaz ve model dosyalarını asla silmez. Yönlendirici diğer istemcilerle paylaşılabilir, dolayısıyla /llama her zaman yönlendiricinin mevcut durumunu görüntüler.
/model'de yalnızca yüklü modeller görünür. Bir modeli yükledikten sonra, geçerli Pi oturumu için seçmek üzere /model komutunu çalıştırın.
Yönlendiricinin bağlantısı kesilirse /llama, Yeniden Dene ve Kapat'ı gösterir. Yeniden dene, kesintiye uğrayan işlemi tekrar yürütmeden model durumunu yeniden bağlar ve yeniler.
Sorun giderme
Yönlendiricinin erişilebilir olup olmadığını kontrol edin:
curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/models/llama'da model yok:--models-dirdizin düzenini kontrol edin ve yönlendiriciyi yeniden başlatın./modelmodelinde eksik: Önce/llamaile yükleyin.- Yükleme başarısız oluyor veya çok fazla bellek kullanıyor:
-cdeğerini düşürün veya başka bir modeli kaldırın. - Sunucu yönlendirici modunda değil:
--model,-mveya-hfolmadan başlatın.