Pi için yapılandırma, özelleştirme, platform kurulumu ve API referansları.

llama.cpp

Pi, llama.cpp yönlendirici sunucusunu destekler. Yönlendirici birden fazla GGUF modeli keşfeder ve bunları isteğe bağlı olarak yükler veya kaldırır.

Yönlendirici desteğine sahip güncel bir llama.cpp yapı kullanın. build instructions'yi takip edin veya platformunuz için bir prebuilt release yükleyin.

Yönlendiriciyi başlat

llama-server'yi --model veya -m olmadan başlatın. Bir modelin iletilmesi, yönlendirici modu yerine tek model modunu başlatır.

llama-server \
  --models-dir ~/models \
  --no-models-autoload \
  --jinja \
  --host 127.0.0.1 \
  --port 8080 \
  -ngl 999 \
  -c 32768

Önemli seçenekler:

  • --models-dir ~/models yerel GGUF dosyalarını keşfeder.
  • --no-models-autoload /llama aracılığıyla açık bir şekilde yüklenmeye devam ediyor.
  • --jinja uyumlu sohbet şablonlarını ve araç aramayı etkinleştirir.
  • -ngl 999 GPU'ya mümkün olduğu kadar çok katmanı aktarır.
  • -c 32768 yüklü her model için bağlam penceresini ayarlar. Önemli ölçüde daha fazla bellek gerektirebilecek modelin yerel bağlamını kullanmak için bunu atlayın.

Tek dosyalı bir model doğrudan model dizininde bulunabilir. Çok modlu ve çok parçalı modelleri ayrı alt dizinlere yerleştirin:

~/models/
├── llama-3.2-1b-Q4_K_M.gguf
├── gemma-3-4b-it-Q4_K_M/
│   ├── gemma-3-4b-it-Q4_K_M.gguf
│   └── mmproj-F16.gguf
└── large-model-Q4_K_M/
    ├── large-model-Q4_K_M-00001-of-00003.gguf
    ├── large-model-Q4_K_M-00002-of-00003.gguf
    └── large-model-Q4_K_M-00003-of-00003.gguf

Dosyaları manuel olarak ekledikten sonra yönlendiriciyi yeniden başlatın. Model başına bağlam boyutları ve diğer seçenekler için llama.cpp model presets kullanın.

Yapılandır Pi

Pi uygulamasını başlatın ve sağlayıcıyı yapılandırın:

/login llama.cpp

Yönlendiricinin URL'sini ve isteğe bağlı olarak API key girin. Varsayılan URL http://127.0.0.1:8080'dir.

Ortam değişkenleri aynı değerleri /login olmadan yapılandırabilir:

export LLAMA_BASE_URL=http://127.0.0.1:8080
export LLAMA_API_KEY=optional-secret
pi

Sunucu API key kullanıyorsa, llama-server'yi eşleşen --api-key değeriyle başlatın. Yalnızca yerel erişim için --host 127.0.0.1'yi saklayın.

Modelleri yönet

Koşmak:

/llama
  • Yüklemek için yüklenmemiş bir model seçin.
  • Kaldırmak için yüklü bir modeli seçin.
  • Modeli indir…'i seçin, Hugging Face'yi arayın, ardından bir depo ve niceleme seçin. Tam owner/repository[:quant] değerleri de işe yarar.
  • İptal işlemini onaylamak için yükleme veya indirme sırasında Escape tuşuna basın.

Hugging Face arama, ayarlandığında HF_TOKEN'yi kullanır, ardından $HF_TOKEN_PATH, $HF_HOME/token, $XDG_CACHE_HOME/huggingface/token ve ~/.cache/huggingface/token'yi kontrol eder. Arama, daha düşük hız sınırlarına tabi olarak kimlik doğrulaması olmadan da çalışır. Pi kapılı depoları indirmeden önce uyarır ve erişim sayfalarına bağlantılar verir. İndirmeyi llama.cpp sunucusu gerçekleştirir, bu nedenle seçilen depo erişim gerektirdiğinde işleminde de HF_TOKEN bulunmalıdır.

Başka modeller yüklüyse Pi önce bunları mı boşaltacağınızı yoksa yüklü halde mi tutacağınızı sorar. Pi modelleri sessizce boşaltmaz ve model dosyalarını asla silmez. Yönlendirici diğer istemcilerle paylaşılabilir, dolayısıyla /llama her zaman yönlendiricinin mevcut durumunu görüntüler.

/model'de yalnızca yüklü modeller görünür. Bir modeli yükledikten sonra, geçerli Pi oturumu için seçmek üzere /model komutunu çalıştırın.

Yönlendiricinin bağlantısı kesilirse /llama, Yeniden Dene ve Kapat'ı gösterir. Yeniden dene, kesintiye uğrayan işlemi tekrar yürütmeden model durumunu yeniden bağlar ve yeniler.

Sorun giderme

Yönlendiricinin erişilebilir olup olmadığını kontrol edin:

curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/models
  • /llama'da model yok: --models-dir dizin düzenini kontrol edin ve yönlendiriciyi yeniden başlatın.
  • /model modelinde eksik: Önce /llama ile yükleyin.
  • Yükleme başarısız oluyor veya çok fazla bellek kullanıyor: -c değerini düşürün veya başka bir modeli kaldırın.
  • Sunucu yönlendirici modunda değil: --model, -m veya -hf olmadan başlatın.