llama.cpp
Pi suporta o servidor roteador llama.cpp. O roteador descobre vários modelos GGUF e os carrega ou descarrega sob demanda.
Use uma versão llama.cpp atual com suporte para roteador. Siga o build instructions ou instale um prebuilt release para sua plataforma.
Inicie o roteador
Comece llama-server sem --model ou -m. A passagem de um modelo inicia o modo de modelo único em vez do modo roteador.
llama-server \
--models-dir ~/models \
--no-models-autoload \
--jinja \
--host 127.0.0.1 \
--port 8080 \
-ngl 999 \
-c 32768Opções importantes:
--models-dir ~/modelsdescobre arquivos GGUF locais.--no-models-autoloadcontinua carregando explícito até/llama.--jinjapermite modelos de bate-papo compatíveis e chamadas de ferramentas.-ngl 999descarrega tantas camadas quanto possível para a GPU.-c 32768define a janela de contexto para cada modelo carregado. Omita-o para usar o contexto nativo do modelo, o que pode exigir substancialmente mais memória.
Um modelo de arquivo único pode ficar diretamente no diretório do modelo. Coloque modelos multimodais e multifragmentos em subdiretórios separados:
~/models/
├── llama-3.2-1b-Q4_K_M.gguf
├── gemma-3-4b-it-Q4_K_M/
│ ├── gemma-3-4b-it-Q4_K_M.gguf
│ └── mmproj-F16.gguf
└── large-model-Q4_K_M/
├── large-model-Q4_K_M-00001-of-00003.gguf
├── large-model-Q4_K_M-00002-of-00003.gguf
└── large-model-Q4_K_M-00003-of-00003.ggufReinicie o roteador após adicionar arquivos manualmente. Para tamanhos de contexto por modelo e outras opções, use llama.cpp model presets.
Configurar Pi
Inicie Pi e configure o provedor:
/login llama.cppInsira o URL do roteador e opcional API key. O URL padrão é http://127.0.0.1:8080.
Variáveis de ambiente podem configurar os mesmos valores sem /login:
export LLAMA_BASE_URL=http://127.0.0.1:8080
export LLAMA_API_KEY=optional-secret
piSe o servidor usar API key, inicie llama-server com o valor --api-key correspondente. Mantenha --host 127.0.0.1 para acesso somente local.
Gerenciar modelos
Correr:
/llama- Selecione um modelo descarregado para carregá-lo.
- Selecione um modelo carregado para descarregá-lo.
- Selecione Baixar modelo…, pesquise Hugging Face e escolha um repositório e quantização. Os valores
owner/repository[:quant]exatos também funcionam. - Pressione Escape durante um carregamento ou download para confirmar o cancelamento.
A pesquisa Hugging Face usa HF_TOKEN quando definida e verifica $HF_TOKEN_PATH, $HF_HOME/token, $XDG_CACHE_HOME/huggingface/token e ~/.cache/huggingface/token. A pesquisa também funciona sem autenticação, sujeita a limites de taxas mais baixos. Pi avisa antes de baixar repositórios bloqueados e links para sua página de acesso. O servidor llama.cpp realiza o download, portanto seu processo também deverá ter HF_TOKEN quando o repositório selecionado necessitar de acesso.
Se outros modelos estiverem carregados, Pi pergunta se deve descarregá-los primeiro ou mantê-los carregados. Pi não descarrega modelos silenciosamente e nunca exclui arquivos de modelo. O roteador pode ser compartilhado com outros clientes, portanto /llama sempre exibe o estado atual do roteador.
Apenas modelos carregados aparecem em /model. Após carregar um modelo, execute /model para selecioná-lo para a sessão Pi atual.
Se o roteador for desconectado, /llama mostrará Tentar novamente e Fechar. A nova tentativa reconecta e atualiza o estado do modelo sem repetir a operação interrompida.
Solução de problemas
Verifique se o roteador está acessível:
curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/models- Nenhum modelo em
/llama: Verifique--models-dir, o layout do diretório, e reinicie o roteador. - Modelo ausente em
/model: Carregue-o com/llamaprimeiro. - O carregamento falha ou usa muita memória: Reduza
-cou descarregue outro modelo. - O servidor não está no modo roteador: Inicie-o sem
--model,-mou-hf.