llama.cpp
Motor de inferência em C/C++ para LLMs em CPU e GPU, com formato GGUF e quantização.
Visão geral
Motor de inferência em C/C++ para LLMs em CPU e GPU, com formato GGUF e quantização.
- Categoria
- Execução de LLMs · Ferramentas de IA
- Plataformas
- Linux, macOS, Windows, Somente API
- Preço
- Grátis
- Licença
- MIT
- Código-fonte
- ggml-org/llama.cpp
- Estrelas no repositório
- 128.722
- API
- Sem descrição pública de API
Histórico de versões
Atualizado há 1 dia10 versões nos últimos 12 meses.
-
b11030
-
b11033
-
b11034
-
b11035
-
b11036
-
b11037
O que os usuários dizem
Nenhuma avaliação ainda
As notas aparecem quando chegarem avaliações verificadas. Até lá, o ranking usa apenas sinais públicos: atualização de versões e adoção do repositório.
Alternativas ao llama.cpp
Ver todas as alternativas Ollama
3
93,8
=
Runtime para baixar e executar modelos de linguagem localmente, com CLI e API REST.
Atualizado há 2 dias
vLLM
22
91,3
=
Motor de serviço de LLMs com alta vazão, paged attention e servidor compatível com a API da OpenAI.
Atualizado há 2 dias
LocalAI
54
89,1
=
API auto-hospedada compatível com a OpenAI que roda modelos de texto, imagem e áudio em hardware local.
Atualizado há 2 dias