
Os 7 principais modelos de linguagem pequena que você pode executar em um laptop computer (clique para ampliar)
Imagem do autor
Introdução
A IA poderosa agora é executada em {hardware} de consumo. Os modelos abordados aqui funcionam em laptops padrão e oferecem resultados de nível de produção para tarefas especializadas. Você precisará aceitar os termos de licença e autenticar-se para alguns downloads (especialmente Llama e Gemma), mas assim que tiver os pesos, tudo será executado localmente.
Este guia cobre sete modelos práticos de linguagem pequena, classificados por adequação ao caso de uso, em vez de pontuações de benchmark. Cada um deles foi comprovado em implantações reais e todos podem ser executados em {hardware} que você provavelmente já possui.
Observação: Modelos pequenos enviam revisões frequentes (novos pesos, novos limites de contexto, novas tags). Este artigo se concentra em qual modelo família escolher; verifique o cartão modelo oficial/Ollama página para a variante atual, termos de licença e configuração de contexto antes da implantação.
1. Phi-3.5 Mini (parâmetros 3.8B)
O Phi-3.5 Mini da Microsoft é a melhor escolha para desenvolvedores que criam sistemas de geração aumentada de recuperação (RAG) em {hardware} native. Lançado em agosto de 2024, é amplamente utilizado para aplicações que precisam processar documentos longos sem chamadas de API na nuvem.
Capacidade de longo contexto em um espaço pequeno. Phi-3.5 Mini lida com entradas muito longas (solicitações do tamanho de um livro dependendo da variante/tempo de execução), o que o torna uma ótima opção para RAG e fluxos de trabalho com muitos documentos. Muitos modelos 7B atingem o máximo em contextos padrão muito mais curtos. Algumas variantes empacotadas (incluindo o padrão phi3.5 tags na biblioteca de Ollama) usam contexto mais curto por padrão — verifique as variantes/configurações específicas antes de confiar no contexto máximo.
Melhor para: Raciocínio de contexto longo (leitura de PDFs, documentação técnica) · Geração e depuração de código · Aplicativos RAG onde você precisa referenciar grandes quantidades de texto · Tarefas multilíngues
{Hardware}: Quantizado (4 bits) requer 6 a ten GB de RAM para prompts típicos (mais para contextos muito longos) · Precisão complete (16 bits) requer 16 GB de RAM · Recomendado: qualquer laptop computer moderno com 16 GB de RAM
Baixe / execute localmente: Obtenha os pesos oficiais do Phi-3.5 Mini Instruct em Abraçando o rosto (microsoft/Phi-3.5-mini-instruct) e siga o cartão de modelo para o tempo de execução recomendado. Se você usar o Ollama, obtenha o modelo da família Phi 3.5 e verifique a variante/configurações na página do modelo Ollama antes de confiar no contexto máximo. (ollama pull phi3.5)
2. Lhama 3.2 3B
O Llama 3.2 3B da Meta é versátil. Ele lida bem com o acompanhamento de instruções gerais, faz ajustes finos com facilidade e é executado com rapidez suficiente para aplicativos interativos. Se você não tiver certeza de qual modelo começar, comece aqui.
Equilíbrio. Não é o melhor em nenhuma tarefa, mas é bom o suficiente em tudo. Meta suporta 8 idiomas (inglês, alemão, francês, italiano, português, hindi, espanhol, tailandês), com dados de treinamento cobrindo mais. O forte seguimento de instruções o torna versátil.
Melhor para: Bate-papo geral e perguntas e respostas · Resumo de documentos · Classificação de texto · Automação de suporte ao cliente
{Hardware}: Quantizado (4 bits) requer 6 GB de RAM · Precisão complete (16 bits) requer 12 GB de RAM · Recomendado: mínimo de 8 GB de RAM para desempenho suave
Baixe / execute localmente: Disponível em Abraçando o rosto sob o meta-llama org (Instrução Llama 3.2 3B). Você precisará aceitar os termos de licença do Meta (e pode precisar de autenticação dependendo de suas ferramentas). Para Ollama, puxe a tag 3B: ollama pull llama3.2:3b.
3. Lhama 3.2 1B
A versão 1B troca alguma capacidade por extrema eficiência. Este é o modelo que você implanta quando precisa de IA em dispositivos móveis, servidores de borda ou qualquer ambiente onde os recursos são escassos.
Ele pode funcionar em telefones. Um modelo quantizado de 1B cabe em 2 a 3 GB de memória, tornando-o prático para inferência no dispositivo onde a privacidade ou a conectividade de rede são importantes. O desempenho no mundo actual depende do tempo de execução e da temperatura do dispositivo, mas smartphones de última geração podem lidar com isso.
Melhor para: Tarefas simples de classificação · Perguntas e respostas básicas sobre domínios restritos · Análise de log e extração de dados · Implantação móvel e de IoT
{Hardware}: Quantizado (4 bits) requer 2 a 4 GB de RAM · Precisão complete (16 bits) requer 4 a 6 GB de RAM · Recomendado: pode ser executado em smartphones de última geração
Baixe / execute localmente: Disponível em Abraçando o rosto sob o meta-llama org (Instrução Lhama 3.2 1B). A aceitação/autenticação da licença pode ser necessária para obtain. Para Ollama: ollama pull llama3.2:1b.
4. Ministério 3 8B
A Mistral AI lançou o Ministral 3 8B como seu modelo de ponta, projetado para implantações onde você precisa de desempenho máximo em espaço mínimo. É competitivo com modelos maiores da classe 13B em tarefas práticas, ao mesmo tempo que permanece eficiente o suficiente para laptops.
Forte eficiência para implantações de borda. A linha Ministral é ajustada para oferecer alta qualidade com baixa latência em {hardware} de consumo, tornando-a uma opção prática de “modelo pequeno de produção” quando você deseja mais capacidade do que os modelos da classe 3B. Ele usa atenção de consulta agrupada e outras otimizações para oferecer forte desempenho com contagem de parâmetros de 8B.
Melhor para: Tarefas complexas de raciocínio · Conversas múltiplas · Geração de código · Tarefas que exigem compreensão diferenciada
{Hardware}: Quantizado (4 bits) requer 10 GB de RAM · Precisão complete (16 bits) requer 20 GB de RAM · Recomendado: 16 GB de RAM para uso confortável
Baixe / execute localmente: A família “Ministral” possui vários lançamentos com licenças diferentes. Quanto mais velho Ministral-8B-Instruct-2410 os pesos estão sob a licença de pesquisa Mistral. As versões mais recentes do Ministral 3 são Apache 2.0 e são preferidos para projetos comerciais. Para uma execução native mais direta, use a tag oficial do Ollama: ollama pull ministral-3:8b (pode exigir uma versão recente do Ollama) e consulte a página do modelo do Ollama para obter os detalhes exatos da variante/licença.
5.Qwen 2.5 7B
O Qwen 2.5 7B do Alibaba domina os benchmarks de codificação e raciocínio matemático. Se o seu caso de uso envolve geração de código, análise de dados ou resolução de problemas matemáticos, este modelo supera os concorrentes em sua classe de tamanho.
Especialização de domínio. Qwen foi treinado com grande ênfase em código e conteúdo técnico. Ele entende padrões de programação, pode depurar código e gerar soluções funcionais de forma mais confiável do que modelos de uso geral.
Melhor para: Geração e conclusão de código · Raciocínio matemático · Documentação técnica · Tarefas multilíngues (especialmente chinês/inglês)
{Hardware}: Quantizado (4 bits) requer 8 GB de RAM · Precisão complete (16 bits) requer 16 GB de RAM · Recomendado: 12 GB de RAM para melhor desempenho
Baixe / execute localmente: Disponível em Abraçando o rosto sob o Qwen org (instrução Qwen 2.5 7B). Para Ollama, extraia a variante marcada com instrução: ollama pull qwen2.5:7b-instruct.
6. Gema 2 9B
O Gemma 2 9B do Google ultrapassa os limites do que pode ser qualificado como “pequeno”. Com parâmetros 9B, é o modelo mais pesado da lista, mas é competitivo com os modelos da classe 13B em muitos benchmarks. Use-o quando precisar da melhor qualidade que seu laptop computer pode suportar.
Segurança e seguimento de instruções. Gemma 2 foi treinada com extenso trabalho de filtragem e alinhamento de segurança. Ele recusa solicitações prejudiciais de forma mais confiável do que outros modelos e segue instruções complexas e de várias etapas com precisão.
Melhor para: Seguimento de instruções complexas · Tarefas que exigem manuseio cuidadoso de segurança · Conhecimento geral, perguntas e respostas · Moderação de conteúdo
{Hardware}: Quantizado (4 bits) requer 12 GB de RAM · Precisão complete (16 bits) requer 24 GB de RAM · Recomendado: mais de 16 GB de RAM para uso em produção
Baixe / execute localmente: Disponível em Abraçando o rosto sob o google org (Gemma 2 9B TI). Você precisará aceitar os termos de licença do Google (e pode precisar de autenticação dependendo das suas ferramentas). Para Ollama: ollama pull gemma2:9b-instruct-*. Ollama fornece tags de base e de instrução. Escolha aquele que corresponde ao seu caso de uso.
7.SmolLM2 1.7B
O SmolLM2 da Hugging Face é um dos menores modelos aqui, projetado para experimentação e aprendizado rápidos. Não está pronto para produção para tarefas complexas, mas é perfeito para prototipagem, teste de pipelines e compreensão de como modelos pequenos se comportam.
Rapidez e acessibilidade. O SmolLM2 é executado em segundos, tornando-o ultimate para iteração rápida durante o desenvolvimento. Use-o para testar seu pipeline de ajuste fino antes de dimensionar para modelos maiores.
Melhor para: Prototipagem rápida · Aprendizagem e experimentação · Tarefas simples de PNL (análise de sentimento, categorização) · Projetos educacionais
{Hardware}: Quantizado (4 bits) requer 4 GB de RAM · Precisão complete (16 bits) requer 6 GB de RAM · Recomendado: funciona em qualquer laptop computer moderno
Baixe / execute localmente: Disponível em Abraçando o rosto sob HuggingFaceTB (Instrução SmolLM2 1.7B). Para Ollama: ollama pull smollm2.
Escolhendo o modelo certo
O modelo que você escolher depende de suas restrições e requisitos. Para processamento de contexto longo, escolha Phi-3.5 Mini com seu suporte de contexto muito longo. Se você está apenas começando, o Llama 3.2 3B oferece versatilidade e documentação robusta. Para implantação móvel e de borda, o Llama 3.2 1B ocupa o menor espaço ocupado. Quando você precisar de qualidade máxima em um laptop computer, escolha Ministral 3 8B ou Gemma 2 9B. Se você estiver trabalhando com código, Qwen 2.5 7B é o especialista em codificação. Para prototipagem rápida, o SmolLM2 1.7B oferece a iteração mais rápida.
Você pode executar todos esses modelos localmente assim que tiver os pesos. Algumas famílias (principalmente Llama e Gemma) são fechadas; você precisará aceitar os termos e poderá precisar de um token de acesso, dependendo do seu conjunto de ferramentas de obtain. As variantes do modelo e os padrões de tempo de execução mudam frequentemente, portanto, trate o cartão de modelo oficial/página Ollama como a fonte da verdade para a licença atual, configuração de contexto e quantização recomendada. Construções quantizadas podem ser implantadas com lhama.cpp ou tempos de execução semelhantes.
A barreira para executar IA em seu próprio {hardware} nunca foi tão baixa. Escolha um modelo, passe uma tarde testando-o em seu caso de uso actual e veja o que é possível.