Invadindo uma GPU NVIDIA de nível de servidor em um desktop doméstico



Invadindo uma GPU NVIDIA de nível de servidor em um desktop doméstico

Qual é o problema com o {hardware} do computador ultimamente? Os preços da memória e do armazenamento atingiram níveis estratosféricos. Um Raspberry Pi 5 topo de linha agora custa mais de US$ 300. Nem pergunte sobre uma GPU – se precisar perguntar, provavelmente você não terá dinheiro para comprar uma. Com os dias de computadores de placa única de US$ 35 e RAM barata para trás, temos que começar a ser criativos novamente, como na época em que transformar roteadores Wi-Fi em computadores period uma grande coisa.

É isso que Oscar Molnar está fazendo, e isso lhe rendeu um bom negócio em uma GPU. Por cerca de US$ 250, ele comprou uma placa NVIDIA Tesla V100 SXM2 de 16 GB. O truque é que esta GPU foi extraído de um knowledge middle. Embora ainda tenha muita vida útil, está obsoleto para aplicações comerciais. Mas adaptar uma GPU de nível de servidor para uso doméstico não é fácil. Não há conector PCIe e o conector de alimentação também não é o que você esperaria.

O Tesla V100 SXM2 foi originalmente projetado para servidores NVIDIA DGX e sistemas de computação em hiperescala. Ao contrário de uma placa gráfica regular, ela se conecta a um soquete proprietário e depende de {hardware} de servidor especializado para alimentação, resfriamento e comunicação. Felizmente para Molnar, placas adaptadoras SXM2 para PCIe de terceiros estão disponíveis. Ao combinar um desses adaptadores com o V100 de segunda mão, ele conseguiu instalar a placa junto com seu RTX 4080 existente.

O V100 pode ser de 2017, mas ainda possui 16 GB de memória HBM2 e impressionantes 900 GB/s de largura de banda de memória. Na verdade, isso excede a largura de banda disponível em um RTX 4080 mais recente. Para cargas de trabalho de inferência de IA, onde a movimentação de pesos de modelos pela memória costuma ser o fator limitante, a largura de banda é muito mais importante do que muitas pessoas imaginam.

No entanto, ainda havia algum trabalho a ser feito para tornar esta GPU adequada para uso doméstico. A ventoinha de resfriamento do adaptador period tão barulhenta quanto um aspirador de pó – Molnar mediu a configuração padrão em 82 dB. Após algumas experiências, ele descobriu que a ventoinha usava sinais de controle PWM padrão, apesar de seu conector incomum. Alguns jumpers e um cabo personalizado permitiram que a ventoinha fosse conectada diretamente ao conector da placa-mãe, reduzindo drasticamente o ruído e mantendo as temperaturas abaixo de 50°C sob carga.

Com ambas as GPUs instaladas, o sistema de Molnar agora possui 32 GB de VRAM combinado. Usando a divisão de tensores em llama.cpp, grandes modelos de linguagem podem ser distribuídos em ambos os dispositivos. Em um teste, um modelo Qwen3.6 quantizado de 27 bilhões de parâmetros com uma janela de contexto de 128.000 tokens alcançou 32 tokens por segundo durante a inferência.

A configuração do software program exigiu alguns hackers, principalmente porque os drivers NVIDIA mais recentes abandonaram o suporte para a arquitetura Volta usada pelo V100. Ao fixar versões específicas de driver, kernel e CUDA no NixOS, Molnar conseguiu fazer com que o RTX 4080 e o V100 funcionassem juntos de maneira confiável.

Esse tipo de projeto certamente não é para todos, mas é um bom lembrete de que, se você estiver disposto a ser criativo, ainda poderá obter bastante poder de computação por um preço razoável.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *