Este weblog foi escrito em conjunto por Md Rahman, Arkaprabho Ghosh, Navin Bilwar e Desh Shukla.
Sumário executivo
A TI da Cisco avaliou recentemente modelos de incorporação de ajuste fino usando a receita de ajuste fino NVIDIA Nemotron RAG como parte de um esforço para melhorar a precisão da recuperação de dados corporativos específicos de domínio. O objetivo não period redesenhar os sistemas existentes de geração aumentada de recuperação (RAG), mas entender se o ajuste fino de incorporação direcionado poderia melhorar materialmente a qualidade da pesquisa semântica com esforço razoável e resposta rápida. Através deste experimento, a Cisco conseguiu validar em primeira mão que a incorporação do ajuste fino, combinada com a geração de dados sintéticos, pode proporcionar ganhos mensuráveis de precisão em um curto espaço de tempo. O experimento também demonstrou um forte tempo de obtenção de valor, permitindo iteração rápida e sinais claros de desempenho sem longos ciclos de treinamento ou rotulagem guide extensa. O tempo de espera reduzido de apenas alguns dias para compreender os benefícios imediatos foi um resultado elementary desta colaboração.
O fluxo de trabalho de treinamento e avaliação do modelo de incorporação foi executado em Cisco AI PODs executando a infraestrutura Cisco UCS 885A com tecnologia da plataforma NVIDIA HGX.
Declaração do problema
Antes de conduzir esse experimento, a Cisco realizou experimentos de ajuste fino de incorporação semelhantes usando modelos de geração anterior e infraestrutura de menor escala. Esses esforços anteriores exigiam um ajuste guide significativo de hiperparâmetros, como tamanho do lote e número de épocas, e os resultados eram muitas vezes difíceis de estabilizar. Os ciclos de iteração eram longos, tornando um desafio explorar diferentes configurações ou escalar experimentos. Apesar de algumas melhorias localizadas, a pesquisa por palavra-chave continuou necessária para muitos cenários de recuperação de domínios específicos. Também não havia um fluxo de trabalho padronizado e completo que as equipes de engenharia pudessem executar rapidamente e avaliar de forma consistente em todas as execuções. Muitas vezes, estes esforços levariam semanas a meses de esforço guide para obter ganhos incertos.
Como foi o ajuste fino e tempo para avaliar
Neste experimento, a Cisco usou a receita de ajuste fino incorporada do NVIDIA NeMo Retriever, aproveitando a geração de dados sintéticos para produzir sinais de treinamento a partir de corpora existentes. A receita passa por cinco estágios distintos: geração de dados sintéticos (SDG), preparação de dados com mineração fortemente negativa, ajuste fino contrastivo, avaliação BEIR e exportação do modelo ONNX. O fluxo de trabalho foi executado de ponta a ponta com êxito. Todos os experimentos foram executados em uma única GPU NVIDIA H200 de 143 GB hospedada em Cisco AI Pods criados em sistemas Cisco UCS 885A. O ajuste fino é concluído poucas horas após o treinamento, permitindo experimentação rápida em vários tamanhos e configurações de conjuntos de dados. O uso da geração de dados sintéticos eliminou a necessidade de rotulagem guide, reduzindo significativamente a sobrecarga. Essa abordagem permitiu que a Cisco iterasse rapidamente, observasse antecipadamente as tendências de desempenho e validasse se a incorporação de ajustes finos valia a pena investir mais. O tempo geral de obtenção de valor foi substancialmente menor do que os esforços anteriores, com insights significativos obtidos após apenas um pequeno número de execuções.
A arquitetura do pipeline de cinco estágios:

Tempos baseados em aproximadamente 925 documentos / aproximadamente 9.200 pares de controle de qualidade / aproximadamente 7.800 exemplos de treinamento em uma única GPU NVIDIA H200 executada em Cisco AI Pods com infraestrutura Cisco UCS 885A. A duração actual é escalonada com o quantity de dados.
Ganhos de precisão observados
Em vários experimentos, os resultados mostraram melhorias consistentes e mensuráveis. O ajuste fino do modelo NV-EmbedQA de 1 bilhão de parâmetros da NVIDIA em dados sintéticos específicos de domínio rendeu ganhos em todas as métricas de recuperação, com ganhos NDCG@1 de +7,1 a +7,3 pontos absolutos (+9,9% a +11,1% relativos). O Recall@10 melhorou em até +6,8 pontos (+8,5%) e o MAP@10 em até +6,5 pontos (+9,7%). Usando um LLM native de 120B de parâmetros para geração de dados sintéticos, todo o pipeline foi executado sem custos externos de API e com os dados permanecendo completamente no native, garantindo a privacidade dos dados. Esses ganhos se mantiveram mesmo quando o tamanho do conjunto de dados aumentou e as tarefas de recuperação se tornaram mais desafiadoras. É importante ressaltar que melhorias foram observadas em consultas específicas de domínio que anteriormente apresentavam desempenho insatisfatório com modelos de incorporação de base. Embora estes resultados representem uma linha de base inicial em vez de um resultado totalmente otimizado, eles forneceram uma forte confirmação de que a incorporação do ajuste fino pode melhorar significativamente a qualidade da recuperação de dados específicos da empresa.
Resumo dos experimentos

Tabela 1. Comparação do desempenho de recuperação entre o modelo de incorporação de base e o modelo contrastantemente ajustado em dois tamanhos de conjunto de dados (334 e 925 documentos). O ajuste fino melhora consistentemente a qualidade da classificação em todas as métricas de avaliação BEIR.
Principais observações:
- O ajuste fino melhorou consistentemente a qualidade de recuperação em todas as métricas.
- NDCG@1 apresentou a maior melhoria na relevância de nível superior.
- Os ganhos permaneceram estáveis nos dois tamanhos de conjuntos de dados (334 e 925 documentos).
- Ganhos aprimorados de Recall@10 e Map@10, indicativos de melhor cobertura e classificação do que o modelo de incorporação básico.
O que nos surpreendeu
A descoberta mais inesperada foi a rapidez com que a receita produziu resultados acionáveis. Poucos dias após o início do experimento, obtivemos melhorias mensuráveis na precisão – um forte contraste com os esforços anteriores que levaram semanas ou meses. A abordagem de geração de dados sintéticos produziu sinais de treinamento de qualidade suficiente para gerar ganhos significativos sem um único exemplo rotulado manualmente. Também ficamos surpresos com o quão bem as melhorias foram generalizadas entre os tipos de consulta, incluindo as consultas de identificador de token raro que historicamente foram o ponto mais fraco para a pesquisa semântica.
Próximas etapas com engajamento
Com base nesses resultados, a Cisco continuará trabalhando com a NVIDIA para aumentar sistematicamente a precisão. A próxima fase do trabalho vai focar sobre:
- Usando uma avaliação fixa definida em execuções para que as métricas vai ser diretamente comparável
- Afinação a taxa de aprendizagem (tentando padrão, metade e duplo) e aumentando épocas de 3 a 5
- Dimensionamento dados de treinamento para aproximadamente 100 mil pares de controle de qualidade para encontrar o ponto de saturação do domínio
- Usando um LLM maior ou de qualidade superior para geração de dados sintéticos para melhorar a fidelidade do par de controle de qualidade
- Candidatura Aquecimento de 10% com decaimento de cosseno para convergência mais estável
- Aumentando mineração de negativos fortes de 5 a ten negativos por consulta para um sinal contrastante mais forte
- Refino a geração de dados sintéticos solicita uma melhor ênfase em termos raros e específicos de domínio – IDs de bugs, identificadores de produtos, versões de firmware – onde os modelos básicos têm mais dificuldades
- Explorando treinamento com reconhecimento de pedaços: usando pedaços de documentos reais de um banco de dados de vetores de produção como corpus de recuperação, gerando perguntas contra esses pedaços por meio do LLM e mapeando cada pergunta para seu pedaço positivo e pedaços negativos – treinando o modelo na mesma distribuição de dados que ele vai encontrar na produção, onde as respostas talvez enterrado em textos mais longos e estratégias de agrupamento irá variar
A longo prazo, o envolvimento irá expandir incluir ajuste fino de reclassificação e otimização de recuperação mais ampla como parte de um esforço completo de melhoria do RAG de ponta a ponta.
Valor do modelo de incorporação de ajuste fino
Este experimento confirma que o aproveitamento de um modelo de incorporação de ajuste fino pode acelerar o tempo de produção, fornecendo um fluxo de trabalho de ajuste fino validado e de ponta a ponta que oferece melhorias mensuráveis em dias, em vez de meses. As ideias e descobertas deste trabalho estão moldando ativamente a evolução da receita, enquanto a Cisco obtém acesso antecipado a um pipeline maduro que encurta o caminho da experimentação à produção. O trabalho também demonstra como os Cisco AI Pods baseados em sistemas Cisco UCS 885A e GPUs NVIDIA H200 podem fornecer uma base de infraestrutura empresarial eficaz para rápida adaptação do modelo de incorporação.
Principais benefícios do modelo de incorporação de ajuste fino para empresas
- Proteja dados proprietários (execução native)
- Reduza os custos de suporte (resolução mais rápida, menos escalonamentos)
- Sem dependência de API na nuvem (zero custos externos)
- Valorização rápida (pipeline completo de ponta a ponta — todos os 5 estágios, incluindo ODS, mineração, treinamento, avaliação e exportação — concluído em 2 a 5 horas em uma única GPU)
Principais benefícios do modelo de incorporação de ajuste fino para desenvolvedores
- Nenhuma anotação guide necessária (geração de dados sintéticos)
- Arquitetura modular e hackeável (5 estágios distintos: ODS → Preparação de dados → Ajuste fino → Avaliar → Exportar)
- Saídas prontas para produção (exportação ONNX)
- Avaliação integrada (BEIR — Benchmarking Data Retrieval — framework)
- Mineração negativa forte incluída (aumento automático de qualidade)
Comece
A receita de ajuste fino para Lhama Nemotron Incorporar 1B O modelo está disponível agora como um pipeline completo e pronto para produção. Esteja você criando pesquisa corporativa, aplicativos RAG ou sistemas de recuperação específicos de domínio, esta receita fornece um caminho claro desde documentos brutos até incorporações implementadas e adaptadas ao domínio.
Pronto para ajustar seu próprio modelo de incorporação?
👉 Discover a receita de ajuste fino do Nemotron Embed no GitHub