Quão seguros são os modelos gpt-oss-safeguard?


Os modelos de linguagem grande (LLMs) tornaram-se ferramentas essenciais para as organizações, com modelos de peso aberto que fornecem controle e flexibilidade adicionais para personalizar modelos para seus casos de uso específicos. No ano passado, a OpenAI lançou sua série gpt-oss, incluindo padrão e, pouco depois, salvaguarda variantes, focadas em tarefas de classificação de segurança. Decidimos avaliar sua postura de segurança bruta em relação às informações adversárias – especificamente, injeção imediata e fuga de presos técnicas que usam procedimentos como manipulação de contexto e codificação para contornar as barreiras de segurança e extrair conteúdo proibido. Avaliamos quatro configurações gpt-oss em um ambiente de caixa preta: os modelos padrão 20b e 120b junto com os equivalentes de salvaguarda 20b e 120b.

Nossos testes revelaram duas descobertas críticas: as variantes de proteção fornecem melhorias de segurança inconsistentes em relação aos modelos padrão, enquanto o tamanho do modelo emerge como o determinante mais forte da resiliência básica aos ataques. OpenAI declarou em seu lançamento gpt-oss-safeguard weblog que “classificadores de segurança, que distinguem conteúdo seguro de inseguro em uma área de risco específica, têm sido há muito tempo uma camada primária de defesa para nossos próprios e outros grandes modelos de linguagem”. A empresa desenvolveu e implantou um “Razão de Segurança” em gpt-oss-safeguard que classifica os resultados do modelo e determina a melhor forma de responder.

Observe: essas avaliações focaram exclusivamente em modelos básicos, sem proteções em nível de aplicativo, prompts personalizados, filtragem de saída, limitação de taxa ou outras salvaguardas de produção. Como resultado, as descobertas refletem o comportamento no nível do modelo e servem como base. As implantações no mundo actual com controles de segurança em camadas normalmente alcançam uma menor exposição ao risco.

Avaliando a segurança do modelo gpt-oss

Nossos testes incluíram ataques baseados em prompts de turno único e interações multiturno mais complexas, projetadas para explorar técnicas de refinamento iterativas. Rastreamos taxas de sucesso de ataque (ASR) em uma ampla gama de técnicas, subtécnicas e procedimentos alinhados com o Cisco Taxonomia de segurança e proteção de IA.

Os resultados revelam uma imagem diferenciada: modelos maiores demonstram uma resiliência inerente mais forte, com a variante padrão gpt-oss-120b alcançando o ASR geral mais baixo. Descobrimos que os mecanismos gpt-oss-safeguard proporcionam benefícios mistos em cenários de turno único e fazem pouco para enfrentar a ameaça dominante: ataques multi-turno.

A análise comparativa de vulnerabilidade (Figura 1 abaixo) indica taxas gerais de sucesso de ataque nos quatro modelos gpt-oss. Nossas principais observações incluem:

  • O modelo padrão 120b supera outros em resistência de volta única;
  • variantes do gpt-oss-safeguard às vezes introduzem complexidade explorável, o que significa aumento da vulnerabilidade em certos cenários de ataque em comparação com modelos padrão; e
  • Cenários multivoltas causam aumentos dramáticos de ASR (5x–8,5x), destacando a construção de contexto como um ponto fraco crítico.

Quão seguros são os modelos gpt-oss-safeguard?Quão seguros são os modelos gpt-oss-safeguard?

Figura 1. Taxa geral de sucesso de ataques por modelo agrupado por modelos padrão versus modelos de salvaguarda

Principais descobertas

Os ataques multivoltas continuam sendo o principal modo de falha em todas as variantes, com taxas de sucesso aumentando acentuadamente quando um invasor adversário pode refinar os prompts em diversas trocas. A Figura 2 abaixo mostra as disparidades na taxa de sucesso de ataque entre avisos de turno único e múltiplos. Os aumentos específicos nas variantes do modelo que testamos incluem:

  • gpt-oss-120b: 7,24% → 61,22% (8,5x)
  • gpt-oss-20b: 14,17% → 79,59% (5,6x)
  • gpt-oss-safeguard-120b: 12,33% → 78,57% (6,4x)
  • gpt-oss-safeguard-20b: 17,55% → 91,84% (5,2x)

Figura 2. Análise comparativa de vulnerabilidade mostrando taxas de sucesso de ataques em modelos testados para cenários de turno único e de vários turnos.

As áreas específicas onde os modelos carecem consistentemente de resistência contra nossos procedimentos de teste incluem codificação de exploração, manipulação de contexto e diversidade de procedimentos. A Figura 3 abaixo destaca os 10 procedimentos de ataque mais eficazes contra esses modelos:

Figura 3. Os 10 principais procedimentos de ataque agrupados por modelo

A análise processual indica que modelos maiores (120b) tendem a ter melhor desempenho em todas as categorias, embora certos métodos de codificação e relacionados ao contexto mantenham eficácia mesmo contra versões gpt-oss-safeguard. No geral, a escala do modelo parece contribuir mais para a robustez de volta única do que o ajuste de salvaguarda adicional nestes testes.

Figura 4. Mapa térmico de sucesso de ataque por subtécnica e modelo

Essas descobertas ressaltam que nenhuma variante de modelo fornece proteção autônoma adequada, especialmente em casos de uso de conversação.

Conforme afirmado no início deste submit, os modelos gpt-oss-safeguard não são pretendido para uso nas configurações de bate-papo. Em vez disso, esses modelos destinam-se a casos de uso de segurança, como filtragem de entrada-saída LLM, rotulagem de conteúdo on-line e rotulagem offline para casos de uso de confiança e segurança. OpenAI recomenda usando os modelos gpt-oss originais para chat ou outros casos de uso interativos.

No entanto, como modelos de peso aberto, as variantes gpt-oss e gpt-oss-safeguard podem ser implementadas livremente em qualquer configuração, incluindo interfaces de chat. Atores maliciosos podem baixar esses modelos, ajustá-los para remover totalmente as recusas de segurança ou implantá-los em aplicativos de conversação, independentemente das recomendações da OpenAI. Ao contrário dos modelos baseados em API, onde a OpenAI mantém o controle e pode implementar mitigações ou revogar o acesso, as versões de peso aberto exigem a inclusão intencional de mecanismos de segurança e proteções adicionais.

Avaliamos os modelos gpt-oss-safeguard em cenários de ataque conversacional porque qualquer pessoa pode implantá-los dessa forma, apesar de não ser o caso de uso pretendido. Os resultados que observamos em nossa análise refletem o desafio basic de segurança colocado pelos lançamentos de modelos abertos, onde o uso remaining não pode ser controlado ou monitorado.

Recomendações para implantação segura

Como afirmamos em nosso anterior análise de modelos de peso abertoa seleção de modelos por si só não pode fornecer segurança adequada e que os modelos básicos ajustados com a segurança em mente ainda exigem controles defensivos em camadas para proteger contra adversários determinados que podem refinar ataques iterativamente ou explorar a acessibilidade aberta.

Este é precisamente o desafio que o Cisco AI Protection foi criado para enfrentar. O AI Protection fornece a proteção abrangente e em várias camadas que as implantações modernas de LLM exigem. Ao combinar a identificação avançada de vulnerabilidades de modelos e aplicativos, como aquelas usadas em nossa avaliação, e a filtragem de conteúdo em tempo de execução, o AI Protection fornece proteção independente de modelo, desde a cadeia de suprimentos até o desenvolvimento e a implantação.

As organizações que implementam o gpt-oss devem adotar uma estratégia de defesa profunda em vez de depender apenas da escolha do modelo:

  • Seleção de modelo: Ao avaliar modelos de peso aberto, priorize o tamanho do modelo e a abordagem de alinhamento do laboratório. Nossa pesquisa anterior em oito modelos de peso aberto mostrou que as estratégias de alinhamento impactam significativamente a segurança: modelos com protocolos de segurança integrados mais fortes demonstram resistência de volta única e múltipla mais equilibrada, enquanto modelos focados em capacidade mostram lacunas de vulnerabilidade mais amplas. Especificamente para gpt-ossgpt-oss, a variante padrão 120b oferece maior resiliência de volta única, mas nenhum modelo de peso aberto, independentemente do tamanho ou ajuste de alinhamento, fornece proteção multivoltas adequada sem a implementação de controles adicionais.
  • Proteções em camadas: Implemente monitoramento de conversas em tempo actual, análise de contexto, filtragem de conteúdo para procedimentos conhecidos de alto risco, limitação de taxa e detecção de anomalias.
  • Tmitigações específicas de ameaças: Priorize a detecção dos principais procedimentos de ataque (por exemplo, truques de codificação, refinamento iterativo) e subtécnicas de alto risco.
  • Avaliação contínua: Conduza equipes regulares, rastreie técnicas emergentes e incorpore atualizações de modelos.

As equipes de segurança devem ver a implantação do LLM como um desafio contínuo de segurança que exige avaliação, monitoramento e adaptação contínuos. Ao compreender as vulnerabilidades específicas dos modelos escolhidos e implementar estratégias de defesa adequadas, as organizações podem reduzir significativamente a sua exposição ao risco, ao mesmo tempo que aproveitam as capacidades poderosas que os LLMs modernos fornecem.

Conclusão

Nossa análise abrangente de segurança dos modelos gpt-oss revela um cenário de segurança complexo moldado tanto pelo design do modelo quanto pelas realidades de implantação. Embora as variantes gpt-oss-safeguard tenham sido projetadas especificamente para classificação de conteúdo baseada em políticas, em vez de resistência ao jailbreak conversacional, sua natureza aberta significa que podem ser implantadas em configurações de bate-papo, independentemente da intenção do design.

À medida que as organizações continuam a adotar LLMs para aplicações críticas, estas descobertas sublinham a importância de uma avaliação de segurança abrangente e de estratégias de defesa multicamadas. A postura de segurança de um LLM não é determinada por um único fator. O tamanho do modelo, os mecanismos de segurança e a arquitetura de implantação desempenham papéis consideráveis ​​no desempenho de um modelo. As organizações devem utilizar estas conclusões para informar as suas decisões de arquitetura de segurança, reconhecendo que a segurança ao nível do modelo é apenas um componente de uma estratégia de defesa abrangente.

Nota Remaining sobre Interpretação:

As descobertas desta análise representam a postura de segurança dos modelos básicos testados isoladamente. Quando esses modelos são implantados em aplicativos com controles de segurança adequados — incluindo validação de entrada, filtragem de saída, limitação de taxa e monitoramento — as taxas reais de sucesso de ataque provavelmente serão significativamente mais baixas do que as relatadas aqui.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *