As empresas precisam saber exatamente o que seus sistemas detectam e essa definição deve permanecer consistente ao longo do tempo. Escrever uma definição suficientemente precisa para resolver todos os casos difíceis tem sido impraticável há muito tempo porque os anotadores humanos não conseguem manter um documento tão detalhado na memória de trabalho. Em nosso artigo de pesquisa, Definições de segurança de fonte única, substituímos o intérprete humano por IA e mostramos que os LLMs podem reter, aplicar e manter especificações por muito mais tempo e de forma mais precisa do que qualquer anotador, tornando a própria definição a única fonte de verdade para classificação, rotulagem, reciclagem e explicações voltadas para o cliente. Para nosso portfólio de produtos Cisco AI Protection, estamos migrando toda a nossa taxonomia de segurança para esse modelo que prioriza a IA. Também estendemos esta abordagem além das classificações de segurança, como mostrado em Definindo a proveniência do modelo: uma constituição para segurança e proteção da cadeia de suprimentos de IA.
Cisco Estrutura integrada de segurança e proteção de IA organiza as ameaças que as empresas enfrentam ao implantar inteligência synthetic (IA): conteúdo prejudicial, sequestro de metas, violações de privacidade de dados, explorações de espaço de ação e ataques persistentes. Cada ameaça de nível superior se divide em técnicas, e cada técnica precisa de uma definição suficientemente precisa para que um classificador, um anotador, um cliente e um revisor de conformidade cheguem à mesma decisão sobre a mesma entrada. As taxonomias existentes, entre elas a nossa, ainda não produziram tal definição para uma grande parte dessas técnicas (assédio, discurso de ódio, fuga de presos e outras), e a descrição honesta de como elas são decididas na prática vem da concordância do juiz Potter Stewart em Jacobellis v.378 US 184 (1964): Eu sei disso quando vejo. Um juiz pode decidir um caso de cada vez, mas uma barreira que sinaliza milhares de conversas por hora não pode debater cada caso limítrofe ou esperar pelo consenso social. Sem uma especificação escrita, não podemos medir o desempenho, explicar um sinalizador a um cliente ou garantir que o mesmo caso seja decidido da mesma forma de um mês para o outro.
A ciência da anotação reconhece dois caminhos (Röttger et al., 2022). O descritivo path aceita que pessoas razoáveis discordem e trata a variação como um sinal, que se adapta aos humanos, mas não produz nenhuma especificação estável. O prescritivo path escreve regras detalhadas o suficiente para que diferentes leitores convirjam, mas até recentemente period impraticável: julgar a longa cauda de casos extremos ultrapassa a capacidade de qualquer equipe e o documento resultante transborda o que um anotador pode conter na memória de trabalho. Os modelos de linguagem de grande porte (LLMs) de fronteira mudam a economia ao reler uma especificação de 300 linhas em cada classificação e dimensionar a adjudicação para volumes de produção, e quando dois modelos de fornecedores diferentes discordam sob a mesma especificação, a discordância localiza a sentença que ainda é ambígua e nos permite validar através de um patch direcionado em vez de um debate aberto.
Uma única fonte de verdade, impulsionada de ponta a ponta pela IA
IA Constitucional da Antrópica mostraram que um documento em linguagem pure pode funcionar como uma especificação executável, e sua Classificadores Constitucionais estendeu a ideia para filtragem de segurança destilando uma constituição em dados de treinamento sintéticos para um classificador ajustado. Estendemos o termo para uma especificação operacional por técnica: um documento de mais de 300 linhas para cada técnica na estrutura de segurança e proteção de IA da Cisco, com elementos necessários, um fluxograma de decisão, regras de limites contra técnicas adjacentes, exemplos trabalhados e decisões acumuladas de casos extremos. Nós o tratamos como a única fonte de verdade que cada processo downstream julga, incluindo classificação de tempo de execução (o LLM lê o documento completo em cada chamada), geração de dados sintéticos para reciclagem, diretrizes de rotulagem, documentação voltada para o cliente e mapeamentos de conformidade.
Em nosso fluxo de trabalho, o papel humano se reduz a uma pergunta: o que essa técnica deveria significar, respondida por um especialista no assunto que outline a intenção e o escopo e depois delega todo o resto à IA. A IA elabora a constituição a partir da fonte taxonômica, rotula as conversas de produção, diagnostica onde os modelos de fronteira discordam, propõe correções às seções responsáveis e audita as constituições em busca de contradições e lacunas. O especialista analisa os patches e os aceita, modifica ou rejeita, sem rotular manualmente as conversas ou manter o documento completo na memória.
Também introduzimos uma formulação de eixo duplo que os classificadores de segurança anteriores não produzem. Intenção captura se o usuário tentou causar danos por meio desta técnica. Contente capta se materials nocivo para esta técnica apareceu na conversa. Intenção sem conteúdo significa que o modelo foi investigado e recusado. O conteúdo sem intenção expõe o mau comportamento do modelo em uma solicitação benigna. Ambos positivos marcam uma falha de proteção, e ambos negativos cobrem conversas limpas, incluindo discussões sobre um tópico. Pontuamos ambos os eixos durante toda a conversa, já que os ataques multiturno constroem a intenção gradualmente.
Os LLMs são realmente melhores avaliadores?
Avaliamos três técnicas (assédio, crime não violento, discurso de ódio) usando seis LLMs de três fornecedores. Nas conversas do WildChat, dois LLMs de fronteira que leem uma definição em nível de parágrafo discordam em até 66 conversas por 1.000; segundo a Constituição, isso cai abaixo de 3 por 1.000, uma redução de até 57x. No HarmBench, três LLMs de fronteira que leem uma constituição alcançam rótulos de intenção unânime com mais frequência do que três humanos lendo o mesmo documento.


Casos não unânimes por 1.000 conversas no HarmBench (quanto menor, melhor). Avaliadores LLM: GPT-5.4, Opus 4.6, Gemini 3.1, cada um lendo a mesma constituição que os humanos receberam.
Atribuímos as falhas humanas a duas causas. Um documento com mais de 300 linhas excede a memória de trabalho, então os anotadores comprimem as regras escritas em heurísticas lembradas e recorrem à intuição. Eles também transformam taxonomias multitécnicas em triagem de rótulo único, arquivando uma conversa sob uma técnica irmã em vez de avaliar cada constituição de forma independente. Os LLMs evitam ambas as falhas relendo o documento completo a cada chamada e julgando cada técnica isoladamente. Suas falhas restantes aplicam mal a lógica de decisão de maneiras que podemos rastrear até seções específicas, enquanto as falhas humanas ignoram silenciosamente as regras. Esperamos que a lacuna aumente: as constituições crescem à medida que novos casos extremos se acumulam, a memória de trabalho humana permanece fixa e o seguimento de instruções de modelo, a extensão do contexto e o raciocínio continuam melhorando.
O desacordo residual entre os modelos de fronteira deixa de ser um ruído para rejeitar. Cada caso restante aponta para uma frase específica que é ambígua ou incompleta, e o nosso ciclo de refinamento converte essa frase numa decisão explícita.
O que isso significa para os clientes do Cisco AI Protection
Os clientes se preocupam menos com um número de pesquisa do que em saber por que o sistema tomou uma determinada decisão. Cada sinalizador rastreia uma regra específica em um documento legível: o classificador cita a regra que aplicou, os elementos que encontrou e as notas de limite que verificou e, quando não sinalizamos, o mesmo documento explica por que o caso ficou fora da linha. Num futuro próximo, os clientes poderão consultar esta especificação diretamente através de um assistente de IA, sem necessidade de serem especialistas numa categoria, e obter uma resposta em linguagem simples baseada no texto. O mesmo documento orienta a reciclagem, a rotulagem, o produto, a legalidade e a entrada no mercado, de modo que uma mudança de redação se espalha por toda parte a partir de uma única fonte. AI-first não é um slogan, mas uma mudança concreta na forma como construímos esses sistemas, mais rápidos, mais simples e mais precisos internamente e para nossos clientes.
Leia o artigo de pesquisa completo: Melhorando a consistência da rotulagem com definições constitucionais detalhadas e avaliação orientada por IA.