CiscoEstrutura integrada de segurança e proteção de IAenosso trabalho recente na definição de constituições de taxonomiafocado na definição e detecção de riscos comuns compartilhados entre empresas ao implantar IA. No entanto, embora a maioria das empresas partilhe muitas categorias de risco comuns, elas também são diversas e é impossível desenvolver uma taxonomia completa que cubra totalmente todos os casos específicos do cliente. O assistente de IA de um banco de retalho, por exemplo, deveria responder “como funciona um 401(okay)”, mas ao abrigo das regras da SEC e da FINRA poderá não ser capaz de responder “devo transferir as minhas poupanças para fundos de índice” como aconselhamento de investimento personalizado. Escrever essa regra é uma tarefa de reflexão, e as ferramentas disponíveis no mercado para proteções personalizadas (menus suspensos de categoria fixa, campos de expressão common, uploaders de exemplos rotulados, caixas de parágrafos em branco) solicitam ao proprietário da apólice o trabalho que ele ainda não realizou.
Estamos introduzindo o Coverage Studio no Cisco AI Protection, um assistente de IA flexível que orienta o proprietário da política na criação de uma proteção personalizada. Em uma interface de bate-papo e revisão, o proprietário responde a insights: perguntas conceituais sobre o que a regra deveria significar, combinadas com evidências de seus próprios dados, como um gerente emitindo orientações em vez de editar um rascunho. O assistente transforma essa orientação em texto de política, refina-a em relação aos dados e publica o resultado no console de proteção do AI Protection para aplicação em tempo de execução.
Uma política que você pode ler
Uma proteção do Coverage Studio é um documento de política legível por humanos. Ele nomeia a conduta em questão, declara seus elementos, marca os limites da conduta adjacente e registra exemplos trabalhados para os casos encerrados. A conformidade lê, os auditores leem e, em tempo de execução, o modelo de linguagem lê para decidir cada caso. Modelámos o documento nas nossas constituições para riscos de segurança partilhados, que se baseiamIA Constitucionale execute mais de 300 linhas por técnica, com precisão suficiente para que vários modelos de fronteira retornem a mesma decisão na mesma entrada.
Uma política escrita é o artefato que as funções jurídicas, de conformidade e de auditoria do banco já utilizam. Um guarda-corpo personalizado não deve ser diferente.
Meta-promessa centrada no ser humano
O nosso trabalho constitucional mostrou que escrever uma política suficientemente precisa para ser aplicada em grande escala está além do que um autor humano não assistido pode razoavelmente fazer, por isso focamo-nos na meta-solicitação: usar a IA para criar a mensagem que outro modelo irá ler. Um guardrail personalizado é exatamente esse tipo de immediate, o immediate do sistema que o classificador de tempo de execução lê em cada solicitação e o Coverage Studio o cria. O trabalho estabelecido em meta-promting é automatizado: otimizadores do DSPy (Khattab et al., 2023) e OPRO (Yang et al., 2023) pegue um conjunto de dados rotulado e pesquise no espaço do immediate por uma string que reproduza os rótulos, e a literatura relata que esses métodos podem corresponder ou superar um humano editando o immediate diretamente quando o comportamento alvo já está estabelecido.
A criação de uma nova proteção personalizada não começa com uma política estabelecida. O proprietário da apólice elabora o limite entre aconselhamento versus educação durante a rotulagem e, como qualquer especialista que constrói um padrão pela primeira vez, sua leitura dele se torna mais nítida à medida que avança. Os rótulos registram um alvo em movimento e um immediate compilado diretamente deles herda o desvio.
Baseamo-nos nesta linha de trabalho e estendemo-la às políticas que ainda estão em formação, através de um agente de IA em vez de um pipeline fixo: o Coverage Studio analisa o rascunho em relação aos chats do banco, sinaliza as lacunas, enquadra as questões para o proprietário da política resolver e reescreve a política em cada resposta, para que o proprietário da política mantenha a direção e o agente lide com cada iteração.
Insights: perguntas estruturadas combinadas com evidências
Em uma sessão do Coverage Studio, o proprietário da política e o agente trabalham em níveis diferentes: o proprietário da política determine sobre questões gerais e o agente cuida dos bate-papos individuais e do rascunho do texto da política, uma camada abaixo. Chamamos cada problema geral de perception, e a resolução de um deles orienta a próxima reescrita do agente, fechando o ciclo de meta-solicitação. Os insights vêm de duas fontes e uma sessão se transfer continuamente entre elas.
As percepções textuais leem o rascunho atual e sinalizam lacunas, silêncios e cláusulas ambíguas que o proprietário da apólice não entenderia em uma releitura. Uma visão textual inicial na sessão do banco poderia ser:
Enquadramentos hipotéticos
O projecto precise proíbe recomendações, mas não aborda formulações hipotéticas como “se hoje investisse em obrigações…”. As orientações de conformidade normalmente tratam conselhos hipotéticos como conselhos.
Concordo · Discordo · Descarto
A pergunta nomeia a cláusula, o caso faltante e a decisão que o proprietário da apólice precisa tomar, e respondê-la não requer a leitura de um único bate-papo do cliente.
Os insights comportamentais vêm da comparação do rascunho atual com os bate-papos de produção do banco e do agrupamento das decisões pelo caminho de raciocínio que as produziu. Cada grupo é um padrão que o rascunho exibe, mostrado ao lado de casos representativos:
Aconselhamento implícito através de comparações de mercado · FN · 31 casos
O projecto precise permite respostas que comparam os retornos históricos entre courses de activos (“os fundos de índice superaram a gestão activa desde 2000”), apesar de orientar o leitor para uma escolha de investimento específica.
Concordo · Discordo · Dispensar · Ver conversas
O proprietário da política responde no nível do padrão. Uma única resposta se aplica a todas as conversas do grupo e, após a próxima reescrita, aos casos que ainda não vimos. Um perception respondido muda a forma como a política é escrita. Um rótulo altera um exemplo. O esforço do titular da apólice aumenta com o número de julgamentos distintos na apólice, não com o quantity de casos. Uma política com dez decisões distintas assume a ordem de dez insights resolvidos, quer o banco traga setenta chats ou setenta mil.
A análise textual detecta lacunas que os dados não podem revelar, porque os casos que a política já tornou impossível de observar nunca entram nos dados. A análise comportamental capta suposições silenciosas que o proprietário da apólice não sabia que estavam fazendo. A execução de ambos na mesma sessão torna a apólice legível, primeiro para o proprietário da apólice e depois para um auditor que analisa o trabalho do banco.
Implantando uma política escrita em tempo de execução
A política que o proprietário escreve é a política executada. Modelos de segurança com reconhecimento de política de código aberto leem uma política de linguagem pure na inferência, mostrada pela primeira vez pelo Llama Guard da Meta (Inan et al., 2023) e desde então confirmado pelo ShieldGemma do Google (Zeng et al., 2024), Aegis Security Guard da NVIDIA (Ghosh et al., 2024) e OpenAIgpt-oss-salvaguarda. Em nosso próprio trabalho sobre constituição (LINK ARXiv PRÓXIMO), descobrimos que um modelo de código aberto de tamanho razoável interpreta uma constituição quase tão precisamente quanto modelos de fronteira de código fechado, para que as empresas possam executar uma política escrita em produção sem uma API hospedada. O Coverage Studio publica o documento diretamente no Cisco AI Protection para aplicação em modelos e aplicativos.
O que isso significa para os clientes do Cisco AI Protection
Essa camada de aplicação é a mesma em que nossas taxonomias de segurança publicadas são executadas, e criamos ambas com o mesmo padrão AI-first. As constituições fornecem aos clientes uma especificação na qual eles podem confiar sem escrevê-la, e o Coverage Studio permite que eles a estendam com as regras que só eles podem escrever, em uma sessão que mais parece redigir um documento com um advogado do que preencher um formulário. O proprietário da política que outline a regra é quem a escreve, e a regra executada na produção é a regra que ele escreveu. Nosso objetivo é publicar uma descrição técnica do sistema em nosso próximo trabalho.

IU de bate-papo e revisão do Coverage Studio