Uma especificação aberta para avaliação de segurança agente
Na period da IA, a verdadeira virada de jogo é mais do que o LLM mais recente, é como você o coloca para funcionar. É por isso que estamos abrindo o código-fonte do Especificações de segurança da fundição, um projeto testado em batalha para construir um sistema de avaliação de segurança de agentes. Como a estrutura é independente de modelo e de pilha, as organizações podem construir um equipamento que se adapte ao seu ambiente exclusivo. Ao compartilhar o que aprendemos, nosso objetivo é ajudar a comunidade de defensores a se mover de maneira mais rápida e inteligente. Ele permite que as organizações mudem de alertas barulhentos para descobertas de segurança verificáveis que geram impacto.
O modelo operacional de segurança cibernética mudou fundamentalmente. À medida que os modelos de IA de ponta criam um novo desafio de dupla frente, os invasores agora identificam vulnerabilidades na velocidade das máquinas, deixando as equipes de segurança lutando para acompanhar os processos manuais e legados. Na Cisco, reconhecemos que o antigo ciclo de “localizar e corrigir” já não é suficiente para lidar com esta nova velocidade de risco. No entanto, o verdadeiro potencial destes modelos só é concretizado quando combinamos o equipamento certo – os agentes e a orquestração – com os profissionais qualificados que os conduzem. Ao ir além dos ganhos incrementais de produtividade para repensar como encontramos e corrigimos vulnerabilidades em escala, estamos apresentando a Foundry Safety Spec como uma oportunidade crítica para capacitar nossas equipes e ajudar a inclinar a balança a favor dos defensores. Este trabalho da Cisco é baseado em lições aprendidas e recursos desenvolvidos por meio de esforços avançados de engenharia de segurança em nossa equipe de segurança interna.
Foundry Safety Spec deve ser usado com Equipment de especificações do GitHubque é um conjunto de fluxos de trabalho de desenvolvimento orientados por especificações para todo o setor que pode ser usado com diferentes agentes de IA.
Foundry é publicada como dois artefatos principais e um conjunto de documentos de apoio:
- O artefato “especificação” – oito funções de agente central, cinco funções de extensão, o ciclo de vida de descoberta, o substrato de coordenação e aproximadamente 130 requisitos funcionais, cada um com uma justificativa em linha explicando por que ele existe.
- O artefato da “constituição” – onze princípios invioláveis. Cada um deles codifica uma falha actual de produção que enviamos, diagnosticamos e corrigimos.
O problema que a fundição resolve
Cada equipe de segurança com acesso a um LLM de fronteira tentou a mesma coisa pelo menos uma vez: lançar um repositório no modelo e pedir-lhe para “encontrar os bugs”. O resultado geralmente é uma parede de resultados ilimitados e inverificáveis que misturam insights precisos com descobertas alucinadas, sem nenhuma maneira de saber o que foi perdido ou quando você realmente terminou. Um sistema de agente completo como o Foundry Safety Spec é o antídoto para esse caos: ele envolve o modelo em orquestração, funções e proteções para que a detecção, a validação e a cobertura sejam projetadas antecipadamente, em vez de improvisadas em uma janela de bate-papo. A diferença é gritante – uma é uma demonstração interessante; o outro é um sistema de avaliação de segurança que você pode defender diante de seu CISO e de seus auditores.


As organizações estão investindo em segurança assistida por IA e recuperando descobertas alucinadas, falsos positivos em grande escala e nenhum sinal de cobertura. Foundry Safety Spec é a estrutura que transforma um LLM de fronteira de “uma demonstração interessante contra sua base de código” em um sistema de avaliação de segurança que produz:
- UM limitado, priorizado, verificável conjunto de descobertas.
- Um sinal claro de “pronto” e a conjunção de um piso de cobertura definido pelo operador e um limite de rendimento económico.
- Uma cadeia de proveniência auditável desde a detecção até a triagem, validação e publicação.
- Grades de segurança que pressupõem que o modelo, em algum momento, tentará fazer a coisa errada; e restrinja-o no substrato, não no immediate.
Se você possui um LLM de fronteira e um software program que está autorizado a avaliar, o Foundry fornece a forma do sistema que você precisa.
Como os defensores podem usar as especificações de segurança do Foundry para testar seu software program
A fundição foi projetada para ser recolhida e adaptada, e não consumida como está. É o ponto de partida da sua jornada de avaliação de segurança do agente. O fluxo fica assim:


- O Structure.md é lido pelo agente AI (como Claude Code, Codex ou outros) a serem usados para construir a infraestrutura. No entanto, também é deliberadamente escrito como prosa dirigida ao construtor e mantenedor humano, com o parágrafo “Por que isto é inviolável” de cada princípio explicando a falha de produção específica que a regra evita, de modo que quando um engenheiro é tentado a enfraquecer um princípio por conveniência, ele enfrenta o custo dessa decisão antes de tomá-la.
- Execute a semente através do equipment de especificações. A especificação é escrita para ser consumida por equipment de especificações. A “semente” refere-se à configuração inicial mínima que coloca seu projeto orientado por especificações em um estado conhecido e pronto para trabalhar, para que os agentes (ou desenvolvedores) de IA possam começar a fazer um trabalho útil de forma consistente.
- Agente de IA constrói a arquitetura. Cada uma das oito funções principais (Orquestrador, Indexador, Cartógrafo, Detector, Triager, Validador, Guia de Cobertura, Reporter) tem um propósito definido, entradas e saídas definidas e uma lista de requisitos funcionais com justificativa. Você pode implementá-los como loops de subprocessos, como pipelines baseados em gráficos, como funções sem servidor, como um equipamento personalizado. A forma é o que transfere; a implementação é sua.
- Emparelhe as especificações de segurança do Foundry com Projeto CodeGuard. A função Detector do Foundry Safety Spec consome um corpus de regras de detecção avaliadas pelo LLM. As regras são de Projeto CodeGuard, que a Cisco period de código aberto antes da existência do Foundry Safety Spec e doou para o Coalizão para IA Segura (CoSAI). O objetivo unique do Projeto CodeGuard é incorporar práticas seguras por padrão nos fluxos de trabalho do agente de codificação de IA. Ele fornece regras de segurança abrangentes e habilidades de agente que orientam os agentes de codificação de IA para gerar códigos mais seguros automaticamente. No entanto, também tem sido muito útil para revisão de código e para avaliações e testes de segurança autônomos.


O auto-aperfeiçoamento volante de detecção para prevenção:
- As regras do CodeGuard varrem todas as funções do seu alvo: sistemática, repetível, encontra o que já sabemos procurar.
- Os agentes exploratórios do Foundry Safety Spec caçam lado a lado: criativos, específicos para o alvo, encontram o que nenhuma regra ainda descreve.
- Quando exploração confirma algo que as regras perderam, o Foundry Safety Spec registra uma lacuna nas regras.
- A lacuna é generalizada em uma regra nova (ou revisada) do CodeGuard e chega ao corpus.
- A próxima varredura (neste alvo e em todos os alvos futuros) pega toda a classe na primeira passagem.
- Como as regras do CodeGuard são portáteis, o mesmo corpus é carregado em um assistente de codificação LLM como seu conjunto de regras de codificação segura. A classe de bug que sua última avaliação ensinou ao corpus a detectar agora é evitada ao pressionar uma tecla, em cada editor do desenvolvedor, antes que a próxima avaliação seja executada.
Cada volta do circuito melhora a detecção aqui e a prevenção em todos os lugares.
Um ótimo ponto de partida
Queremos ser muito explícitos sobre isso: Foundry Safety Spec é uma especificação inicial e de blueprint. Não é um scanner pronto para uso ou uma ferramenta única. É um exemplo de como é um sistema sólido de avaliação de segurança baseado em IA. Seu ambiente, seu modelo de ameaça e seus objetivos remodelarão partes dele. Isso é intencional. Em todos os lugares onde a semente pudesse ditar uma escolha ou deixá-la em aberto, nós a deixamos em aberto e explicamos a compensação.
Foundry Safety Spec é uma especificação de código aberto, não um serviço gerenciado. Como acontece com qualquer ferramenta de segurança, a responsabilidade pela implementação, supervisão e tomada de decisão last permanece com o usuário. Nós fornecemos o modelo para as grades de proteção, mas cabe a você garantir que o “humano no circuito” proceed sendo o árbitro last das decisões de segurança. Incentivamos os usuários a tratar isso como um componente basic do seu programa de governança de segurança existente.
Uma questão comum é se esta especificação se tornará obsoleta à medida que os LLMs evoluem. A resposta é que foi projetado para não ser. As especificações de segurança do Foundry são baseadas em requisitos e funções funcionais, não em parâmetros de modelo específicos. Quer você esteja usando os modelos de fronteira de hoje ou os agentes de raciocínio mais complexos de amanhã, a necessidade de um orquestrador, um detector e um validador permanecerá constante. A especificação foi projetada para ser o equipamento estável que mantém sua avaliação de segurança consistente, independentemente do “motor” subjacente.
Por que uma especificação e não a fonte?
Nossas implementações internas estão fortemente ligadas à infraestrutura da Cisco: nosso gateway LLM, nosso rastreador de problemas, nossa nuvem privada, and so on. O código aberto daria aos defensores algo que funcionasse exatamente em um ambiente. Não seria transferido.
Quais são as transferências projeto: quais funções você precisa e por quê, o que cada uma deve garantir, como as descobertas fluem da detecção até a publicação, o que “pronto” significa para uma avaliação, para onde vão os portões de qualidade e quais atalhos irão prejudicá-lo seis meses depois.
Uma contribuição genuína para a comunidade
Não dizemos isto levianamente: acreditamos que esta é uma das especificações mais substanciais que podem ajudar os defensores a testar o seu ambiente e software program. É o que as equipes de segurança que tentam usar um LLM de fronteira com responsabilidade estão atualmente tentando inventar por conta própria.
Combina com CodeGuard para formar um volante actual e móvel entre detecção (Especificações de segurança da fundição) e prevenção (CodeGuard contra habilidades no agente de codificação do seu desenvolvedor). Cada adoção fortalece o corpus. Cada atualização do corpus aumenta o nível para todos.
A segurança da nossa infraestrutura digital international é um esforço coletivo. Convidamos você a explorar as especificações de segurança do Foundry no GitHub, participar da conversa em nossos fóruns da comunidade e começar a construir seu próprio sistema de avaliação de segurança de agente. Visite nosso repositório em https://github.com/CiscoDevNet/foundry-security-spec https://github.com/CiscoDevNet/foundry para começar hoje.
Construa sobre isso. Adapte-o. Contribua para isso.