SkillOpt: Habilidades do agente como parâmetros treináveis


SkillOpt: Habilidades do agente como parâmetros treináveis

De relance

  • Os agentes de IA muitas vezes falham porque suas instruções, ou habilidades, são modificadas manualmente, sem garantia de melhoria. SkillOpt transforma a edição de habilidades em um processo de treinamento, tornando o comportamento do agente mais confiável sem alterar os pesos do modelo.
  • SkillOpt trata um arquivo de habilidades do agente como um parâmetro treinável fora de um modelo de destino congelado, transformando a escrita de habilidades de uma solicitação única em um processo de otimização controlado.
  • Em seis benchmarks, sete modelos alvo e três modos de execução, o SkillOpt é o melhor método ou o melhor empatado em todas as 52 células de avaliação, melhorando o desempenho sem atualizar os pesos do modelo.
  • O SkillOpt mantém as habilidades compactas e auditáveis ​​por meio de edições de texto limitadas, controle de validação, suggestions de edição rejeitada e atualizações lentas/meta, evitando desvios imediatos descontrolados.
  • As habilidades otimizadas são transferidas entre escalas de modelos, recursos de agentes e tarefas relacionadas, sugerindo que elas capturam conhecimento de fluxo de trabalho reutilizável em vez de instruções específicas de benchmark.

Grandes modelos de linguagem (LLMs) são cada vez mais implantados como agentes que coletam evidências, chamam ferramentas e executam tarefas de várias etapas. Para esses agentes, o problema difícil não é mais saber se eles conseguem chamar uma ferramenta, mas se conseguem concluir tarefas de maneira confiável e consistente. Hoje, as habilidades dos agentes normalmente vêm de três fontes: os especialistas as escrevem à mão, um modelo de fronteira as gera de uma só vez ou o agente as revisa vagamente após a execução. Nenhuma dessas abordagens se comporta como um otimizador de aprendizado profundo. Eles não possuem controle de tamanho de etapa, validação prolongada e qualquer memória de revisões que falharam. Como resultado, as habilidades tendem a crescer e se desviar a cada reescrita, e uma revisão que parece perfeitamente razoável pode degradar silenciosamente o desempenho actual da tarefa. Essa evolução descontrolada de habilidades tornou-se um grande obstáculo no caminho do protótipo do agente até a implantação confiável em nível de produção.

Em nosso artigo recente, SkillOpt: Estratégia Executiva para Habilidades de Agente em Autoevoluçãoreformulamos a questão de “como podemos escrever um immediate melhor?” para “como treinamos a habilidade?” SkillOpt trata o arquivo de habilidades como um parâmetro treinável fora de um modelo de destino congelado, trazendo um ciclo de otimização de estilo de treinamento, ganhos consistentes em 52 células de avaliação e um arquivo de habilidades compacto que permanece legível, auditável e transferível.

Figura 1. Um modelo de destino congelado executa tarefas enquanto um modelo otimizador separado treina a camada de habilidade a partir do feedback de trajetória, exportando o arquivo de habilidade reutilizável best_skill.md por meio do gate de validação.
Figura 1. Um modelo de destino congelado executa tarefas enquanto um modelo otimizador separado treina a camada de habilidade a partir do suggestions de trajetória, exportando o arquivo de habilidade reutilizável best_skill.md por meio do gate de validação.

Como funciona o SkillOpt

SkillOpt organiza a edição de habilidades como um ciclo de atualização para frente e para trás no espaço de texto. No passe direto, o modelo alvo congelado executa um lote de tarefas de treinamento com a habilidade atual; o tamanho do lote de implementação controla a quantidade de evidências que cada atualização recebe. Na passagem para trás, um modelo otimizador separado lê as trajetórias resultantes em minilotes de reflexão, destilando padrões para preservar de trajetórias bem-sucedidas e padrões para corrigir falhas.

Na etapa de atualização, o otimizador propõe pequenas edições de adição, exclusão e substituição; as edições dos candidatos são mescladas, desduplicadas, classificadas e cortadas por uma taxa de aprendizagem textual – um orçamento de edição por etapa. Cada habilidade candidata deve então passar por um portão de validação estrito: ela é adotada somente se obtiver uma pontuação estritamente superior à habilidade atual na divisão de validação retida. As edições rejeitadas não são descartadas; eles entram em um buffer de edição rejeitada que serve como suggestions negativo para chamadas posteriores do otimizador na mesma época. Em uma cadência mais lenta, uma meta atualização lenta/época consolida lições de horizonte mais longo que lotes únicos não podem revelar (Figura 2). Juntos, as edições limitadas, o controle de validação e a seleção da melhor versão mantêm a otimização de habilidades controlável e auditável, para que a habilidade convirja em vez de flutuar.

Figura 2. O pipeline SkillOpt: coleta de trajetória, reflexão de minilote, atualizações de texto limitadas, controle de validação e atualizações lentas/meta de época restringem conjuntamente o treinamento de habilidades.
Figura 2. O pipeline SkillOpt: coleta de trajetória, reflexão de minilote, atualizações de texto limitadas, controle de validação e atualizações lentas/meta de época restringem conjuntamente o treinamento de habilidades.

Ganhos consistentes em benchmarks, modelos e modos de execução

Avaliamos o SkillOpt em seis benchmarks (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench e ALFWorld), sete modelos de destino do GPT-5.5 em escala de fronteira ao pequeno Qwen3.5-4B de peso aberto e três modos de execução (chat direto, Codex e Claude Code). Contando cada combinação como uma célula de avaliação, quando medido em relação às habilidades escritas por humanos, habilidades LLM únicas, Trace2Skill, TextGrad, GEPA e EvoSkill, o SkillOpt entregou os melhores ou empatou para os melhores resultados em todas as 52 células. Essas melhorias de desempenho são excepcionalmente grandes para um método que não atualiza os pesos do modelo. Com GPT-5.5 no chat direto, o SkillOpt aumenta a média de seis benchmarks de 58,8 para 82,3, uma melhoria absoluta de +23,5 pontos – e +5,4 pontos acima de um oráculo que escolhe o melhor método concorrente por célula. Os maiores ganhos aparecem em benchmarks procedurais: SpreadsheetBench sobe de 41,8 para 80,7, OfficeQA de 33,1 para 72,1 e LiveMathematicianBench de 37,6 para 66,9. A mesma interface é transferida para loops de agente, elevando o GPT-5,5 em +24,8 pontos dentro do Codex e +19,1 dentro do Claude Code em relação a nenhuma habilidade.

SÉRIE PODCAST

A revolução da IA ​​na medicina, revisitada

Junte-se a Peter Lee, da Microsoft, em uma jornada para descobrir como a IA está impactando a saúde e o que ela significa para o futuro da medicina.


Um pequeno modelo mais um arquivo de habilidade

Aproximar-se do próximo nível de modelo SkillOpt também reduz a lacuna entre modelos pequenos ou de peso aberto e modelos de fronteira – sem alterar quaisquer pesos ou adicionar quaisquer chamadas de modelo extras na inferência. Após a otimização, a média de seis benchmarks do GPT-5.4-mini (64,3) excede a linha de base sem habilidade do GPT-5.4 maior (59,7) e o GPT-5.4-nano (57,4) excede a linha de base sem habilidade do GPT-5.2 (51,3). Qwen3.5-4B, um modelo de peso aberto de 4 bilhões de parâmetros, também supera a linha de base sem habilidade do GPT-5.2. Os ganhos que antes exigiam um modelo maior agora podem ser aproximados por um arquivo de habilidade otimizado.

Habilidades que são transferidas: treine uma vez, reutilize em qualquer lugar

O arquivo de habilidades otimizado captura procedimentos reutilizáveis ​​de resolução de tarefas, em vez de instruções ajustadas a um único modelo, benchmark ou ambiente de execução. É por isso que a mesma habilidade ainda pode melhorar o desempenho quando transferida entre escalas de modelos, equipamentos de agentes e tarefas relacionadas. Em nossos experimentos de transferência, as habilidades continuaram a gerar ganhos quando transferidas entre escalas de modelos, entre sistemas de execução e para um benchmark matemático próximo. O exemplo mais claro é a transferência cruzada: uma habilidade de planilha treinada no Codex, transferida para o Claude Code sem otimização adicional, eleva a linha de base sem habilidade de 22,1 para 81,8 (+59,7) – um pouco acima dos 80,4 alcançados pelo treinamento diretamente no Claude Code. Como os dois chicotes expõem superfícies de ferramentas diferentes, isso sugere que o SkillOpt aprende a lógica geral do fluxo de trabalho, e não apenas receitas específicas do chicote.

Compacto, legível e criado a partir de poucas edições aceitas

O artefato implantado, best_skill.md , não é um blob de parâmetro opaco nem um log em constante crescimento. Em seis estudos de caso, a duração média da habilidade ultimate é de aproximadamente 920 tokens e, como a porta de validação rejeita a maioria das propostas, apenas uma a quatro edições são aceitas no arquivo ultimate. O ganho de +39,0 pontos do OfficeQA vem de uma única edição aceita. As regras aprendidas parecem o conselho de um praticante experiente. As ablações de componentes confirmam que os controles fazem o trabalho: a remoção do buffer de edição rejeitada reduz as pontuações em todos os três benchmarks de ablação e a remoção da meta habilidade e da atualização lenta reduz o SpreadsheetBench de 77,5 para 55,0. Uma nova camada de adaptação para a period do agente SkillOpt aponta para um caminho mais leve para agentes de adaptação de domínio: em vez de pesos de ajuste fino, lógica de tarefa codificada ou prompts de ajuste handbook, as equipes podem treinar uma camada de habilidades de linguagem pure pequena, versionável e auditável – onde quer que exista avaliação automática ou um verificador confiável.

Ao trazer taxas de aprendizagem, cronogramas, divisões de validação, amostras rejeitadas e atualizações lentas para as habilidades dos agentes, a SkillOpt sugere que o treinamento não precisa ser limitado aos pesos do modelo. O conhecimento processual fora do modelo também pode ser otimizado.

Quando esse processo é controlado, validado e registrado, uma habilidade de linguagem pure torna-se um adaptador estável, transferível e reversível entre a capacidade do modelo de fronteira e as cargas de trabalho do mundo actual. Leia o artigo completo, visite a página do projeto em aka.ms/skillopt (abre em nova aba)ou discover o repositório SkillOpt GitHub em github.com/microsoft/SkillOpt (abre em nova aba). As equipes que criam fluxos de trabalho de agente podem usar o SkillOpt como base para treinar habilidades reutilizáveis ​​em suas próprias tarefas e verificadores. Veja também nosso projeto complementar, SkillLens.



Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *