Evoluindo a forma como os LLMs são medidos para Android: a próxima period do Android Bench


O lançamento de julho do Android Bench – seu rating de benchmark LLM para tarefas de desenvolvimento Android – agora é baseado na estrutura Harbour para avaliação de modelos, anunciou o Google.

Em seu postagem no weblog ao anunciar as atualizações, a empresa observou que quando o Android Bench foi lançado em março, o objetivo period oferecer insights sobre as capacidades do modelo, oferecer opções de IA e incentivar a melhoria dos modelos. Nesta versão, oito modelos foram adicionados à tabela de classificação — Claude Fable 5, Sonnet 5 e Opus 4.8; MLG 5.2; Kimi K2.7; MiniMax M3; e Qwen 3.7 Plus e 3.7 máx.

“Desde o início, valorizamos uma abordagem aberta e transparente, e é por isso que disponibilizamos publicamente nossa metodologia authentic e nosso equipamento de teste no GitHub”, escreveu a empresa no weblog. “Agora estamos levando a colaboração um passo adiante, dando a vocês, comunidade de desenvolvedores Android, a oportunidade de moldar o Android Bench.”

Os desenvolvedores agora podem projetar e enviar tarefas de desenvolvimento do Android e ver como os modelos lidam com os cenários importantes para eles, e agora podem realmente executar avaliações de benchmark para testar os modelos que usam em relação ao conjunto de dados de tarefas do Android. Essas tarefas podem ser encontradas neste Repositório GitHub e os desenvolvedores podem enviar avaliações ou explorar os dados do Android em Centro portuário.

“Com cada vez mais opções para o desenvolvimento de agentes”, concluiu o weblog, “manter uma referência de ponta garante que a assistência de IA na qual você confia proceed se tornando mais inteligente, mais útil e mais eficaz”.

Evoluindo a forma como os LLMs são medidos para Android: a próxima period do Android BenchEvoluindo a forma como os LLMs são medidos para Android: a próxima period do Android Bench

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *