Procurando um modelo para implementar a estimativa de pose? Conheço algo que pode realizar detecção, segmentação de instâncias, estimativa de pose e classificação, tudo isso em tempo actual. Sim, estou falando do YOLO26 da ultralíticos.
Ele pode auxiliar sistemas de segurança ou ser ajustado para detectar objetos ainda menores. Quer saber como começar? Não se preocupe, abordaremos os fundamentos do YOLO e aprenderemos a realizar inferências usando o modelo.
Antecedentes do YOLO

YOLO (você olha apenas uma vez) é uma família de modelos de aprendizagem profunda usados para tarefas de visão computacional; a lógica elementary é o uso de localização e classificação. Em palavras simples, a localização detecta objetos e encontra as coordenadas de cada um. Então, o classificador prevê as probabilidades da classe e atribui a classe mais provável a esse objeto. A mais recente família de modelos da YOLO é a YOLO26, como mencionado anteriormente eles podem realizar:
- Detecção de objetos: Encontra um ou mais objetos em uma imagem e prevê sua pontuação de confiança de classe e caixa delimitadora. Isso informa o que é o objeto e onde ele está localizado.
- Classificação: Atribui a imagem a uma das 1.000 categorias do ImageNet. A classe com maior probabilidade é selecionada como previsão last.
- Estimativa de pose: Detecta os 17 pontos-chave do corpo humano definidos pelo Conjunto de dados COCO. Isso inclui pontos como nariz, ombros, cotovelos, joelhos e tornozelos para estimar a postura de cada pessoa.
- Detecção de caixa delimitadora orientada (OBB): Prevê caixas delimitadoras giradas usando cinco parâmetros. xyw h e θ. Isto é especialmente útil para imagens aéreas e de satélite onde os objetos raramente aparecem perfeitamente alinhados.
- Segmentação de instância: Gera uma máscara de nível de pixel para cada objeto detectado. Isso ajuda a separar objetos individuais mesmo quando pertencem à mesma classe.
Esses modelos têm maior precisão e melhor eficiência do que as gerações anteriores de modelos.
Arquitetura

- Imagem de entrada: A imagem de entrada é redimensionada e normalizada antes que o modelo a processe.
- Estrutura principal (C3k2 + CSP): Extrai recursos da imagem, como bordas, texturas, formas e padrões de objetos.
- Pescoço (PAN-FPN): Executa a fusão de P3, P4 e P5. Isso ajuda a melhorar a detecção de objetos pequenos, médios e grandes, respectivamente.
- Cabeça de detecção: Prevê as lessons de objetos, caixas delimitadoras e pontuações de confiança usando os mapas de recursos fundidos.
- Inferência ponta a ponta: Elimina algumas coisas presentes nas gerações anteriores, especificamente DFL e NMS. Simplificando o pipeline e melhorando a latência de inferência.
- Saída: Detecção de objetos, segmentação, estimativa de pose, detecção de orientação ou classificação.
Para Contexto
- C3k2: Um bloco de extração de recursos introduzido recentemente nos modelos YOLO. Melhora o aprendizado de recursos com menos parâmetros.
- PAN (rede de agregação de caminho): Passa recursos de baixo e alto nível em ambas as direções, ajudando na detecção de objetos de tamanhos variados com precisão.
- FPN (Rede Pirâmide de Recursos): Combina mapas de características de múltiplas profundidades, ajuda a reconhecer objetos em múltiplas escalas.
- P3 -> Mapa de recursos de alta resolução, P4 -> Mapa de recursos de média resolução e P5 -> Mapa de recursos de baixa resolução. Eles ajudam o modelo a detectar objetos pequenos, médios e grandes, respectivamente.
Prática
Vamos experimentar o YOLO26 com a ajuda do Google Colab. Usaremos principalmente esta imagem durante a inferência:

Observação: Os modelos YOLO não requerem {hardware} de última geração, eles também podem ser executados localmente no Jupyter Pocket book.
Instalações
!pip set up -q "ultralytics>=8.4.0" Aqui ‘-q’ é usado para instalar a biblioteca e dependências sem exibir nada.
Definindo a função Auxiliar
from PIL import Picture
# helper perform
def present(end result):
show(Picture.fromarray(end result.plot()(..., ::-1)))Isso será usado para exibir os resultados.
Detecção de objetos
from ultralytics import YOLO
IMAGE = "https://ultralytics.com/pictures/bus.jpg"
mannequin = YOLO("yolo26n.pt")
end result = mannequin(IMAGE)(0)
present(end result)
O modelo detectou com sucesso o ônibus e as pessoas.
Segmentação de instância
seg_model = YOLO("yolo26n-seg.pt")
end result = seg_model(IMAGE)(0)
present(end result)
Aqui o modelo realizou a segmentação, mascarou os objetos que detectou. A detecção de bordas também parece boa.
Estimativa de pose/ponto-chave
pose_model = YOLO("yolo26n-pose.pt")
end result = pose_model(IMAGE)(0)
present(end result)
O modelo previu com sucesso os pontos-chave do corpo humano para detecção de pose.
Caixas delimitadoras orientadas
obb_model = YOLO("yolo26n-obb.pt")
end result = obb_model("https://ultralytics.com/pictures/boats.jpg")(0)
present(end result)
Este modelo pode detectar especificamente objetos em imagens aéreas, de cima para baixo ou de satélite. Como você pode ver, ele detectou muito bem os navios da imagem.
Classificação de imagens
cls_model = YOLO("yolo26n-cls.pt")
end result = cls_model(IMAGE)(0)
for i in end result.probs.top5:
print(f"{end result.names(i):<25} {end result.probs.information(i):.2%}")Saída:

O modelo gera as probabilidades de 1.000 lessons, aqui o classificador previu a classe como microônibus com precisão.
Conclusão
Em resumo, você aprendeu o básico do YOLO e do YOLO26, explorou sua arquitetura e realizou inferência no Google Colab para detecção de objetos, segmentação de instâncias, estimativa de pose, caixas delimitadoras orientadas e classificação de imagens. Com sua precisão, eficiência e desempenho em tempo actual aprimorados, o YOLO26 é uma boa escolha para uma ampla gama de aplicações de visão computacional.
Perguntas frequentes
A. No Google Colab, você pode fazer add de uma imagem usando a função information.add() e passar o caminho do add para o modelo para inferência.
R. Sim. Você pode ler o vídeo como imagens (quadros), executar o modelo em cada quadro e depois combinar os quadros processados como um vídeo.
R. Não. Os modelos YOLO26 podem ser executados em uma CPU, embora uma GPU seja muito mais rápida para inferência para tarefas maiores.
Faça login para continuar lendo e desfrutar de conteúdo com curadoria de especialistas.