Desde que lançamos Personalização do Amazon Nova no Amazon SageMaker AI no AWS NY Summit 2025, os clientes têm solicitado os mesmos recursos com Amazônia Nova como fazem quando personalizam modelos de pesos abertos em Inferência do Amazon SageMaker. Eles também queriam ter mais controle e flexibilidade na inferência de modelos personalizados sobre tipos de instância, políticas de escalonamento automático, comprimento de contexto e configurações de simultaneidade exigidas pelas cargas de trabalho de produção.
Hoje, estamos anunciando a disponibilidade geral do suporte ao modelo personalizado Nova no Amazon SageMaker Inference, um serviço de inferência gerenciado de nível de produção, configurável e econômico para implantar e dimensionar modelos Nova personalizados de classificação completa. Agora você pode experimentar uma jornada de personalização completa para treinar modelos Nova Micro, Nova Lite e Nova 2 Lite com recursos de raciocínio usando Empregos de treinamento do Amazon SageMaker ou Amazon HyperPod e implante-os perfeitamente com a infraestrutura de inferência gerenciada do Amazon SageMaker AI.
Com o Amazon SageMaker Inference para modelos personalizados do Nova, você pode reduzir o custo de inferência por meio da utilização otimizada de GPU usando Amazon Elastic Compute Cloud (Amazon EC2) G5 e G6 instâncias acima Instâncias P5escalonamento automático com base em padrões de uso de 5 minutos e parâmetros de inferência configuráveis. Esse recurso permite a implantação de modelos Nova personalizados com pré-treinamento contínuo, ajuste fino supervisionado ou ajuste fino de reforço para seus casos de uso. Você também pode definir configurações avançadas sobre comprimento do contexto, simultaneidade e tamanho do lote para otimizar a compensação latência-custo-precisão para suas cargas de trabalho específicas.
Vamos ver como implantar modelos Nova personalizados em endpoints em tempo actual do SageMaker AI, configurar parâmetros de inferência e invocar seus modelos para teste.
Implante modelos personalizados do Nova no SageMaker Inference
No AWS re:Invent 2025, apresentamos nova personalização sem servidor no Amazon SageMaker AI para modelos populares de IA, incluindo modelos Nova. Com apenas alguns cliques, você pode selecionar perfeitamente um modelo e uma técnica de personalização e lidar com a avaliação e implantação do modelo. Se você já possui um artefato de modelo Nova personalizado treinado, poderá implantar os modelos no SageMaker Inference por meio do Estúdio SageMaker ou SDK de IA do SageMaker.
No SageMaker Studio, escolha um modelo Nova treinado em Modelos em seus modelos no Modelos menu. Você pode implantar o modelo escolhendo Implantar botão, SageMaker IA e Criar novo ponto last.

Escolha o nome do endpoint, o tipo de instância e opções avançadas, como contagem de instâncias, contagem máxima de instâncias, permissão e rede, e Implantar botão. No lançamento do GA, você pode usar g5.12xlarge, g5.24xlarge, g5.48xlarge, g6.12xlarge, g6.24xlarge, g6.48xlargee p5.48xlarge tipos de instância para o modelo Nova Micro, g5.48xlarge, g6.48xlargee p5.48xlarge para o modelo Nova Lite, e p5.48xlarge para o modelo Nova 2 Lite.

A criação do seu endpoint requer tempo para provisionar a infraestrutura, baixar os artefatos do modelo e inicializar o contêiner de inferência.
Depois que a implantação do modelo for concluída e o standing do endpoint for exibido Em serviçovocê poderá realizar inferência em tempo actual usando o novo endpoint. Para testar o modelo, escolha o Parque infantil guia e insira seu immediate no Bater papo modo.

Você também pode usar o SDK do SageMaker AI para criar dois recursos: um objeto de modelo do SageMaker AI que faz referência aos artefatos do modelo Nova e uma configuração de endpoint que outline como o modelo será implantado.
O exemplo de código a seguir cria um modelo SageMaker AI que faz referência aos artefatos do modelo Nova. Para imagens de contêiner compatíveis por região, consulte tabela lista os URIs da imagem do contêiner:
# Create a SageMaker AI mannequin
model_response = sagemaker.create_model(
ModelName="Nova-micro-ml-g5-12xlarge",
PrimaryContainer={
'Picture': '708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-inference-repo:v1.0.0',
'ModelDataSource': {
'S3DataSource': {
'S3Uri': 's3://your-bucket-name/path/to/mannequin/artifacts/',
'S3DataType': 'S3Prefix',
'CompressionType': 'None'
}
},
# Mannequin Parameters
'Setting': {
'CONTEXT_LENGTH': 8000,
'MAX_CONCURRENCY': 16,
'DEFAULT_TEMPERATURE': 0.0,
'DEFAULT_TOP_P': 1.0
}
},
ExecutionRoleArn=SAGEMAKER_EXECUTION_ROLE_ARN,
EnableNetworkIsolation=True
)
print("Mannequin created efficiently!")Em seguida, crie uma configuração de endpoint que defina sua infraestrutura de implantação e implante seu modelo Nova criando um endpoint em tempo actual do SageMaker AI. Este endpoint hospedará seu modelo e fornecerá um endpoint HTTPS seguro para fazer solicitações de inferência.
# Create Endpoint Configuration
production_variant = {
'VariantName': 'main',
'ModelName': 'Nova-micro-ml-g5-12xlarge',
'InitialInstanceCount': 1,
'InstanceType': 'ml.g5.12xlarge',
}
config_response = sagemaker.create_endpoint_config(
EndpointConfigName="Nova-micro-ml-g5-12xlarge-Config",
ProductionVariants= production_variant
)
print("Endpoint configuration created efficiently!")
# Deploy your Noval mannequin
endpoint_response = sagemaker.create_endpoint(
EndpointName="Nova-micro-ml-g5-12xlarge-endpoint",
EndpointConfigName="Nova-micro-ml-g5-12xlarge-Config"
)
print("Endpoint creation initiated efficiently!")
Depois que o endpoint for criado, você poderá enviar solicitações de inferência para gerar previsões a partir do seu modelo personalizado do Nova. O Amazon SageMaker AI oferece suporte a endpoints síncronos para tempo actual com modos de streaming/sem streaming e endpoints assíncronos para processamento em lote.
Por exemplo, o código a seguir cria um formato de conclusão de streaming para geração de texto:
# Streaming chat request with complete parameters
streaming_request = {
"messages": (
{"position": "person", "content material": "Evaluate our This autumn 2025 precise spend towards finances throughout all departments and spotlight variances exceeding 10%"}
),
"max_tokens": 512,
"stream": True,
"temperature": 0.7,
"top_p": 0.95,
"top_k": 40,
"logprobs": True,
"top_logprobs": 2,
"reasoning_effort": "low", # Choices: "low", "excessive"
"stream_options": {"include_usage": True}
}
invoke_nova_endpoint(streaming_request)
def invoke_nova_endpoint(request_body):
"""
Invoke Nova endpoint with computerized streaming detection.
Args:
request_body (dict): Request payload containing immediate and parameters
Returns:
dict: Response from the mannequin (for non-streaming requests)
None: For streaming requests (prints output instantly)
"""
physique = json.dumps(request_body)
is_streaming = request_body.get("stream", False)
attempt:
print(f"Invoking endpoint ({'streaming' if is_streaming else 'non-streaming'})...")
if is_streaming:
response = runtime_client.invoke_endpoint_with_response_stream(
EndpointName=ENDPOINT_NAME,
ContentType="software/json",
Physique=physique
)
event_stream = response('Physique')
for occasion in event_stream:
if 'PayloadPart' in occasion:
chunk = occasion('PayloadPart')
if 'Bytes' in chunk:
knowledge = chunk('Bytes').decode()
print("Chunk:", knowledge)
else:
# Non-streaming inference
response = runtime_client.invoke_endpoint(
EndpointName=ENDPOINT_NAME,
ContentType="software/json",
Settle for="software/json",
Physique=physique
)
response_body = response('Physique').learn().decode('utf-8')
consequence = json.hundreds(response_body)
print("✅ Response acquired efficiently")
return consequence
besides ClientError as e:
error_code = e.response('Error')('Code')
error_message = e.response('Error')('Message')
print(f"❌ AWS Error: {error_code} - {error_message}")
besides Exception as e:
print(f"❌ Surprising error: {str(e)}")Para usar exemplos de código completos, visite Primeiros passos com a personalização de modelos Nova no SageMaker AI. Para saber mais sobre as melhores práticas de implantação e gerenciamento de modelos, visite Melhores práticas para SageMaker AI.
Agora disponível
O Amazon SageMaker Inference para modelos personalizados do Nova está disponível hoje nas regiões da AWS Leste dos EUA (Norte da Virgínia) e Oeste dos EUA (Oregon). Para disponibilidade regional e um roteiro futuro, visite o Capacidades da AWS por região.
O recurso oferece suporte aos modelos Nova Micro, Nova Lite e Nova 2 Lite com recursos de raciocínio, executados em instâncias EC2 G5, G6 e P5 com suporte de escalonamento automático. Você paga apenas pelas instâncias de computação usadas, com cobrança por hora e sem compromissos mínimos. Para mais informações, visite Página de preços do Amazon SageMaker AI.
Experimente Console de IA do Amazon SageMaker e envie comentários para AWS re:Submit para SageMaker ou por meio de seus contatos habituais do AWS Help.
– Channy
