Por que personalizar modelos de IA é mais do que uma otimização
Modelos de IA de propósito geral são um ponto de partida poderoso, mas empresas que dependem de terminologia específica, fluxos de trabalho próprios e padrões de decisão internos precisam de algo além do genérico. O processo de fine-tuning (ajuste fino) de modelos fundacionais (FMs — Foundation Models) com dados de domínio transforma esses modelos em ativos proprietários: eles aprendem a voz da marca, reduzem alucinações e incorporam as melhores práticas da organização diretamente na arquitetura.
Do ponto de vista estratégico, um modelo ajustado representa propriedade intelectual difícil de replicar com modelos públicos de prateleira. E há um bônus prático: modelos menores, ajustados em tarefas específicas, frequentemente igualam ou superam modelos muito maiores — com custo operacional significativamente menor e dados sensíveis mantidos dentro de uma infraestrutura privada e segura.
Com esse cenário em mente, a AWS anunciou suporte à personalização serverless de modelos para a família NVIDIA Nemotron 3 no Amazon SageMaker AI, começando pelos modelos Nemotron 3 Nano (30B parâmetros totais, 3B ativos) e Nemotron 3 Super (120B parâmetros totais, 12B ativos). Para a lista completa de modelos open-weight disponíveis para personalização serverless, a AWS disponibiliza a documentação de customização de modelos open-weight no Amazon SageMaker AI.
Arquitetura dos modelos NVIDIA Nemotron 3
A família Nemotron 3 é construída sobre uma arquitetura híbrida Mamba-Transformer Mixture-of-Experts (MoE), com suporte nativo a contextos de até 1 milhão de tokens. A arquitetura intercala três tipos de camadas complementares:
- Camadas Mamba-2: processamento de sequências em tempo linear, com alta eficiência computacional.
- Camadas de atenção Transformer: responsáveis pela recuperação associativa precisa.
- Camadas LatentMoE (Latent Mixture-of-Experts): comprimem tokens antes de roteá-los para especialistas específicos.
Essa combinação garante que apenas uma fração dos parâmetros totais seja ativada em cada passagem — por exemplo, 12B dos 120B parâmetros no modelo Super. O resultado é alto throughput e boa precisão com custo computacional substancialmente menor. Os modelos também passam por aprendizado por reforço em múltiplos ambientes via NeMo Gym, o que os alinha a tarefas agênticas reais em domínios como programação, raciocínio e análise de contextos longos.
Nemotron 3 Nano (30B)
O Nemotron 3 Nano é um modelo de linguagem compacto, otimizado para alta eficiência computacional sem abrir mão de precisão em tarefas especializadas. Ele se destaca em programação e raciocínio dentro da sua classe de tamanho, e alcança throughput 4x maior que seu antecessor, o Nemotron 2 Nano. Com apenas 3B parâmetros ativos, é ideal para cargas de trabalho multi-agente de alto volume onde custo e latência são críticos. Para mais detalhes técnicos sobre arquitetura e treinamento, a NVIDIA mantém um blog para desenvolvedores com informações aprofundadas.
Nemotron 3 Super (120B)
O Nemotron 3 Super é projetado para aplicações multi-agente complexas que exigem mais capacidade que o Nano, mas ainda com foco em eficiência de custo. Ele performa bem em raciocínio, programação e análise de contextos longos, sendo adequado para automação de tickets de TI, orquestração de fluxos corporativos e sistemas de agentes autônomos que exigem raciocínio sustentado em múltiplas etapas. Mais detalhes estão disponíveis no blog da NVIDIA sobre o Nemotron 3 Super.
Personalização serverless no SageMaker AI: sem infraestrutura para gerenciar
O grande diferencial da personalização serverless do SageMaker AI é remover a complexidade operacional do fine-tuning. Não é necessário provisionar clusters de GPU, configurar frameworks de treinamento distribuído nem gerenciar checkpoints e tolerância a falhas. O SageMaker AI cuida do provisionamento de infraestrutura e da orquestração do treinamento — o time foca nos dados, no caso de uso e na avaliação, pagando apenas pelo que usa. Mais detalhes estão na documentação oficial da AWS sobre personalização serverless no SageMaker AI.
Para os modelos Nemotron 3, o SageMaker AI suporta três técnicas de fine-tuning:
- Ajuste Fino Supervisionado — SFT (Supervised Fine-Tuning): fornece pares de entrada e saída rotulados para ensinar novos comportamentos ao modelo. Ideal quando há exemplos de alta qualidade do comportamento desejado: pares de perguntas e respostas de domínio, chamadas de ferramentas formatadas, respostas alinhadas ao estilo da marca ou conclusões de instruções específicas de tarefas.
- Ajuste Fino por Reforço com Recompensas Verificáveis — RLVR (Reinforcement Learning with Verifiable Rewards): otimiza o comportamento do modelo com base em um sinal de recompensa. O modelo gera múltiplas respostas candidatas por prompt, uma função de recompensa as pontua, e o modelo atualiza sua política para favorecer o que funciona. Indicado para tarefas com objetivos naturalmente verificáveis, como precisão em chamadas de ferramentas, correção de código ou conformidade de formato.
- Aprendizado por Reforço com Feedback de IA — RLAIF (Reinforcement Learning from AI Feedback): usa um modelo de IA separado para guiar a otimização. Um modelo de IA avalia as saídas e fornece sinais de feedback, permitindo melhoria iterativa de política sem dados de recompensa rotulados por humanos. Útil para alinhar tom, utilidade e segurança; melhorar a qualidade das respostas quando avaliação humana é cara ou subjetiva; e refinar tarefas de geração aberta.
Casos de uso para personalização empresarial
Embora os modelos Nemotron 3 base entreguem boa performance geral, casos de uso corporativos exigem comportamentos específicos de domínio. Com a personalização, é possível:
- Adaptar os modelos para terminologia e padrões de decisão específicos do setor.
- Treinar chamadas de ferramentas confiáveis com as APIs internas da organização.
- Alinhar as saídas à voz e ao tom da marca.
- Refinar o raciocínio agêntico em múltiplas etapas para arquiteturas próprias.
- Reduzir custos especializando o modelo Nano menor para igualar a performance de modelos maiores em tarefas específicas.
Como começar: pré-requisitos e preparação dos dados
A personalização serverless pode ser iniciada pelo console do Amazon SageMaker Studio ou programaticamente via SageMaker Python SDK. Para quem já trabalha no SageMaker AI, é possível usar a funcionalidade agêntica com agent skills para acelerar o fluxo de personalização. Para um exemplo programático detalhado, a AWS disponibiliza o repositório de exemplos no GitHub.
Antes de começar, é necessário ter:
- Uma conta AWS com permissões IAM (Gerenciamento de Identidade e Acesso — Identity and Access Management) para o Amazon SageMaker AI.
- Um domínio SageMaker AI com acesso ao Studio.
- Dados de treinamento na estrutura e formato corretos.
Os dados de treinamento devem estar no formato JSONL (JSON Lines), onde cada linha representa um exemplo de treinamento. O schema específico depende da técnica escolhida: o SFT exige exemplos no formato de conversa com pares de entrada e saída rotulados, enquanto o RLVR exige prompts combinados com valores de verdade para a função de recompensa. Para um guia prático de preparação dos dados, a AWS disponibiliza o módulo de Preparação de Dados no workshop de personalização serverless do SageMaker AI. Quem usa o SageMaker AI pode contar com o agente de codificação integrado com agent skills para preparar e validar automaticamente a formatação dos dados.
Passo a passo: personalizando um modelo Nemotron 3 no SageMaker Studio
O fluxo de personalização no console do SageMaker AI Studio segue estas etapas:
- Abra o Amazon SageMaker AI Studio e, no painel de navegação à esquerda, selecione Models.
- Busque por “NVIDIA” para localizar a família Nemotron 3 e selecione o modelo desejado (
NVIDIA-Nemotron-3-Nano-30B-*ouNVIDIA-Nemotron-3-Super-120B-*). - Escolha a técnica de personalização entre SFT, RLVR e RLAIF.
- Ao optar por RLVR, defina o tipo de função de recompensa. A função embutida (Correspondência Exata, Execução de Código, Respostas Matemáticas) funciona bem para tarefas com respostas únicas e objetivamente corretas. Já uma função de recompensa personalizada é indicada quando a tarefa exige lógica de pontuação mais rica — crédito parcial, verificações de formato, avaliação de qualidade de raciocínio ou regras específicas de domínio. Funções personalizadas permitem pontuar em múltiplos sinais, moldar recompensas e emitir métricas de observabilidade. Para orientações detalhadas sobre como criar e registrar uma função de recompensa personalizada, consulte a documentação do workshop de RLVR.
- Configure os dados de treinamento selecionando um dataset existente ou criando um novo.
- Defina os hiperparâmetros de customização ou use os valores padrão recomendados.
- Clique em Submit para iniciar o job de personalização.
O SageMaker AI provisiona automaticamente o compute necessário, executa o job de treinamento e captura logs contínuos. As métricas de treinamento são registradas por padrão no SageMaker MLflow App.
Monitoramento do treinamento
O progresso do treinamento pode ser acompanhado na página inicial do modelo. Algumas métricas de alto nível merecem atenção especial:
- Train Reward (para RLVR): deve aumentar progressivamente.
- Training Loss e Validation Loss: devem diminuir, indicando generalização.
- Policy Entropy (para RLVR): diminui à medida que o modelo ganha confiança.
- Gradient Norm: deve estabilizar para indicar convergência.
As métricas detalhadas de treinamento e validação também são registradas no SageMaker AI MLflow App. Na interface de rastreamento do MLflow, essas métricas são organizadas por componente (actor, critic, rollout, performance), facilitando o diagnóstico da saúde do treinamento.
Avaliação do modelo personalizado
Após o treinamento, o SageMaker AI oferece três métodos para avaliar a qualidade do modelo customizado:
- LLM-as-a-Judge: utiliza um modelo frontier do Amazon Bedrock para avaliar respostas com base em métricas de qualidade, sem necessidade de rótulos de verdade.
- Custom Scorer: aplica funções de recompensa próprias ou scorers embutidos para produzir métricas padrão de Processamento de Linguagem Natural — PLN (Natural Language Processing — NLP), como F1, ROUGE e BLEU.
- Benchmarks: pontua o modelo em benchmarks acadêmicos padronizados (MMLU, BBH, GPQA, MATH, IFEval) para avaliação ampla de capacidades em raciocínio, conhecimento e seguimento de instruções.
Também é possível ativar a comparação com o modelo base durante a avaliação, para medir diretamente o ganho do modelo pós-treinamento em relação ao original. Combinadas com as métricas de treinamento registradas no MLflow, essas avaliações oferecem uma visão completa da efetividade do fine-tuning.
Deploy do modelo personalizado
O modelo customizado pode ser implantado diretamente pela página de detalhes do modelo no console. Outras opções incluem deploy para endpoints de inferência do SageMaker ou download dos pesos do modelo de um bucket no Amazon S3 para implantação autogerenciada. As opções de deploy preenchem automaticamente os padrões, com flexibilidade total sobre compute e escalonamento conforme os requisitos de tráfego e throughput.
O deploy do Nemotron Nano 30B ajustado utiliza uma instância ml.g6e com GPUs NVIDIA L40S Tensor Core. Por padrão, o SageMaker serve os pesos do modelo mesclado — onde o modelo base e o adaptador LoRA são combinados em um único conjunto de pesos para inferência otimizada. Por se tratar de um fine-tuning LoRA, também é possível hospedar e servir o adaptador LoRA não mesclado separadamente, já que tanto os pesos base quanto os pesos do adaptador ficam disponíveis no bucket S3. Após o deploy, o endpoint é invocado via método invoke com a AWS CLI ou SDK.
Limpeza de recursos
Para evitar cobranças desnecessárias, a AWS recomenda excluir o domínio do SageMaker AI Studio, os SageMaker Endpoints e quaisquer outros recursos criados após o uso. O custo específico da personalização serverless no SageMaker AI depende do modelo base escolhido e do estágio de customização — os detalhes estão na página de preços do Amazon SageMaker AI.
Conclusão
A personalização serverless dos modelos NVIDIA Nemotron 3 no Amazon SageMaker AI representa um avanço prático para equipes que precisam adaptar modelos de alto desempenho a domínios específicos sem a complexidade operacional do fine-tuning tradicional. Seja ajustando o Nemotron 3 Nano para execução eficiente de tarefas agênticas, seja customizando o Nemotron 3 Super para orquestração multi-agente complexa, o SageMaker AI cuida do provisionamento de compute, da orquestração do treinamento e do rastreamento de métricas — deixando o time livre para focar nos dados, na avaliação e no deploy.
Para exemplos detalhados de customização de modelos open-source, acesse o repositório de exemplos da AWS no GitHub. Para saber mais, consulte a documentação de customização de modelos do Amazon SageMaker AI.
Fonte
Fine-tune NVIDIA Nemotron 3 models with Amazon SageMaker AI serverless model customization (https://aws.amazon.com/blogs/machine-learning/fine-tune-nvidia-nemotron-3-models-with-amazon-sagemaker-ai-serverless-model-customization/)
Leave a Reply