NVIDIA Nemotron 3.5 Lightning já está disponível no Amazon SageMaker JumpStart

O que é o NVIDIA Nemotron 3.5 Lightning

A NVIDIA disponibilizou o Nemotron 3.5 Lightning no Amazon SageMaker JumpStart, tornando mais acessível o deploy de um modelo de fundação aberto voltado para cargas de trabalho agênticas de alto volume. O modelo pode ser implantado sem que o time precise configurar manualmente a infraestrutura de serving — o JumpStart cuida disso.

Segundo a NVIDIA, o Lightning é o modelo aberto mais rápido de sua categoria para alimentar agentes sempre ativos (always-on agents). A empresa reporta até 4x mais throughput e até 30% mais velocidade na conclusão de tarefas em cargas agênticas de alto volume.

O modelo conta com 30 bilhões de parâmetros totais, mas apenas 3 bilhões ativos por inferência, o que permite que ele rode em uma única GPU compatível. Isso significa que etapas repetitivas e especializadas de fluxos agênticos podem ser executadas sem precisar de infraestrutura de escala frontier.

Arquitetura e características técnicas

O Nemotron 3.5 Lightning é um modelo de fundação publicamente disponível, destilado a partir do Nemotron 3 Ultra da NVIDIA e desenvolvido em colaboração com o Nemotron Coalition. Ele usa uma arquitetura híbrida de Mistura de Especialistas (MoE — Mixture-of-Experts) e foi treinado especificamente para uso de ferramentas agênticas em frameworks populares de agentes.

Por ser treinado em datasets abertos e lançado como modelo aberto, é possível personalizá-lo, manter os pesos resultantes e implantá-lo onde os agentes rodam.

A tabela abaixo resume as principais especificações do modelo:

  • Arquitetura: Híbrida MoE (Mistura de Especialistas)
  • Parâmetros: 30B totais / 3B ativos
  • Tamanho de contexto: Até 1 milhão de tokens
  • Entrada / Saída: Texto para texto
  • Decodificação especulativa: DFlash
  • Throughput: Até 4x maior para cargas agênticas de alto volume
  • Conclusão de tarefas: Até 30% mais rápida
  • Destilado de: NVIDIA Nemotron 3 Ultra

Nem toda etapa agêntica precisa de um modelo frontier

Agentes sempre ativos trabalham de forma contínua: coletam contexto, observam o ambiente, raciocinam sobre o que sabem e agem. Muitas dessas etapas envolvem chamadas a modelos, mas nem todas exigem o mesmo nível de capacidade.

Planejar um fluxo de trabalho em múltiplos estágios ou orquestrar sub-agentes pode exigir raciocínio de nível frontier. Já classificar um alerta, extrair campos de um formulário ou verificar um registro contra uma política geralmente pode ser tratado por um modelo menor e especializado — e essas tarefas podem representar uma grande parcela do volume de chamadas.

Executar todas as etapas suportadas por modelos através de um único modelo grande pode adicionar custo e latência de modelo frontier a trabalhos que um modelo menor e especializado consegue resolver. Uma abordagem de sistema de modelos pode, em vez disso, rotear cada etapa para o modelo mais adequado à tarefa.

O Nemotron 3.5 Lightning foi construído para o extremo de alto volume desse sistema. Sua arquitetura MoE ativa 3B dos 30B parâmetros por passagem forward, ajudando a manter alto throughput em sessões longas e com múltiplos turnos. A decodificação especulativa DFlash pode reduzir ainda mais a latência por token. A janela de contexto de 1 milhão de tokens permite que um agente carregue estado acumulado ao longo de uma sessão de longa duração sem precisar de re-ancoragem repetida.

Se o NVIDIA NeMo Switchyard fizer parte do seu stack, ele pode rotear etapas individuais do fluxo de trabalho entre o pool de modelos escolhido. O Lightning pode ser selecionado para etapas especializadas de alto volume onde sua velocidade e precisão por domínio são um bom encaixe.

Precisão em benchmarks de raciocínio e agênticos

A NVIDIA reporta que os resultados de avaliação foram medidos sob um harness consistente e podem diferir dos números reportados pelos próprios fornecedores. As receitas e comandos de avaliação usados para produzir esses resultados estão publicados no NeMo Gym.

A tabela a seguir compara as variantes BF16 e NVFP4 do Nemotron 3.5 Lightning nos principais benchmarks de raciocínio e agênticos:

  • MMLU Pro: BF16 → 81,94 | NVFP4 → 81,62
  • GPQA Diamond: BF16 → 75,44 | NVFP4 → 75,57
  • SWE-bench Verified: BF16 → 51,56 | NVFP4 → 52,80
  • PinchBench: BF16 → 85,37 | NVFP4 → 83,43
  • IFBench: BF16 → 71,88 | NVFP4 → 72,88
  • AA-LCR: BF16 → 52,00 | NVFP4 → 49,19

De modo geral, a variante NVFP4 permanece próxima à BF16 na maioria das tarefas avaliadas.

Personalização para precisão por domínio

Organizações podem fazer pós-treinamento do modelo com o NVIDIA NeMo para ferramentas, fluxos de trabalho e políticas específicas do domínio, e depois implantar o modelo resultante no ambiente de sua escolha. Vale notar que o model card do SageMaker JumpStart para este lançamento não expõe a funcionalidade de customização nativa do JumpStart.

Casos de uso empresariais

O Lightning foi construído para o trabalho especializado e de alta frequência dentro de fluxos agênticos. A NVIDIA destaca os seguintes casos de uso:

  • Agentes pessoais: Assistentes de longa duração que lidam com e-mail, calendário, projetos e reservas, com a opção de rodar localmente para dados contextuais.
  • Serviços financeiros: Extração de dados de documentos, verificação de regras de política, monitoramento de sinais de risco e preparação de resumos estruturados.
  • Operações de segurança cibernética: Enriquecimento de alertas, classificação de incidentes, consulta a logs, validação de controles, correlação de indicadores e preparação de achados para analistas.
  • Telecomunicações: Triagem de alarmes de rede, otimização de configurações de rede e atendimento a perguntas de faturamento.
  • Varejo: Enriquecimento de catálogos de produtos, resolução de exceções de inventário e fulfillment, auxílio na descoberta de produtos e atendimento a perguntas sobre pedidos, devoluções e fidelidade.

Como fazer o deploy pelo SageMaker JumpStart

O Nemotron 3.5 Lightning pode ser implantado pelo Amazon SageMaker JumpStart sem necessidade de configurar manualmente o framework de serving. Antes de começar, é necessário ter:

  • Uma conta AWS ativa.
  • Permissões adequadas para o SageMaker JumpStart.
  • Cota de serviço suficiente para instâncias GPU (por exemplo, ml.g6e.12xlarge, ml.p4d.24xlarge ou ml.p5.48xlarge).

Atenção: O deploy deste modelo cria um endpoint no SageMaker AI que gera cobranças enquanto estiver ativo. Consulte a página de preços do Amazon SageMaker AI para mais detalhes. Exclua o endpoint ao terminar para evitar cobranças contínuas.

Deploy pelo SageMaker Studio

Para fazer o deploy pelo SageMaker Studio, abra o Amazon SageMaker Studio, acesse o SageMaker JumpStart pelo painel de navegação e busque por Nemotron 3.5 Lightning. Selecione o model card correspondente — o ID do modelo NVFP4 é huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4; para BF16, use huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16. Escolha Deploy, selecione o tipo de instância (por exemplo, ml.g6e.24xlarge), revise as configurações de deploy — os padrões são suficientes para a maioria dos casos de uso — e confirme o deploy para criar o endpoint. Aguarde o status do endpoint mostrar InService antes de executar inferências.

Deploy a partir do Hugging Face

Também é possível fazer o deploy do NVIDIA Nemotron 3.5 Lightning para o Amazon SageMaker AI diretamente pela página do modelo no Hugging Face. Na página do modelo, basta escolher Deploy, selecionar Amazon SageMaker AI e clicar em Deploy on SageMaker AI. Isso abre o fluxo de deploy do SageMaker AI, onde é possível configurar e implantar o modelo.

Imagem original — fonte: Aws

Deploy via SageMaker Python SDK

Com o SageMaker JumpStart, é possível acessar as variantes NVFP4 e BF16 via SDK. O exemplo abaixo usa o ID do modelo NVFP4. Para BF16, substitua pelo ID huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16:

from sagemaker.jumpstart.model import JumpStartModel

model_id = "huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4"
model_version = "*"

model = JumpStartModel(model_id=model_id, model_version=model_version)
predictor = model.deploy()

Limpeza de recursos

Para evitar cobranças desnecessárias, exclua o endpoint do SageMaker AI ao terminar:

predictor.delete_endpoint()

Conclusão

O NVIDIA Nemotron 3.5 Lightning representa uma opção relevante para equipes que trabalham com fluxos agênticos de alto volume e precisam de velocidade sem abrir mão de precisão. Sua arquitetura MoE com apenas 3B de parâmetros ativos, a decodificação especulativa DFlash e a janela de contexto de 1 milhão de tokens fazem dele um modelo pensado para o trabalho especializado e repetitivo dentro de sistemas de agentes.

Por ser um modelo aberto e customizável, as organizações mantêm controle sobre os pesos resultantes do pós-treinamento. A disponibilidade no Amazon SageMaker JumpStart simplifica o processo de deploy, eliminando a necessidade de configurar a infraestrutura de serving manualmente. Para orientações detalhadas sobre implantação, a AWS disponibiliza a documentação de uso de modelos de fundação no JumpStart no guia do desenvolvedor do SageMaker AI.

Fonte

NVIDIA Nemotron 3.5 Lightning now available in Amazon SageMaker JumpStart (https://aws.amazon.com/blogs/machine-learning/nvidia-nemotron-3-5-lightning-now-available-in-amazon-sagemaker-jumpstart/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *