Três novos modelos de IA chegam ao Amazon SageMaker JumpStart: cache semântico, raciocínio em código e OCR multilíngue

Novos modelos ampliam o portfólio do SageMaker JumpStart

A AWS anunciou a disponibilidade de três novos modelos de fundação no Amazon SageMaker JumpStart: o langcache-embed-v3-small (da Redis), o Mellum2-12B-A2.5B-Thinking (da JetBrains) e o LightOnOCR-2-1B (da LightOn). A adição reforça o catálogo de modelos prontos para implantação na plataforma, cobrindo três frentes bastante distintas: cache semântico, raciocínio focado em código e reconhecimento óptico de caracteres (OCR) em documentos.

O que cada modelo faz

langcache-embed-v3-small — cache semântico para aplicações LLM

Desenvolvido pela Redis, o langcache-embed-v3-small foi criado especificamente para otimizar o cache semântico em aplicações que utilizam Modelos de Linguagem de Grande Escala (LLM). O modelo mapeia sentenças e parágrafos em um espaço vetorial denso, projetado para identificar consultas semanticamente equivalentes — mesmo que escritas de formas diferentes. Na prática, isso permite que o sistema reconheça perguntas parecidas e entregue respostas já armazenadas em cache, reduzindo chamadas redundantes ao LLM e acelerando o tempo de resposta em cargas de trabalho de inferência de alto volume.

Mellum2-12B-A2.5B-Thinking — raciocínio e geração de código

A JetBrains — conhecida pelo ecossistema de IDEs como IntelliJ e PyCharm — traz ao JumpStart o Mellum2-12B-A2.5B-Thinking, um modelo voltado para geração de código, depuração, raciocínio em múltiplas etapas e fluxos de trabalho de codificação agêntica. Sua arquitetura utiliza Mistura de Especialistas (MoE — Mixture of Experts) com 64 especialistas, sendo 8 ativados por token. Isso significa que, de seus 12 bilhões de parâmetros totais, apenas 2,5 bilhões são ativados por passagem direta, tornando a inferência mais eficiente. O modelo suporta um contexto de 131.072 tokens e emite rastreamentos explícitos de raciocínio em cadeia de pensamento (CoT — Chain of Thought) antes de apresentar a resposta final — característica útil para cenários de roteamento, Geração Aumentada por Recuperação (RAG — Retrieval-Augmented Generation), sub-agentes e implantações privadas.

LightOnOCR-2-1B — OCR multilíngue ponta a ponta

Da LightOn, o LightOnOCR-2-1B é um modelo de visão e linguagem com 1 bilhão de parâmetros que realiza a conversão de documentos — PDFs, digitalizações e imagens — diretamente em texto limpo e ordenado, sem depender de pipelines tradicionais de OCR, que costumam ser frágeis e difíceis de manter. O modelo suporta múltiplos idiomas e alcança desempenho de ponta no benchmark OlmOCR-Bench, sendo aproximadamente 9 vezes menor e significativamente mais rápido do que abordagens concorrentes.

Como acessar os modelos no SageMaker JumpStart

Com o SageMaker JumpStart, a AWS permite que os clientes implantem qualquer um desses modelos com poucos cliques, diretamente pelo console do SageMaker ou via SDK Python do SageMaker, dentro de sua própria conta AWS. Para mais detalhes sobre como implantar e utilizar modelos de fundação na plataforma, a AWS disponibiliza a documentação oficial do Amazon SageMaker JumpStart.

Fonte

langcache-embed-v3-small, Mellum2-12B-A2.5B-Thinking, and LightOnOCR-2-1B models now available on Amazon SageMaker JumpStart (https://aws.amazon.com/about-aws/whats-new/2026/01/langcache-embed-v3-small-mellum2-12B-A2.5B-thinking-lightOnOCR-2-1B-on-sagemaker-jumpstart/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *