Geração de conteúdo visual em escala com IA
A AWS publicou um tutorial completo sobre como executar workflows do ComfyUI em jobs de processamento do Amazon SageMaker AI para automatizar a criação de conteúdo visual em grande escala. A proposta é direta: transformar o que antes levava dias de trabalho de um time criativo em um processo que termina em menos de uma hora.
Para empresas que dependem de ativos de marketing — posts para redes sociais, peças publicitárias, vídeos curtos —, atrasos na produção criativa se traduzem diretamente em receita perdida. A solução descrita pela AWS permite gerar centenas de imagens prontas para uso em campanhas globais, voiceovers personalizados para múltiplos idiomas e clipes de vídeo com roteiros gerados por IA, tudo dentro das diretrizes de marca da empresa.
Por que combinar ComfyUI com SageMaker AI?
O ComfyUI é um construtor visual de workflows baseado em nós para IA generativa. Ele permite compor, testar e iterar sobre pipelines complexos de imagem, áudio e vídeo sem precisar codificar cada etapa do processo. Os componentes modulares se conectam em um grafo reproduzível que pode ser versionado e compartilhado entre equipes.
Ao trazer o ComfyUI para jobs de processamento do SageMaker AI, a arquitetura ganha vantagens concretas:
- Velocidade com GPU: instâncias aceleradas por GPU entregam tempos de inferência rápidos.
- Custo sob demanda: cobrança por segundo com encerramento automático do job — você paga apenas pelo que usar.
- Escalabilidade natural: a arquitetura baseada em fila processa múltiplas requisições em paralelo sem intervenção manual.
- Portabilidade: qualquer workflow do ComfyUI exportado em formato JSON pode ser implantado nessa estrutura.
O modelo Z-Image Turbo
Para a geração de imagens, a solução utiliza o Z-Image Turbo, um modelo de difusão texto-para-imagem que apresenta uma arquitetura chamada Transformador de Fluxo Único Escalável (S3DiT — Scalable Single-Stream Diffusion Transformer).
O diferencial técnico do Z-Image está na sua abordagem de fusão antecipada (Early Fusion): os tokens de texto e de imagem são concatenados em uma única sequência unificada, permitindo interação densa entre as modalidades em cada camada do modelo. Isso significa que o Transformador trata tokens de texto, tokens latentes de imagem e tokens semânticos de imagem de forma uniforme, maximizando o compartilhamento de parâmetros entre as modalidades.
O backbone do modelo é um Transformador decoder-only, inspirado nos decoders de Grandes Modelos de Linguagem (LLMs — Large Language Models), com 30 camadas, dimensão oculta de 3840, 32 cabeças de atenção, dimensões intermediárias de rede feed-forward de 10240 e um total de 6 bilhões de parâmetros. O workflow do ComfyUI para o Z-Image Turbo já vem armazenado no container do job de processamento e pode ser substituído por qualquer outro workflow personalizado — desde que os modelos necessários estejam baixados, os nós customizados instalados no container e a instância tenha VRAM suficiente.
Outros casos de uso
Embora o exemplo central seja geração de imagens, o motor de workflows do ComfyUI pode escalar diferentes tarefas criativas com IA. Alguns casos de uso adicionais citados pela AWS incluem:
- Testes A/B de criativos publicitários em escala: produção automática de centenas de variações de anúncios, carrosséis para redes sociais e clipes de vídeo para campanhas globais.
- Design de embalagens para lançamentos internacionais: geração de designs específicos por localidade, adaptando cores, imagens e textos para estética, regulamentações ou datas comemorativas regionais.
- Narrativas de vídeo interativas para games e entretenimento: criação de narrativas de vídeo ramificadas onde a IA gera cenas dinâmicas que mudam com base nas escolhas do usuário.
Arquitetura da solução
A infraestrutura é organizada em três stacks do Kit de Desenvolvimento em Nuvem da AWS (AWS CDK):
DataStack
Implementa a camada de armazenamento usando buckets do Amazon S3 com criptografia server-side. O bucket de saída armazena as imagens geradas pelos workflows do ComfyUI.
SecurityStack
Estabelece a infraestrutura de segurança para toda a solução. Cria uma Nuvem Privada Virtual da Amazon (Amazon VPC) com sub-redes públicas e privadas em duas Zonas de Disponibilidade para alta disponibilidade e isolamento de rede. A VPC inclui um gateway NAT para acesso seguro à internet a partir das sub-redes privadas onde os jobs do SageMaker AI são executados.
Uma chave gerenciada pelo cliente do Serviço de Gerenciamento de Chaves da AWS (AWS KMS) fornece criptografia em repouso para dados nos buckets do S3, logs do Amazon CloudWatch e variáveis de ambiente — com rotação automática habilitada. Os logs de fluxo da VPC são enviados ao CloudWatch para monitoramento de tráfego de rede.
ComfyUISmStack
Orquestra o pipeline central de processamento por meio de uma função AWS Lambda que dispara os jobs de processamento do SageMaker AI. A função Lambda pode ser invocada manualmente para iniciar o processamento com GPU usando instâncias ml.g5.xlarge rodando um container Docker personalizado. Esse container empacota o ComfyUI com o modelo Z-Image Turbo, oferecendo geração de imagens de alta qualidade com parâmetros configuráveis para prompts, seeds e processamento em batch.
A stack cria um construct reutilizável de job de processamento que cuida de:
- Build e deploy da imagem Docker para o Registro de Contêineres Elástico da Amazon (Amazon ECR).
- Criação de papéis de Gerenciamento de Identidade e Acesso (IAM — Identity and Access Management) com permissões abrangentes para SageMaker AI, S3, ECR, VPC e CloudWatch.
- Definição do job de processamento com integração à VPC, criptografia via AWS KMS e isolamento de rede.
- Configuração da função Lambda com variáveis de ambiente contendo a configuração completa do job.
Fluxo de processamento
O processo começa quando a função Lambda é acionada. Ela cria o job de processamento e o envia ao SageMaker AI, que provisiona uma instância GPU dentro da rede privada, puxa a imagem do container ComfyUI do registry e a implanta com as configurações de armazenamento e rede necessárias.
Após o container estar em execução, o servidor ComfyUI:
- Baixa os componentes do modelo de IA do HuggingFace via conexão segura de saída.
- Organiza os componentes nos diretórios correspondentes.
- Carrega os modelos na memória GPU e aguarda a inicialização completa.
Com o servidor pronto, o sistema lê os prompts de texto de um arquivo e os processa em batches. Para cada imagem, seleciona um prompt com base em um valor de seed único, preenche o template do workflow com o prompt e o seed, e envia a requisição ao ComfyUI para processamento.
As imagens geradas são gravadas em um diretório de saída e sincronizadas com o Amazon S3 em tempo real — os resultados ficam disponíveis antes mesmo do job terminar. Os logs do container são transmitidos ao CloudWatch para monitoramento. Após todos os batches serem processados, um loop de polling verifica a fila a cada 15 segundos até que todas as requisições sejam concluídas. Quando a fila esvazia, o servidor é encerrado, o container sai e o SageMaker AI termina a instância automaticamente.
Passo a passo de implantação
Pré-requisitos
- Python 3.13 ou superior
- Interface de Linha de Comando da AWS (AWS CLI) configurada com as credenciais adequadas
- Docker instalado e em execução
- AWS CDK v2
- AWS CDK com bootstrap feito na conta e região AWS alvo
1. Clonar o repositório
git clone https://github.com/aws-samples/sample-comfy-to-sagemaker-processing-job
2. Configurar o ambiente
Crie o arquivo de ambiente a partir do template de exemplo:
cp .env.example .env
Edite o arquivo .env com os dados da sua conta AWS:
AWS_ACCOUNT_ID=your-account-id
REGION=us-east-1
3. Instalar dependências
O projeto usa uv para gerenciamento de dependências:
# Instale o uv se ainda não tiver
curl -LsSf https://astral.sh/uv/install.sh | sh
# Crie o ambiente
uv venv --python 3.13
# Ative o ambiente
source .venv/bin/activate
# Instale as dependências
uv sync
Alternativamente, usando pip:
pip install -r requirements.txt
4. Bootstrap do AWS CDK
cdk bootstrap aws://YOUR-ACCOUNT-ID/YOUR-REGION
Exemplo:
cdk bootstrap aws://123456789012/us-east-1
5. Solicitar aumento de cota de serviço
Solicite um aumento de cota para seis instâncias ml.g5.xlarge em jobs de processamento do SageMaker AI pelo Console de Gerenciamento da AWS.
6. Configuração
A configuração do job de processamento é definida em config/config.yaml:
- Tipo de instância:
ml.g5.xlarge(com GPU) - Quantidade de instâncias: 6
- Tamanho do volume: 125 GB
- Container: imagem Docker personalizada do ComfyUI
7. Implantar as stacks
cdk deploy --all --require-approval never
Atenção: a partir desse comando, custos começam a ser gerados na sua conta AWS.
8. Acionar o job de processamento
Após a implantação, acione os jobs pelo nome da função Lambda criada pelo AWS CDK:
ComfyUiSmStack-ProcessingJob-Trigger-ComfyUI-trigger-Lambda
Você pode invocar a função pelo Console de Gerenciamento da AWS (serviço Lambda → botão Test) ou pela AWS CLI:
aws lambda invoke --function-name <function-name> response.json
Ao ser invocada, a função Lambda gera um nome único para o job com timestamp, cria o job de processamento no SageMaker AI com a configuração predefinida e provisiona seis instâncias GPU ml.g5.xlarge.
Limpeza de recursos
Para evitar cobranças contínuas, siga os passos abaixo após os testes:
aws s3 rm s3://<comfyui-output-bucket> --recursive
aws s3 rm s3://<comfyui-logging-bucket> --recursive
cdk destroy --all --force
Conclusão
A solução descrita pela AWS demonstra como é possível automatizar a geração de conteúdo com IA em escala combinando o ComfyUI com a infraestrutura gerenciada de GPU do SageMaker AI. O modelo Z-Image Turbo com 6 bilhões de parâmetros entrega imagens fotorrealistas mantendo os custos de inferência baixos, enquanto o AWS CDK implanta toda a infraestrutura com segurança, criptografia e isolamento de rede já integrados desde o início.
Com cobrança por segundo e encerramento automático das instâncias, as empresas pagam apenas pelo processamento efetivamente consumido. O código completo da solução está disponível no repositório no GitHub, e a documentação oficial pode ser consultada na documentação do SageMaker AI.
Fonte
Running ComfyUI workflows on Amazon SageMaker AI processing jobs (https://aws.amazon.com/blogs/machine-learning/running-comfyui-workflows-on-amazon-sagemaker-ai-processing-jobs/)
Leave a Reply