O problema de monitorar a web manualmente
Acompanhar dezenas de sites ao mesmo tempo é um trabalho que rapidamente se torna inviável quando feito de forma manual. Times de design precisam rastrear produtos de concorrentes, equipes de marketing querem monitorar tendências de conteúdo, e gerentes de produto precisam estar por dentro da inteligência de mercado. Mas fazer isso na mão significa visitar sites, copiar conteúdo e organizar informações antes mesmo de começar qualquer análise real.
Scrapers baseados em regras oferecem alguma automação, mas são fortemente acoplados à estrutura das páginas. Uma redesign do site ou uma migração para um frontend renderizado via JavaScript pode quebrar silenciosamente o pipeline por dias antes que alguém perceba.
Para resolver esse cenário, a AWS publicou uma solução de extração automatizada de insights utilizando o Amazon Bedrock AgentCore — uma plataforma para construir, conectar e otimizar agentes em escala, com qualquer framework ou modelo. O componente central da solução é o AgentCore Browser, um serviço de navegador totalmente gerenciado que renderiza páginas com muito JavaScript de forma confiável, tornando o pipeline mais resiliente às mudanças nos sites.
O que a solução entrega
A arquitetura combina quatro serviços principais: o Amazon Bedrock AgentCore Browser para automação do navegador, o Amazon Bedrock para análise com IA, o Amazon OpenSearch Serverless para busca semântica e o AWS Lambda para orquestração. O resultado é um sistema que monitora feeds RSS, recupera conteúdo da web usando o navegador gerenciado, extrai insights com IA e disponibiliza tudo em uma interface de busca.
Os casos de uso cobertos pela solução incluem:
- Inteligência competitiva: rastreamento de blogs de concorrentes, anúncios de produtos e comunicados à imprensa, com identificação de novos recursos, mudanças de preço ou movimentos estratégicos.
- Pesquisa de mercado: monitoramento de notícias do setor, relatórios de analistas e publicações especializadas para identificar tendências emergentes.
- Curadoria de conteúdo: agregação de conteúdo de múltiplas fontes com a IA identificando as peças mais relevantes para o público.
- Monitoramento de conformidade: acompanhamento de sites regulatórios e fontes de notícias para mudanças que possam afetar o negócio.
A implementação completa está disponível neste repositório no GitHub.
Como a arquitetura funciona
A arquitetura segue um padrão orientado a eventos que separa a coleta de conteúdo do processamento. O sistema é organizado em três camadas funcionais.

Coleta via feeds RSS
Um agendamento no Amazon EventBridge dispara uma função AWS Lambda a cada 15 minutos para verificar os feeds RSS configurados em busca de novos artigos, realizando deduplicação com base no Amazon Simple Storage Service (Amazon S3).
Recuperação de conteúdo via navegador gerenciado
Para cada novo artigo, a função Lambda abre uma sessão de navegador pelo Amazon Bedrock AgentCore e se conecta a ela usando o Playwright sobre o Protocolo Chrome DevTools (CDP). Diferente de requisições HTTP comuns, o navegador remoto renderiza a página completa — incluindo conteúdo JavaScript pesado —, aguarda o carregamento de elementos dinâmicos, tira um screenshot e faz o download de imagens. Esse é o passo que torna o restante do pipeline possível: sem renderização confiável de páginas, a extração por IA receberia conteúdo incompleto ou quebrado. Os artefatos são enviados ao Amazon S3 em um formato estruturado.
Vale destacar que esse não é um navegador headless rodando dentro do Lambda. É um serviço de navegador gerenciado: o AgentCore hospeda o navegador remoto, e o Playwright o controla por meio de uma conexão WebSocket.
Os arquivos são armazenados com a seguinte estrutura no S3:
s3://bucket/
└── example.com/
└── abc123def456/ # hash da URL
├── article.html # HTML completo
├── screenshot.png # screenshot da página
├── metadata.json # metadados do artigo
└── images/ # imagens capturadas
├── image1.jpg
└── image2.jpg
O arquivo metadata.json inclui a URL original, título, timestamp e referências para os assets baixados. Quando esse arquivo é enviado ao Amazon S3, ele dispara automaticamente o pipeline de processamento.
Processamento orientado a eventos
Eventos de upload no Amazon S3 publicam mensagens em uma fila do Amazon Simple Queue Service (Amazon SQS), e uma segunda função Lambda extrai o texto limpo do HTML bruto.
Extração de insights com IA
O Amazon Bedrock gera resumos, identifica temas e entidades, extrai insights acionáveis e cria embeddings vetoriais a partir do conteúdo limpo. Antes de enviar o conteúdo ao Bedrock, a função Lambda executa um pré-processamento do HTML para reduzir o consumo de tokens — um passo que melhora significativamente a consistência da saída gerada pela IA. Arquivos HTML grandes (acima de 1 MB) são simplificados com a biblioteca html-to-text para evitar limites de tokens. Arquivos menores usam a biblioteca Readability da Mozilla, que faz um trabalho melhor de extrair o conteúdo principal e identificar a imagem primária.
O prompt enviado ao Amazon Bedrock solicita a extração de:
- Um resumo conciso
- Temas e tópicos principais
- Entidades principais (pessoas, empresas, produtos)
- Categorias relevantes
- Insights acionáveis
Para verificar a disponibilidade de modelos por região da AWS, consulte a documentação de modelos suportados por região no Amazon Bedrock.
Indexação e busca semântica
Os resultados enriquecidos são indexados no Amazon OpenSearch Serverless, que suporta tanto busca por palavras-chave quanto busca vetorial. Uma consulta como “quais são as tendências emergentes de design” retorna resultados relevantes mesmo que essas palavras exatas não apareçam no conteúdo-fonte — é o embedding vetorial que torna a interface de busca genuinamente útil para inteligência competitiva ou pesquisa de mercado.
Acesso via interface web e API
Os usuários finais se autenticam pelo Amazon Cognito e acessam um frontend em React hospedado no Amazon Elastic Container Service (Amazon ECS) com AWS Fargate. Para acesso programático, um servidor MCP (Protocolo de Contexto de Modelo) no Amazon ECS com Fargate expõe o sistema via Amazon CloudFront. O MCP é um padrão aberto que permite que assistentes de IA e ferramentas se conectem a fontes de dados externas por meio de uma interface unificada.
Controles de IA responsável
Como o pipeline envia conteúdo de terceiros a um modelo de fundação e publica a saída gerada pela IA para a equipe, implantações em produção devem incluir salvaguardas. O Amazon Bedrock Guardrails permite aplicar esses controles sem alterar o prompt de extração:
- Filtragem de conteúdo: bloqueia material prejudicial ou inapropriado que possa aparecer em páginas web antes de chegar ao índice pesquisável.
- Tópicos negados e filtros de palavras: mantêm os insights extraídos dentro do escopo esperado pelos times, o que importa quando os feeds de origem estão fora do controle da organização.
- Verificações de fundamentação contextual: validam que os resumos e insights gerados estão fundamentados no artigo-fonte, reduzindo o risco de afirmações alucinadas serem indexadas como fatos.
Como o pipeline ingere conteúdo de sites externos, o texto coletado deve ser tratado como entrada não confiável — os guardrails atuam como ponto de controle entre o conteúdo bruto da web e os insights que a organização consome.
Lições aprendidas na construção do pipeline
A AWS compartilhou algumas decisões arquiteturais que tiveram impacto desproporcional em custo, confiabilidade e qualidade de saída:
- Sessões do AgentCore Browser são poderosas, mas custosas. Cada renderização via Playwright pelo Amazon Bedrock AgentCore leva de 10 a 30 segundos e custa significativamente mais do que uma requisição HTTP simples. O uso de hash de URL para deduplicação — verificando o Amazon S3 antes de acionar uma nova sessão do AgentCore — é essencial para manter os custos gerenciáveis em escala.
- HTML bruto é uma entrada ruim para LLMs. Limpar o HTML antes de enviá-lo ao Amazon Bedrock reduz o consumo de tokens e melhora a consistência da saída. Esse pré-processamento não é uma otimização — é um pré-requisito para resultados confiáveis.
- A busca semântica amplia o que você consegue encontrar. Uma busca por palavras-chave retorna correspondências exatas, enquanto a busca vetorial traz conteúdo conceitualmente relacionado independentemente da terminologia usada.
- O desacoplamento via SQS é o que torna o pipeline confiável. Sem ele, uma falha de processamento significa que o artigo nunca é analisado. Uma fila de mensagens mortas (DLQ) entre o Amazon S3 e a Lambda de extração fornece retentativas automáticas — uma pequena mudança arquitetural com impacto significativo na confiabilidade.
- O Amazon OpenSearch Serverless tem um custo mínimo real. O serviço exige unidades de capacidade mínimas independentemente do uso, o que é adequado para cargas de trabalho de produção com volume consistente de consultas. Para implantações de menor volume, o Amazon Relational Database Service (Amazon RDS) com pgvector suporta as mesmas capacidades de busca vetorial com um custo base menor. Consulte os detalhes de preços do Amazon OpenSearch Serverless.
Conclusão
A solução apresentada pela AWS transforma o monitoramento manual da web em uma base de conhecimento pesquisável e enriquecida com IA. A arquitetura orientada a eventos desacopla a coleta de conteúdo do processamento, o Amazon Bedrock AgentCore lida com sites com JavaScript pesado, e o Amazon OpenSearch Serverless com embeddings vetoriais potencializa a busca semântica além da correspondência por palavras-chave.
O código-fonte completo, o guia de implantação e as instruções de configuração estão disponíveis no repositório no GitHub. Para quem quiser se aprofundar nos serviços envolvidos, a AWS também disponibiliza a documentação do Amazon Bedrock AgentCore Browser e o guia do desenvolvedor do Amazon OpenSearch Serverless.
Fonte
Automated web insight extraction with Amazon Bedrock AgentCore (https://aws.amazon.com/blogs/machine-learning/automated-web-insight-extraction-with-amazon-bedrock-agentcore/)
Leave a Reply