Agentic Catalog Experience no Amazon QuickSight: catálogos de dados conectados à IA

O problema que a AWS decidiu resolver

Times de dados em grandes organizações já investiram muito em plataformas de catálogo — AWS Glue, Databricks Unity Catalog, Snowflake Horizon, Collibra, dbt. Nessas ferramentas, engenheiros e analistas definem descrições de tabelas, semântica de colunas, relacionamentos entre chaves primárias e estrangeiras, termos de glossário e métricas de negócio. É um trabalho cuidadoso, que leva tempo e exige alinhamento entre áreas.

O problema é que esse contexto rico raramente chega até o usuário final. Quando um gerente de vendas ou um diretor financeiro vai fazer uma pergunta em linguagem natural para uma ferramenta de análise com Linguagem Natural para SQL (Text2SQL), a resposta que recebe é tão boa quanto o contexto semântico disponível na camada de consumo — e esse contexto, na maioria das vezes, precisa ser recriado manualmente.

Três desafios se acumulam nesse cenário:

  • Descoberta limitada: com milhares de tabelas em catálogos corporativos, encontrar os ativos certos para um relatório específico é como procurar uma agulha no palheiro. Não há como descrever o que você precisa e deixar o sistema encontrar.
  • Fragmentação semântica: metadados ricos que já existem nos catálogos upstream — descrições de negócio, definições de colunas, relacionamentos — não fluem automaticamente. Curadoras precisam recriar tudo do zero, com risco real de inconsistência. “Receita” significa bruta ou líquida? “Cliente ativo” é quem comprou nos últimos 30 ou 90 dias? Essas definições existem upstream, mas exigem re-entrada manual.
  • Tempo de entrega em semanas: a combinação de descoberta manual e recriação manual faz com que o caminho entre o dado e o insight demore semanas. E quando as definições upstream mudam, os metadados criados manualmente ficam desatualizados — gerando o que a AWS chama de “deriva semântica”, que corrói a confiança nas respostas da IA ao longo do tempo.

O problema, como a AWS aponta, não está no upstream. Os metadados existem. A governança está definida. Os relacionamentos estão mapeados. O gargalo é a última milha: traduzir esse contexto de catálogo em uma experiência consumível que entregue respostas de IA confiáveis e dashboards determinísticos para os usuários finais.

O que é a Agentic Catalog Experience

A AWS anunciou a Agentic Catalog Experience no Amazon Quick como um fluxo de trabalho com Inteligência Artificial (IA) que ajuda curadoras de dados a definir rapidamente seu escopo de contexto, herdar semântica dos catálogos upstream e habilitar usuários finais para perguntas e respostas fundamentadas em dados confiáveis.

No centro dessa experiência está o Quick Agent, um agente de IA com escopo definido para tarefas de descoberta, criação e herança dentro do contexto do catálogo. Ele usa o contexto semântico da conexão com o catálogo para:

  • Resumir o catálogo completo de forma acessível;
  • Conduzir uma conversa em linguagem natural com a curadora;
  • Identificar as tabelas e relacionamentos mais relevantes para o caso de uso informado;
  • Avaliar a prontidão dos metadados disponíveis.

Com uma única confirmação conversacional, o agente cria automaticamente Datasets e Tópicos gerados pelo catálogo, com metadados herdados do upstream — sem configuração manual, sem troca de contexto, sem semanas de setup.

Como o fluxo funciona na prática

Descoberta de ativos em linguagem natural

Em vez de navegar por milhares de tabelas, a curadora descreve o que precisa em linguagem natural. Por exemplo: “Sou analista sênior do time de Finanças. Preciso de tabelas para relatórios de receita trimestral e análise de custos.” O Quick Agent pesquisa em todo o catálogo e retorna as tabelas mais relevantes, considerando descrições de negócio, tags, classificações Gold/Silver/Bronze, scores de qualidade, scores de saúde das tabelas e termos de glossário.

Criação em massa de datasets pelo agente

Após a curadora selecionar as tabelas desejadas, o Quick Agent cria as representações de catálogo (Datasets) em escala, em um único fluxo guiado. O caminho padrão de criação é via Consulta Direta (DirectQuery), o que significa que o catálogo upstream permanece como fonte de verdade — nenhum dado é copiado ou movido. Os Datasets com semântica herdada recebem um indicador visual “Semantics Inherited” e seus metadados são somente leitura. As autoras podem sincronizar os metadados herdados sob demanda, usando o botão de sincronização.

Herança de semântica e relacionamentos

O Quick Agent carrega metadados específicos do catálogo para os ativos que cria. A herança hoje é deliberadamente focada em duas áreas:

  • Definições de tabelas e colunas para Datasets: descrições de negócio e definições de colunas são herdadas diretamente, garantindo que curadoras e usuários finais tenham o contexto semântico necessário.
  • Relacionamentos de chaves primárias e estrangeiras para Tópicos: o agente detecta os relacionamentos e os usa para sugerir e criar construções multi-dataset (Tópicos) com joins em esquema estrela e snowflake pré-configurados.

Vale destacar que todos os metadados disponíveis — classificações Gold/Silver, scores de qualidade, tags e scores de saúde — são utilizados durante a descoberta para encontrar as tabelas certas. Mas a herança para dentro dos Datasets é intencionalmente limitada a definições de tabelas e colunas por ora. A AWS indica que novos tipos de metadados serão adicionados aos Datasets ao longo do tempo.

Consumo imediato

Os Datasets e Tópicos criados ficam disponíveis para uso imediato: é possível iniciar uma conversa de Perguntas e Respostas (Q&A) com os novos Datasets, construir visualizações determinísticas com contexto semântico já configurado e compartilhar os Datasets com usuários de negócio para análise self-service. Após a criação, os metadados alimentam o Amazon Quick semantic store, que potencializa o re-ranking e o contexto unificado para Q&A com IA.

Princípio de design: consumidor, não catálogo

Um ponto importante da arquitetura é que o Amazon Quick é posicionado como consumidor de metadados de catálogos upstream — não como um catálogo dedicado. Isso tem implicações práticas:

  • Sem duplicação de dados: Datasets gerados pelo catálogo usam DirectQuery. Nenhum dado é copiado ou movido.
  • Metadados consumidos como contexto: a semântica herdada é somente leitura no Amazon Quick e alimenta o semantic store para re-ranking e fundamentação das respostas de IA. O catálogo upstream permanece como fonte autoritativa.
  • Sincronização manual sob demanda: autoras podem atualizar os metadados herdados a qualquer momento. Sincronização automática agendada está no roadmap.
  • Extensibilidade com transparência: Datasets gerados pelo catálogo exibem a semântica herdada como somente leitura. Se uma autora optar por editar um Dataset, o Amazon Quick exibe uma notificação clara informando que a edição cria um Dataset customizado e que a sincronização semântica deixa de se aplicar. Isso dá controle total às autoras enquanto preserva a integridade do catálogo por padrão.

Catálogos suportados atualmente

No momento do anúncio, a Agentic Catalog Experience suporta dois catálogos:

  • AWS Glue Data Catalog: autenticação via Função de Gerenciamento de Identidade e Acesso da AWS (IAM Role ARN — Amazon Resource Name).
  • Databricks Unity Catalog: autenticação via OAuth 2.0 ou Token de Acesso Pessoal (Personal Access Token).

Suporte para plataformas adicionais de catálogo está previsto para breve.

O que é herdado de cada catálogo

A herança de metadados é focada para manter os Datasets limpos e prontos para produção:

  • Para Datasets (definições de tabelas e colunas): descrições técnicas e de negócio de tabelas; descrições e nomes de exibição de colunas; tipos de dados e nulabilidade; termos de glossário e sinônimos.
  • Para Tópicos (relacionamentos): relacionamentos de chaves primárias e estrangeiras; definições de relacionamentos e cardinalidade; modelos de esquema estrela e snowflake.

Como fica a experiência para o usuário final

Para ilustrar o impacto prático, a AWS descreve o seguinte cenário: um gerente de vendas pergunta “Quais foram nossas vendas do quarto trimestre por região?”. Por trás dos panos, o agente de IA busca nos Datasets gerados pelo catálogo usando descrições de negócio e termos de glossário, identifica a tabela sales.revenue_by_product (classificação Gold, qualidade de 98%), aplica os joins pré-configurados do Tópico para combinar as dimensões relevantes e respeita as regras de mascaramento de Informações de Identificação Pessoal (PII — Personally Identifiable Information) provenientes dos metadados do catálogo. O resultado é uma resposta confiável e fundamentada em segundos.

A curadora definiu o contexto uma única vez com o Quick Agent — e todos os usuários finais se beneficiam imediatamente.

Contexto empresarial unificado

A Agentic Catalog Experience não opera de forma isolada. Combinada com as capacidades mais amplas do Amazon Quick — incluindo integração com Slack, Outlook, documentos e bases de conhecimento — os usuários finais recebem contexto empresarial completo:

  • Dados estruturados dos catálogos via Datasets gerados pelo catálogo;
  • Contexto não estruturado de documentos, e-mails e conversas;
  • Regras de negócio de termos de glossário e definições de métricas.

Esse contexto unificado viabiliza respostas de IA prontas para produção, fundamentadas nos dados e na semântica específicos de cada organização.

Conectando ao AWS Glue Data Catalog: visão geral do fluxo

Para começar com a Agentic Catalog Experience via AWS Glue Data Catalog, a AWS orienta a criação de uma conexão de fonte de dados no Amazon Quick. Uma conexão com o Glue Data Catalog funciona em conjunto com uma conexão com o Amazon Athena: o Glue fornece os metadados (definições de tabelas, colunas e relacionamentos), enquanto o Athena fornece o caminho de consulta aos dados armazenados no Amazon Simple Storage Service (Amazon S3).

Após criar ambas as conexões, a curadora acessa a fonte de dados e escolhe “Explorar dados” para abrir o Quick Agent com escopo definido para aquela conexão específica. O agente resume os catálogos e bancos de dados disponíveis, identifica o schema (estrela, snowflake, etc.), detecta relacionamentos entre as tabelas e, com uma única confirmação, cria todos os Datasets e o Tópico com os joins pré-configurados. O Tópico fica imediatamente disponível para perguntas em linguagem natural.

O mesmo fluxo se aplica ao Databricks Unity Catalog: cria-se a fonte de dados, escolhe-se “Explorar dados”, o agente resume o catálogo e, com uma confirmação, cria Datasets e um Tópico com os joins do schema estrela já configurados. Usuários finais conseguem então responder perguntas complexas que cruzam múltiplas tabelas relacionadas.

O resultado em perspectiva

A proposta da Agentic Catalog Experience é clara: reduzir o tempo de configuração de semanas para minutos, eliminar a recriação manual de metadados que já existem nos catálogos upstream e garantir que as respostas de IA sejam fundamentadas em definições de negócio confiáveis — não em suposições.

Para times de dados brasileiros que já investiram em plataformas como AWS Glue ou Databricks Unity Catalog, essa integração representa uma mudança significativa no custo operacional de habilitar usuários de negócio para análise self-service com IA.

Fonte

Announcing the Agentic Catalog Experience in Amazon Quick (https://aws.amazon.com/blogs/machine-learning/announcing-the-agentic-catalog-experience-in-amazon-quick/)

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *