IA e Dados Abertos do Setor Elétrico Brasileiro
Eiza Carvalho prestígio (1)
Avaliação por modelos + Supervisão Editorial.
Aceite definitivo do comitê
Endossado por Thiago Peixoto.
O número, o score e a prova de integridade são os mesmos desde a publicação — o endosso é uma camada de confiança, não recalcula nada.
Como o ONS democratiza o acesso ao conhecimento do setor elétrico por meio de IA, interoperabilidade e inovação aberta
Resumo executivo
O TIAGO, Tecnologia de Inteligência Artificial Generativa do ONS, integrada ao Portal de Dados Abertos, democratiza o acesso aos dados e informações do setor elétrico brasileiro. Ao eliminar barreiras técnicas que tradicionalmente restringiam o uso dos dados públicos a perfis técnicos, a solução agora permite que qualquer pessoa possa obter informações, gráficos e análises, utilizando linguagem natural e dispensando conhecimentos em programação ou manipulação de dados.
Além do copiloto conversacional, a iniciativa combina outros dois pilares complementares: contratos de dados, que estruturam e enriquecem os dados para consumo por LLMs, e o primeiro servidor MCP do setor elétrico brasileiro, que permite que cidadãos, pesquisadores e empresas utilizem seus próprios assistentes, agentes e plataformas de IA para consumir os dados públicos do ONS. Com isso, o Operador evolui de um provedor de dados para uma plataforma aberta de interoperabilidade e inovação, capaz de acelerar pesquisas, análises, aplicações e automações em todo o ecossistema do setor elétrico.
Além do impacto tecnológico, o TIAGO representa um caso concreto de inovação aberta. A iniciativa nasceu de um desafio da 6ª edição do DatathONS, programa de inovação voltado à conexão entre universidades e desenvolvimento de jovens talentos, e evoluiu para uma solução operacional disponibilizada à sociedade. Com alcance global, o Portal de Dados Abertos do ONS registra cerca de 2,3 milhões de downloads mensais distribuídos em 76 países. Já o TIAGO registra por mês, em média, 6,2 mil usuários, 9,4 mil perguntas em linguagem natural e 20 mil chamadas ao MCP, com tempo médio de resposta de 26,4 segundos. O projeto demonstra como uma ideia originada em um desafio universitário pode ser transformada em um produto de uso público, criando uma arquitetura replicável para organizações de diferentes setores que buscam combinar dados, inteligência artificial, transparência e inovação aberta.
Paper completo
Entre para baixar o PDF registrado# IA e Dados Abertos do Setor Elétrico Brasileiro: como o ONS democratiza o acesso ao conhecimento do setor elétrico por meio de IA, interoperabilidade e inovação aberta
Resumo
A abertura de dados é um dos principais instrumentos de transparência e democratização da informação. Entretanto, disponibilizar dados não significa necessariamente torná-los acessíveis. No setor elétrico brasileiro, embora o Portal de Dados Abertos do ONS publique desde 2021 dezenas de conjuntos de dados do Sistema Interligado Nacional (SIN), o acesso efetivo ao conhecimento ainda dependia de competências técnicas em manipulação de dados, programação e construção de análises, limitando seu uso a públicos especializados.
Este artigo apresenta o TIAGO Dados Abertos, iniciativa que promove a evolução da estratégia de Open Data para Accessible Information, transformando dados públicos disponíveis em conhecimento acessível e democrático com o apoio de inteligência artificial. A solução combina três pilares complementares: contratos de dados enriquecidos para consumo por IA; um copiloto conversacional capaz de responder perguntas em linguagem natural de forma transparente, com gráficos e consultas reprodutíveis; e o primeiro servidor MCP (Model Context Protocol) público do setor elétrico brasileiro, permitindo que cidadãos, pesquisadores, empresas e agentes de IA consumam os dados públicos do ONS de forma padronizada e interoperável.
Mais do que um assistente conversacional, o TIAGO estabelece uma nova infraestrutura pública preparada para inteligência artificial, integrando governança de dados, interoperabilidade, transparência algorítmica, IA responsável e inovação aberta. A iniciativa amplia significativamente o potencial de utilização dos dados do setor elétrico ao eliminar barreiras técnicas que tradicionalmente limitavam seu uso a públicos especializados.
Os resultados iniciais evidenciam o potencial transformador da abordagem. O Portal de Dados Abertos do ONS alcança aproximadamente 2,3 milhões de downloads mensais distribuídos em 76 países, enquanto o TIAGO registra, em média, 6,2 mil usuários, 9,4 mil perguntas processadas e 15 mil chamadas ao servidor MCP por mês. O desenvolvimento da solução teve origem em um desafio da 6ª edição do DatathONS, programa de inovação voltado à conexão entre universidades e ao desenvolvimento de jovens talentos, demonstrando como a inovação aberta pode ser convertida em produtos de impacto para a sociedade.
A principal contribuição deste trabalho não reside em um componente tecnológico isolado, mas na integração de práticas consolidadas de IA, contratos de dados, interoperabilidade e governança em uma arquitetura pública replicável. O caso demonstra como organizações podem evoluir de simples provedoras de dados para plataformas abertas de conhecimento, democratização da informação, aceleração da inovação e geração de valor público.
Palavras-chave: dados abertos; democratização do conhecimento; inteligência artificial; interoperabilidade; contratos de dados; MCP; inovação aberta; setor elétrico; IA responsável.
1. Introdução
A publicação de dados abertos é um dos principais instrumentos de transparência, reuso da informação e participação social na era digital. No setor elétrico brasileiro, o Portal de Dados Abertos do ONS cumpre esse papel ao disponibilizar dados históricos do Sistema Interligado Nacional (SIN) em formatos reutilizáveis, como CSV, XLSX, JSON e Parquet, atendendo agentes do setor, órgãos públicos, academia, imprensa, instituições financeiras, pesquisadores e a sociedade em geral.
Entretanto, disponibilizar dados não significa, necessariamente, democratizar o acesso ao conhecimento. A existência de dados públicos não garante que diferentes públicos consigam transformá-los em informações úteis para tomada de decisão, pesquisa ou geração de valor. Antes do TIAGO, responder a uma pergunta aparentemente simples, como “qual foi a geração eólica no Nordeste em 2026?”, exigia identificar o conjunto de dados correto, compreender escopo, periodicidade, colunas e unidades, baixar e tratar arquivos, escrever fórmulas, códigos ou consultas SQL, validar resultados e, somente então, produzir tabelas e gráficos. Essa jornada limitava o uso efetivo dos dados a públicos com maior maturidade técnica e reproduzia uma assimetria relevante: os dados eram públicos, mas o conhecimento derivado deles permanecia acessível principalmente a especialistas.
Este artigo está organizado da seguinte forma. A Seção 2 apresenta o estado da arte e os trabalhos relacionados, posicionando a iniciativa em relação a soluções similares. A Seção 3 descreve o método de desenvolvimento e a arquitetura da solução. A Seção 4 detalha a metodologia de avaliação e a coleta dos indicadores utilizados. A Seção 5 apresenta os resultados e o alcance da iniciativa. As Seções 6 e 7 tratam, respectivamente, dos aspectos de segurança e IA responsável e da eficiência econômica. As Seções 8 a 10 discutem o ineditismo, a origem em inovação aberta e o potencial de replicabilidade. Por fim, a Seção 11 aborda limitações e cuidados, e a Seção 12 apresenta as conclusões do trabalho.
2. Estado da arte e trabalhos relacionados
A democratização do acesso ao conhecimento por meio de inteligência artificial não depende de uma tecnologia isolada, mas da integração de múltiplas disciplinas já consolidadas na literatura e na indústria. O TIAGO combina conceitos de dados abertos, Text-to-SQL, contratos de dados, interoperabilidade para agentes de IA e IA responsável em uma arquitetura orientada à ampliação do acesso e da reutilização da informação pública. Compreender essas bases é fundamental para identificar com precisão onde reside a contribuição deste trabalho.
2.1 Dados abertos governamentais, FAIR e o “último quilômetro” do acesso
O movimento de dados abertos governamentais consolidou princípios de acesso, qualidade, reuso, redistribuição e participação universal, formalizados por iniciativas como a Open Definition e a Open Data Charter. Na dimensão científica e técnica, os princípios FAIR (Findable, Accessible, Interoperable and Reusable), apresentados por Wilkinson et al. (2016), tornaram-se uma das principais referências para a gestão de dados reutilizáveis por pessoas e sistemas computacionais.
A literatura de governo digital, contudo, aponta de forma recorrente uma lacuna entre a disponibilização de dados e sua utilização efetiva. A existência de portais e catálogos não elimina desafios relacionados à descoberta do conjunto de dados adequado, à interpretação de sua estrutura e à sua utilização em processos analíticos. Esse desafio é frequentemente descrito como o “último quilômetro” do acesso à informação.
Nesse contexto, o TIAGO posiciona-se como uma camada complementar ao Portal de Dados Abertos do ONS. A iniciativa não substitui os princípios de dados abertos nem os referenciais FAIR, mas utiliza mecanismos de inteligência artificial, contratos de dados e interoperabilidade para facilitar a interação com os conjuntos publicados, preservando a rastreabilidade e a governança das informações.
2.2 Text-to-SQL e benchmarks acadêmicos (Spider, BIRD)
A tradução de linguagem natural para SQL (Text-to-SQL) é um problema clássico de interfaces de banco de dados. Entre os principais benchmarks utilizados para avaliar o estado da arte destacam-se o Spider (Yu et al., 2018), que introduziu avaliações cross-domain sobre esquemas complexos e múltiplas tabelas, e o BIRD (Li et al., 2023), que ampliou o realismo dos testes ao incluir 95 bancos de dados, 37 domínios profissionais e 12.751 pares pergunta–SQL, incorporando dados heterogêneos e a necessidade de conhecimento externo. Um dos resultados mais relevantes reportados pelo BIRD é a diferença significativa entre o desempenho humano e o dos modelos de linguagem: a acurácia de execução humana alcançou 92,96%, enquanto o melhor LLM avaliado obteve 40,08%, evidenciando que a tradução de linguagem natural para consultas SQL em esquemas arbitrários permanece um problema em aberto.
Esse resultado é particularmente relevante para posicionar o TIAGO. A solução não busca resolver o problema geral de Text-to-SQL em bases arbitrárias. Em vez disso, adota uma abordagem orientada a domínio, reduzindo deliberadamente a complexidade do problema por meio de contratos de dados curados (Seção 2.4), de um catálogo finito e versionado de conjuntos de dados e de uma execução restrita a consultas somente leitura sobre arquivos Parquet. Trata-se de uma escolha de arquitetura que privilegia confiabilidade, auditabilidade e reprodutibilidade em detrimento da generalidade. Consequentemente, as métricas apresentadas neste trabalho devem ser interpretadas sob essa perspectiva: não como uma avaliação de propósito geral para Text-to-SQL, mas como a avaliação de uma solução especializada para consulta de dados públicos do setor elétrico brasileiro.
2.3 Retrieval-Augmented Generation (RAG) e seleção semântica
A geração aumentada por recuperação (Retrieval-Augmented Generation — RAG), proposta por Lewis et al. (NeurIPS 2020), combina recuperação de contexto relevante com geração por modelos de linguagem, reduzindo alucinações e ancorando respostas em fontes verificáveis. No TIAGO, o RAG não é utilizado para recuperar documentos ou texto livre, mas para selecionar o conjunto de dados mais adequado a partir da pergunta realizada pelo usuário. Para isso, a solução combina sinais léxicos (TF-IDF), embeddings semânticos e técnicas de reranqueamento por LLM aplicadas aos metadados dos contratos de dados. Trata-se, portanto, de uma aplicação de RAG sobre um catálogo estruturado de dados, e não sobre bases documentais tradicionais.
2.4 Contratos de dados e o padrão aberto ODCS
Contratos de dados (data contracts) formalizam, entre produtores e consumidores de dados, o esquema, a semântica, as garantias de qualidade e as regras de uso de um conjunto, deslocando a interpretação dos dados do momento de execução para um artefato versionado e governado. O TIAGO adota o ODCS (Open Data Contract Standard), especificação aberta mantida pelo projeto Bitol sob a Linux Foundation (LF AI & Data), utilizada para descrever cada conjunto por meio de atributos como colunas, tipos, chaves, granularidade, exemplos de consultas (few-shot queries), caminhos de armazenamento e URLs de origem. A adoção de um padrão aberto, em vez de uma estrutura proprietária, favorece a interoperabilidade, a governança e a replicabilidade da solução.
2.5 Model Context Protocol (MCP) e interoperabilidade de agentes
O Model Context Protocol (MCP), publicado pela Anthropic como padrão aberto em novembro de 2024, define uma interface comum para conectar assistentes e agentes de IA a fontes de dados e ferramentas externas, reduzindo o problema de integração de M×N conexões para um modelo M+N. A rápida adoção do MCP pela indústria o transformou, em pouco mais de um ano, em uma referência de fato para interoperabilidade entre agentes e sistemas de inteligência artificial.
O TIAGO disponibiliza os dados do Portal por meio de um servidor MCP público, apresentado como o primeiro do setor elétrico brasileiro, permitindo que ferramentas externas de IA consumam os conjuntos de dados do Operador de forma padronizada, sem a necessidade de raspagem, downloads manuais ou integrações específicas para cada aplicação.
2.6 IA responsável, guardrails e transparência algorítmica
A operação de sistemas de IA voltados ao público geral demanda mecanismos de controle e gestão de riscos. Referenciais como o NIST AI Risk Management Framework (AI RMF 1.0, 2023) e a discussão consolidada sobre transparência algorítmica (“glass box” versus “black box”) orientam práticas de mensuração, mitigação e comunicação desses riscos. No TIAGO, esses princípios se materializam por meio de guardrails de entrada e saída (filtragem de conteúdo proibido e fora de contexto), execução em modo somente leitura, exposição das consultas e das fontes utilizadas, observabilidade e testes automatizados, descritos em maior detalhe nas Seções 3.4 e 6.
2.7 Posicionamento e comparação com soluções similares
Diante do exposto, o ineditismo do TIAGO não reside em um componente tecnológico isolado. Text-to-SQL, RAG, contratos de dados, MCP e guardrails são práticas já estabelecidas na literatura e na indústria. No entanto, não existe atualmente uma solução única de mercado que reúna, de forma integrada, todos os componentes necessários para viabilizar uma infraestrutura pública de dados preparada para IA, incluindo contratos de dados, descoberta semântica, geração de consultas, interoperabilidade por MCP, transparência algorítmica e mecanismos de governança. A Tabela 1 posiciona a solução em relação a categorias correlatas.
**Tabela 1 — Posicionamento frente a soluções correlatas**
| Dimensão | Text-to-SQL acadêmico (Spider/BIRD) | Copilotos corporativos | Portais de dados abertos tradicionais | TIAGO Dados Abertos | |---|---|---|---|---|
| | Escopo dos dados | Aberto e arbitrário | Fechado e privado | Dados públicos publicados | Fechado, público e curado por contratos | |
|---|---|---|---|---|
| | Fonte da semântica | Inferida em tempo de execução | Documentação interna | Dicionários, PDFs e metadados | Contratos ODCS versionados | |
| | Objetivo principal | Avanço científico | Produtividade e análise interna | Transparência e compartilhamento | Democratização do acesso ao conhecimento | |
| | Execução | Avaliada por benchmarks | Proprietária | Manual pelo usuário | Determinística, somente leitura e auditável | |
| | Transparência da resposta | N/A | Geralmente opaca | Acesso ao dado bruto | SQL, fonte e dados expostos (glass box) | |
| | Acesso por agentes externos | N/A | Limitado ou proprietário | Download ou API | Servidor MCP público | |
| | Reprodutibilidade | Alta (benchmark fixo) | Baixa | Alta, porém dependente de esforço técnico | Alta e de baixo custo cognitivo | |
| | Governança dos dados | Fora do escopo | Variável | Dependente do portal | Contratos, validações e guardrails | |
Em síntese, iniciativas de Text-to-SQL buscam generalidade sobre esquemas arbitrários; copilotos corporativos concentram-se em produtividade sobre dados privados; e portais tradicionais priorizam a disponibilização de dados. O TIAGO combina um catálogo de dados públicos curado por contratos, mecanismos de transparência baseados em glass box e interoperabilidade por MCP, integrando esses elementos em uma infraestrutura pública preparada para inteligência artificial e orientada à democratização do acesso ao conhecimento.
3. Método de desenvolvimento e arquitetura da solução
O TIAGO organiza-se em três camadas complementares: contratos de dados AI-ready, copiloto conversacional e servidor MCP, sustentadas por uma arquitetura de execução determinística e por controles de segurança em camadas. O princípio de desenho consiste em utilizar IA para compreender e planejar, e execução determinística para processar e responder, mantendo os resultados ancorados nos dados publicados.
3.1 Contratos de dados e preparação para IA (AI-ready data)
O pipeline de contratos de dados representa uma evolução do dicionário de dados tradicional. Enquanto o dicionário é voltado à compreensão humana, descrevendo campos, significados, unidades e regras para analistas e usuários técnicos, os contratos de dados estruturam esse mesmo conhecimento em formato consumível por sistemas e agentes de IA. No TIAGO, esses contratos são construídos conforme o padrão ODCS (Seção 2.4), que registra significado, limites, campos, tipos, métricas e contexto de negócio. Os contratos são previamente armazenados no catálogo, não produzidos dinamicamente durante a inferência do modelo. Com isso, a solução evita que a IA precise redescobrir, interpretar e organizar a semântica dos dados a cada interação, reduzindo consumo de tokens, tempo de processamento e variabilidade das respostas. Essa escolha desloca parte relevante do esforço cognitivo para uma etapa governada, versionada e reutilizável, tornando o uso da IA mais eficiente, auditável e escalável.
O diferencial é o uso de IA também para apoiar a construção do pipeline de contratos, formando um ciclo virtuoso: a IA ajuda a extrair e estruturar conhecimento sobre os dados; os contratos tornam os dados mais compreensíveis e governados; e os dados enriquecidos passam a sustentar novas aplicações de IA.
3.2 Copiloto conversacional (Text-to-SQL com self-healing)
A segunda camada é o copiloto conversacional. O usuário faz perguntas em linguagem natural, sem conhecer previamente o conjunto, a estrutura dos arquivos ou técnicas de manipulação de dados. O fluxo, orquestrado como um grafo de agentes, executa etapas explícitas: expansão de follow-up e classificação da pergunta; seleção do conjunto por RAG híbrido; planejamento; geração de SQL com schema context, few-shot e chain-of-thought de granularidade; execução analítica sobre Parquet; e validação em múltiplas camadas (sintaxe, semântica e limites físicos). Quando o validador detecta erro recuperável, o grafo aciona um ciclo de self-healing: erros de sintaxe retornam à geração de SQL, erros semânticos retornam ao planejamento, com número máximo de tentativas controlado.
A experiência substitui a jornada longa, localizar conjunto de dados → baixar datasets → tratar → programar → validar → visualizar, por um fluxo direto: perguntar → receber → verificar a fonte → reutilizar. As respostas incluem texto interpretativo, tabela de dados, gráficos gerados automaticamente, o SQL efetivamente executado, a fonte e os metadados (conjunto, período, unidade) e sugestões de follow-up.
3.3 Servidor MCP público
A terceira camada é o servidor MCP (Seção 2.5), o primeiro MCP público do setor elétrico brasileiro. Ele funciona como ponte padronizada entre ferramentas de IA e os dados do Portal: cidadãos, pesquisadores, empresas e desenvolvedores conectam seus próprios assistentes, agentes e plataformas aos conjuntos do Operador (endpoint público em https://dados.ons.org.br/mcp). Com isso, o ONS deixa de oferecer apenas arquivos para download e passa a disponibilizar uma infraestrutura aberta para IA, ampliando a autonomia do usuário, que pode optar pela interface oficial ou por seu próprio ambiente.
Além do endpoint público, o repositório do MCP está disponível ao público, permitindo que desenvolvedores, pesquisadores e organizações interessadas consultem sua implementação, compreendam o padrão de integração adotado e reutilizem ou adaptem códigos e componentes em soluções próprias, aumentando seu potencial de replicação em outras indústrias e setores.
3.4 Arquitetura de execução, segurança e observabilidade
A execução ocorre sobre uma arquitetura em nuvem gerenciada, com separação entre orquestração leve e computação analítica. Os modelos de linguagem são acessados via serviço gerenciado (API), com uso de prompt cache e seleção de modelos conforme a complexidade da tarefa. A execução analítica usa o motor DuckDB sobre arquivos Parquet armazenados em objeto (S3), com leitura direta e sem ETL dedicado por consulta. A transparência do processo é entregue por streaming em tempo real (SSE), que expõe o progresso por etapa, a Glass Box UI.
A segurança é organizada em camadas: proteção de perímetro (WAF), autenticação, limitação de requisições (rate limit) e bloqueio de abuso (red card), prompt guard e guardrails do modelo, além de CAPTCHA e monitoramento por sessão e endereço. A observabilidade combina contagem de tokens e custos, rastreamento de execução (Langfuse), telemetria (OpenTelemetry) e testes automatizados com consultas-ouro (golden queries).
Além disso, os componentes da arquitetura foram concebidos de forma modular e desacoplada, permitindo sua substituição por soluções de mercado ou pacotes de código aberto que ofereçam funcionalidades equivalentes. Essa escolha reduz dependências tecnológicas específicas, facilita a evolução incremental da solução e preserva a flexibilidade da arquitetura, permitindo que motores analíticos, modelos de linguagem, ferramentas de observabilidade, mecanismos de segurança ou camadas de orquestração sejam trocados conforme requisitos de custo, desempenho, governança ou maturidade tecnológica.
4. Metodologia de avaliação e coleta de indicadores
Esta seção detalha a metodologia de avaliação e a origem dos indicadores apresentados no artigo, explicitando o que foi medido, como, quando e com quais limitações. Distinguem-se três famílias de indicadores: (a) alcance do Portal; (b) uso inicial do TIAGO e do MCP; e (c) qualidade e desempenho técnicos da solução.
4.1 Origem, período de referência e natureza dos indicadores de uso
Os indicadores apresentados neste relato possuem naturezas distintas e, por isso, são classificados segundo sua origem, janela de referência e maturidade estatística. Essa distinção é necessária porque o Portal de Dados Abertos possui histórico de operação desde 2021, enquanto o TIAGO Dados Abertos e o servidor MCP correspondem a uma camada recém-disponibilizada ao público, com métricas referentes à sua operação inicial.
Os indicadores de alcance do Portal de Dados Abertos, como conjuntos publicados, volume de downloads, usuários mensais e países de acesso, derivam da analítica do próprio Portal e representam dados observados ao longo de sua operação. Quando apresentados como médias mensais, esses números devem ser entendidos como consolidações históricas do uso do Portal desde 2021, calculadas a partir dos registros disponíveis na plataforma de monitoramento.
Já os indicadores de uso do TIAGO e do MCP, usuários da IA, perguntas feitas ao copiloto, chamadas ao servidor MCP e tempo de resposta, derivam da telemetria da aplicação, dos registros de execução e das métricas de infraestrutura referentes ao mês de agosto de 2026. Por se tratar do primeiro mês de operação pública da solução, esses números devem ser lidos como indicadores observados de produção inicial, e não como métricas consolidadas de longo prazo. Ainda assim, não se trata de projeções: correspondem a registros efetivamente coletados durante a janela de referência de agosto de 2026.
Dessa forma, os resultados são interpretados em três grupos: indicadores históricos do Portal, que demonstram o alcance consolidado da política de dados abertos do ONS; indicadores observados de produção inicial do TIAGO e do MCP, que demonstram a adoção da nova camada conversacional e interoperável no mês de agosto de 2026; e métricas técnicas de avaliação, benchmark de seleção, latência e testes de guardrails, que evidenciam qualidade, desempenho e segurança do pipeline em condições controladas ou monitoradas.
4.2 Benchmark de seleção de conjunto (204 perguntas-ouro)
A etapa de seleção do conjunto de dados é crítica: selecionar o conjunto errado inviabiliza a resposta, independentemente da qualidade do SQL. Por isso ela é avaliada com um benchmark dedicado e reproduzível.
Conjunto de avaliação: 204 perguntas-ouro (golden queries), versão 3.0, cada uma com exatamente um conjunto correto (univocal), de modo que qualquer erro de seleção seja um erro verdadeiro, sem ambiguidade que “perdoe” a métrica. O conjunto cobre 73 datasets, com no mínimo 2 perguntas por dataset.
Estratificação por dificuldade: easy (129), medium (62) e hard (13); e por tipo de desafio: direto (103), inferência (43), desambiguação (54) e linguístico (4). A estratificação permite localizar onde o sistema falha, e não apenas medir um agregado.
Métrica: acurácia top-1 (o conjunto correto é o primeiro retornado) e top-3 (está entre os três primeiros).
Protocolo: execução do pipeline completo de seleção (com boosts) sobre as 204 perguntas, sem amostragem.
Tratamento estatístico: intervalo de confiança de Wilson a 95% sobre a acurácia top-1, adequado a proporções com amostras finitas.
Resultado de referência (baseline): top-1 = 187/204 (91,7%) e top-3 = 198/204 (97,1%). As execuções de regressão comparam-se sempre a essa linha de base, reportando o delta em pontos percentuais, o intervalo de confiança de Wilson e a distribuição de erros por dificuldade. Isso institui uma prática de avaliação contínua: cada alteração relevante no seletor é medida contra o mesmo conjunto-ouro antes de ir a produção.
Esta métrica avalia a seleção do conjunto, e não a correção ponta-a-ponta da resposta, que depende ainda de SQL, agregação e interpretação. Ela não é comparável às métricas de acurácia de execução de Text-to-SQL de esquema aberto do Spider/BIRD (Seção 2.2), pois mede um subproblema mais restrito, sobre um catálogo curado. A comparação relevante é longitudinal, contra a própria linha de base, e não contra benchmarks de outra natureza.
4.3 Latência e desempenho
A latência é monitorada por etapa do pipeline (via spans de telemetria), com relato de P50 e P95. O tempo é dominado por duas etapas que envolvem chamadas a LLM: o reranqueamento na seleção do conjunto e a geração de SQL. Análises internas de desempenho identificaram o reranqueamento por LLM como principal gargalo, na ordem de poucos segundos por consulta, e motivaram otimizações de infraestrutura, cache de metadados e de instâncias, inicialização eager e redução do tamanho de imagem do contêiner, que reduziram o tempo total para a faixa de poucos segundos na maioria das consultas simples. O tempo médio de resposta reportado publicamente (26,4 s) refere-se a perguntas complexas, que envolvem múltiplos conjuntos e geração de gráficos dinâmicos; corresponde, portanto, a um limite superior típico dessa classe de perguntas, e não ao caso médio.
4.4 Testes de guardrails
A robustez dos guardrails foi avaliada por meio de um conjunto controlado de perguntas de teste voltado a medir a capacidade da solução de conter entradas e saídas indesejadas sem bloquear indevidamente perguntas válidas sobre os dados publicados. Essa métrica avalia a eficácia dos mecanismos de contenção e direcionamento conversacional, e não a correção factual das respostas ou a qualidade das consultas SQL, tratadas em métricas próprias.
O conjunto de testes contemplou diferentes categorias de interação: perguntas válidas sobre o Portal de Dados Abertos, perguntas fora do escopo dos dados publicados, tentativas de obter informações internas, sensíveis ou não públicas, solicitações incompatíveis com o uso informativo da solução, conteúdo proibido e interações adversariais voltadas a contornar instruções do sistema. A inclusão de perguntas válidas é importante para medir não apenas a capacidade de bloqueio, mas também a ocorrência de falsos positivos. Isto é, casos em que uma pergunta legítima poderia ser recusada indevidamente.
Para fins de apuração, considerou-se como acerto a decisão correta do mecanismo de guardrails diante de cada cenário testado: bloquear ou redirecionar adequadamente entradas inválidas, fora de escopo ou proibidas, permitir perguntas válidas sobre os dados publicados e preservar a resposta dentro dos limites informativos, rastreáveis e não vinculantes definidos para o TIAGO. A taxa de acerto de 98% corresponde, portanto, ao percentual de decisões corretas do mecanismo de contenção no conjunto avaliado com 602 perguntas.
Esse conjunto é reexecutado sempre que há alteração na solução funcionando também como teste de regressão dos controles de IA responsável.
4.5 Considerações sobre a validade das métricas
As métricas descritas têm escopos distintos e não devem ser lidas de forma intercambiável. A acurácia de seleção mede o acerto na escolha do conjunto, e não a correção da resposta completa, que depende ainda da geração de SQL, da agregação e da interpretação. As perguntas-ouro são construídas internamente e cobrem uma amostra ampla, porém não exaustiva, da diversidade de perguntas reais. Os indicadores de uso do TIAGO e do MCP refletem o primeiro mês de operação pública e ganham representatividade estatística à medida que a base amadurece. Por isso, a avaliação é conduzida como um processo contínuo: o benchmark de seleção é reexecutado a cada alteração relevante do pipeline, e os indicadores de uso são sempre reportados com sua janela de referência.
5. Resultados e alcance
A Tabela 2 consolida os indicadores com sua fonte e janela de referência, conforme a metodologia da Seção 4.
**Tabela 2 — Indicadores, fontes e janelas de referência**
| Indicador | Valor | Fonte | Janela / natureza | |---|---|---|---|
| | Conjuntos de dados publicados | 85 | Portal de Dados Abertos | Estado atual (ago/2026) | |
|---|---|---|---|
| | Downloads do Portal | ~2,3 milhões/mês | Analítica do Portal | Média mensal, histórico desde 2021 | |
| | Downloads do Portal em agosto | ~3,4 milhões/mês | Analítica do Portal | Em ago/2026, mês do lançamento da IA e MCP do portal | |
| | Usuários do Portal | ~15 mil/mês, 76 países | Analítica do Portal | Média mensal, histórico | |
| | Usuários da IA (TIAGO) | ~6,2 mil/mês | Telemetria da aplicação | Produção inicial (ago/2026) | |
| | Perguntas na IA (TIAGO) | ~9,4 mil/mês | Telemetria da aplicação | Produção inicial (ago/2026) | |
| | Chamadas ao MCP | ~20 mil/mês | Telemetria do servidor MCP | Produção inicial (ago/2026) | |
| | Tempo de resposta (perguntas complexas) | ~26,4 s | Telemetria de execução | Limite superior típico, multi-dataset | |
| | Acurácia de seleção (top-1 / top-3) | 91,7% / 97,1% | Benchmark de 204 golden queries | IC 95% de Wilson; baseline interno | |
Além dos indicadores quantitativos, o caso apresenta contribuições qualitativas: a simplificação da jornada de acesso, a ampliação da autonomia de usuários externos, por meio do MCP, a maior rastreabilidade das respostas, via glass box e a criação de uma infraestrutura interoperável para uso de IA sobre dados públicos do setor elétrico. Em conjunto, esses resultados sustentam a tese central do trabalho: a de que a democratização do conhecimento depende não apenas da publicação de dados, mas de uma camada que reduza o custo técnico e cognitivo de transformá-los em informação.
6. Segurança, confiança e IA responsável
A solução combina controles técnicos, jurídicos e comunicacionais, alinhados aos princípios discutidos na Seção 2.6. Entre os controles técnicos: respostas restritas às informações do Portal, consultas somente leitura, contratos de dados para orientar seleção e interpretação, exposição das fontes e das consultas, proteção de segurança cibernética em camadas, limitação de requisições para controle de custos, monitoramento por sessão e endereço, CAPTCHA, observabilidade e testes automatizados e filtros para conteúdo proibido e conversas fora de contexto (AI Guardrails), com 98% de acerto nos testes descritos na Seção 4.4.
Entre as salvaguardas jurídicas e de transparência, os Termos de Uso esclarecem que as respostas têm caráter informativo e não vinculante e que as informações devem ser validadas antes de fundamentar análises ou decisões. Essa combinação busca equilibrar acesso democrático e cautela operacional: o TIAGO amplia a capacidade de consulta e interpretação, mas preserva a necessidade de verificação pelo usuário, coerente com uma postura de IA responsável, em que transparência (SQL e fonte expostos) e contenção (guardrails, somente leitura) operam de forma conjunta.
7. Eficiência e sustentabilidade econômica
A arquitetura foi desenhada para usar IA de forma seletiva: os modelos atuam sobretudo na interpretação da pergunta e na construção das consultas, enquanto a execução ocorre de forma determinística e verificável sobre os dados publicados. Isso reduz a dependência de inferência generativa em etapas resolvíveis por computação determinística, mais econômicas, auditáveis e reprodutíveis.
Entre as estratégias: leitura direta de Parquet no armazenamento, sem cópia ou ETL dedicado por consulta, uso de modelos distintos conforme a complexidade da tarefa para otimização dos custos de tokens, prompt cache e monitoramento de latência, desempenho, uso e custos, com memória, cache e perfis de inferência. As otimizações de infraestrutura descritas na Seção 4.3 reduziram substancialmente o tamanho da imagem de contêiner e o tempo de inicialização, além do overhead por requisição. A principal contribuição desta dimensão é a combinação de IA com execução determinística: em vez de delegar todo o processo ao modelo generativo, o TIAGO usa modelos para compreender e planejar, mantendo a resposta ancorada nos dados e passível de verificação, o que também favorece o controle de custos (FinOps).
8. Ineditismo e diferenciais
Conforme discutido na Seção 2.7, o ineditismo resulta da combinação integrada de quatro avanços, e não de um componente isolado:
Evolução de open data para accessible information. O Portal oferece dados públicos desde 2021, o TIAGO acrescenta uma camada que transforma arquivos em conhecimento pesquisável por linguagem natural.
Contratos enriquecidos para consumo por IA. A camada semântica descreve significado, limites e regras dos dados, permitindo uso consistente por modelos mesmo quando o usuário desconhece a estrutura, com o diferencial de usar IA para apoiar a própria construção dos contratos.
Autonomia via MCP. Ao disponibilizar dados como serviço interoperável para agentes, o ONS habilita o ecossistema externo a criar soluções próprias, no primeiro MCP público do setor elétrico brasileiro.
Transparência e reprodutibilidade (glass box). A exposição do SQL gerado, dos links aos conjuntos e dos dados de suporte permite compreender e reproduzir cada resultado, em linha com a IA responsável.
O que é genuinamente inédito, portanto, é contextual e integrativo: a aplicação coordenada dessas práticas a um bem público, com governança, e o pioneirismo do MCP setorial. Os componentes herdados do estado da arte, Text-to-SQL, RAG, contratos, guardrails, são empregados como blocos consolidados, e o valor da iniciativa reside na engenharia de sua integração governada.
9. Origem em inovação aberta e desenvolvimento de talentos
O TIAGO nasceu de um desafio da 6ª edição do DatathONS, maratona de inovação e dados promovida pelo ONS, voltada à conexão com universidades e ao desenvolvimento de jovens talentos. Após a competição, quatro participantes ingressaram como estagiários e contribuíram para transformar a ideia em solução disponível ao público, com apoio de profissionais internos.
O percurso revela uma dimensão relevante do caso: a inovação não se encerrou na competição, mas seguiu por uma ponte concreta entre desafio, talento, desenvolvimento, governança e entrada em operação. A iniciativa demonstra a capacidade institucional de absorver uma ideia originada em ambiente de inovação aberta, amadurecê-la tecnicamente e transformá-la em produto disponibilizado à sociedade, evidenciando que programas de inovação aberta geram impacto quando há continuidade institucional e capacidade de produção.
10. Replicabilidade e contribuição ao ecossistema
A arquitetura do TIAGO estabelece um padrão reutilizável para outros produtos de dados e contextos institucionais. A combinação de contratos de dados (no padrão aberto ODCS), consulta em linguagem natural, transparência, MCP, guardrails e execução controlada pode ser adaptada por organizações que desejem tornar seus dados abertos mais acessíveis e interoperáveis. O uso de padrões abertos (ODCS, MCP, Parquet), em vez de formatos proprietários, e a concepção modular e desacoplada da arquitetura (Seção 3.4) são o que tornam a replicação viável fora do setor elétrico.
Esse potencial já se materializa na disponibilização pública do repositório do servidor MCP (Seção 3.3), que permite a desenvolvedores, pesquisadores e organizações consultar a implementação, compreender o padrão de integração e reutilizar ou adaptar componentes em soluções próprias. Como próxima etapa, o ONS avalia ampliar a abertura do código-fonte da solução, com o objetivo de estimular replicação, contribuições externas e evolução colaborativa. A contribuição, portanto, não se limita ao setor elétrico: o TIAGO funciona como demonstração prática de como uma instituição pode transformar seus dados em infraestrutura de IA responsável, preservando rastreabilidade e mecanismos de controle.
11. Limitações e cuidados
Como todo sistema baseado em IA e consulta automatizada, o TIAGO exige cuidados de uso e interpretação. Do ponto de vista do produto, as respostas têm caráter informativo e não vinculante, devendo ser validadas antes de fundamentar análises ou decisões e o escopo é restrito às informações disponíveis do Portal.
Do ponto de vista técnico, o Text-to-SQL pode errar conjunto, unidade, granularidade ou agregação; os contratos ODCS são críticos (um contrato incorreto gera resposta incorreta); e a seleção de conjunto, embora com acurácia elevada, não é perfeita (Seção 4.2), sobretudo em casos de desambiguação e inferência. Do ponto de vista de medição, conforme a Seção 4.5, a acurácia de seleção não captura erros a jusante e os indicadores de uso refletem o primeiro mês de operação, ganhando representatividade à medida que a base amadurece.
Do ponto de vista operacional, a robustez depende da continuidade de processos de governança, manutenção de contratos, atualização de conjuntos, monitoramento de desempenho e custos, proteção contra usos indevidos e evolução dos guardrails. A explicitação dessas limitações é parte da postura de transparência que orienta a iniciativa.
12. Conclusão
O TIAGO Dados Abertos representa a evolução de um portal de dados públicos para uma infraestrutura aberta preparada para inteligência artificial. Ao integrar contratos de dados em padrão aberto, um copiloto conversacional Text-to-SQL com execução determinística e self-healing, um servidor MCP público, transparência de glass box, controles de IA responsável e uma estratégia de eficiência econômica, a solução transforma a experiência de acesso aos dados do setor elétrico brasileiro.
O caso demonstra que democratizar dados não significa apenas publicar arquivos, mas permitir que diferentes públicos formulem perguntas, recebam respostas compreensíveis, verifiquem fontes e reutilizem resultados. Sua contribuição não está em inventar técnicas Text-to-SQL, RAG, contratos e MCP são estado da arte, mas em integrá-las com governança sobre um bem público, com pioneirismo no MCP setorial e com uma prática de avaliação verificável. Ao combinar inovação aberta, governança de dados e IA responsável, o TIAGO amplia a transparência, reduz barreiras técnicas e oferece um modelo replicável para instituições que desejem aproximar dados públicos, inteligência artificial e valor social.
Referências
Anthropic. (2024). Introducing the Model Context Protocol. Disponível em: https://www.anthropic.com/news/model-context-protocol
Bitol / LF AI & Data Foundation. (2024–2025). Open Data Contract Standard (ODCS). Disponível em: https://github.com/bitol-io/open-data-contract-standard
Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W., Rocktäschel, T., Riedel, S., & Kiela, D. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems (NeurIPS), 33.
Li, J., Hui, B., Qu, G., Yang, J., Li, B., Li, B., Wang, B., Qin, B., Cao, R., Geng, R., Huo, N., Zhou, X., Ma, C., Li, G., Chang, K. C. C., Huang, F., Cheng, R., & Li, Y. (2023). Can LLM Already Serve as a Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs (BIRD). Advances in Neural Information Processing Systems (NeurIPS), 36. arXiv:2305.03111.
National Institute of Standards and Technology (NIST). (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0). NIST AI 100-1. https://doi.org/10.6028/NIST.AI.100-1
Open Knowledge Foundation. The Open Definition. Disponível em: https://opendefinition.org/
Raasveldt, M., & Mühleisen, H. (2019). DuckDB: An Embeddable Analytical Database. Proceedings of the 2019 ACM SIGMOD International Conference on Management of Data, 1981–1984.
Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3, 160018. https://doi.org/10.1038/sdata.2016.18
Wilson, E. B. (1927). Probable Inference, the Law of Succession, and Statistical Inference. Journal of the American Statistical Association, 22(158), 209–212.
Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., Zhang, Z., & Radev, D. (2018). Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task. Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing (EMNLP).
Anexos
Notícia oficial de lançamento do TIAGO — ons.org.br.
Portal de Dados Abertos e sua trajetória desde 2021 — dados.ons.org.br.
Demonstração conversacional (pergunta → SQL → resultado → gráfico → fonte) — tiago.dados.ons.org.br.
Página pública de conexão do MCP — https://dados.ons.org.br/mcp.
Termos de Uso — https://dados.tiago.ons.org.br/documentos/termo-cessao-uso.pdf.
Histórico do DatathONS (6ª edição) — https://datathons6aedicao.liga.ventures/.
Relatório do benchmark de seleção (204 golden queries): metadados, acurácia top-1/top-3, IC de Wilson e distribuição de erros por dificuldade.
Como citar
CARVALHO, Eiza. IA e Dados Abertos do Setor Elétrico Brasileiro. Crivum, 2026. Disponível em: https://crivum.org/p/1e7bq5l4.
Carvalho, E. (2026). IA e Dados Abertos do Setor Elétrico Brasileiro. Crivum. https://crivum.org/p/1e7bq5l4
@misc{crivum_ea71,
author = {Eiza Carvalho},
title = {IA e Dados Abertos do Setor Elétrico Brasileiro},
year = {2026},
publisher = {Crivum},
url = {https://crivum.org/p/1e7bq5l4},
note = {Crivum EA71},
}Viu um problema nesta obra?
Toda obra publicada aqui fica aberta ao exame de quem lê. Se você encontrou dado que não se sustenta, trecho sem crédito ou autoria que não confere, aponte. A editoria lê todos os apontamentos.
Apontar exige conta, para o registro ter um nome por trás. Entre antes de escrever, assim você não perde o texto. Entrar para apontar
Um apontamento vai direto à editoria e fica registrado. Quando 3 pessoas diferentes apontam a mesma obra, ela sai do ar na hora e o caso vai ao comitê. A avaliação e o registro permanecem em qualquer caso, o que muda é a disponibilidade.