
Solução de Transcrição e Análise de Áudios Operativos Baseada em Múltiplas Camadas de Inteligência Artificial
Julia Herz de Carvalho prestígio (1)
Avaliação por modelos + Supervisão Editorial.
Aceite provisório
Registro já válido e público — número, score e prova congelados. Em revisão complementar do comitê; um endosso o torna definitivo, e o número não muda.
IA em múltiplas camadas transforma comunicações operativas críticas do setor elétrico em inteligência pesquisável, reduzindo erros, custos e tempo de análise.
Resumo executivo
Solução desenvolvida pelo ONS para transcrição e análise de áudios operativos do Sistema Interligado Nacional (SIN), criada para lidar com desafios como grande volume diário de chamadas, gravações monocanais, sobreposição de falas, sotaques regionais, baixa frequência de amostragem, terminologia técnica e identificadores operativos específicos. A solução combina diarização customizada, fine-tuning do modelo de código aberto Whisper com áudios reais do setor elétrico e pós-processamento com LLMs para padronização, extração de entidades, classificação de assuntos e geração de resumos. Como resultado, transforma comunicações de voz em informação estruturada para busca, auditoria, análise e apoio à tomada de decisão.
Em produção, o Transcritor substituiu uma solução comercial anterior, reduzindo em cerca de 29% a taxa de erro de transcrição, elevando em 52% a percepção de qualidade pelos usuários e diminuindo aproximadamente 50% dos custos operacionais. A utilização dos resumos automáticos e dos mecanismos de busca e filtragem também proporcionou uma redução estimada de aproximadamente 80% no tempo de análise e apuração das informações.
Como iniciativa de inovação aberta, o ONS disponibiliza publicamente o código-fonte da solução e os modelos especializados desenvolvidos, permitindo que outras organizações repliquem, adaptem e evoluam a tecnologia. Embora concebida para o contexto da operação do sistema elétrico, a abordagem pode ser aplicada por empresas de diferentes setores que enfrentam desafios relacionados ao processamento de áudios, transcrição, estruturação e análise de grandes volumes de comunicações de voz. Dessa forma, a plataforma transforma comunicações operativas em um ativo estratégico de dados para auditoria, pós-operação, apuração de eventos, inteligência operacional e apoio à tomada de decisão em ambientes críticos.
Paper completo
Entre para baixar o PDF registradoSolução de Transcrição e Análise de Áudios Operativos Baseada em Múltiplas Camadas de Inteligência Artificial
SUMÁRIO
O Operador Nacional do Sistema Elétrico (ONS), no exercício da coordenação e do controle da operação do Sistema Interligado Nacional (SIN), emprega intensamente a comunicação por voz entre seus Centros de Operação e os agentes de operação. Esses registos são insumos fundamentais para audições e atividades de pós-operação, devido à sua relevância para a análise da qualidade da operação e para a contabilização financeira dos ativos de geração e transmissão que compõem o SIN.
Contudo, por se tratar de dado não estruturado, sua análise historicamente depende de métodos manuais pouco escaláveis, agravados por um volume médio de 4.000 chamadas diárias, com picos de até 8.000 ligações em cenários de grandes perturbações, distribuídas entre os centros de Brasília, Recife, Florianópolis e Rio de Janeiro. Essa dinâmica impacta na eficiência dos processos de pós-operação e dificulta a extração sistemática de informações essenciais para a operação.
As soluções comerciais de transcrição disponíveis mostraram-se insuficientes para suprir as necessidades específicas do ONS, pois os áudios operativos apresentam particularidades e complexidades adicionais, entre as quais estão o idioma português com forte variação regional; gravações monocanais com sobreposição de falas entre interlocutores; uso intenso de vocabulários técnicos e nomes próprios de equipamentos, usinas e subestações; além de identificadores operativos específicos, como o número do Sistema de Gestão de Intervenções (SGI). Essas limitações resultam em taxas elevadas de erro de transcrição, perda de contexto e aumento significativo do esforço manual para interpretação das informações.
Diante desse cenário, este trabalho apresenta o desenvolvimento e os resultados do Transcritor, uma solução de transcrição e análise de áudios operativos baseada em múltiplas camadas integradas de Inteligência Artificial, construída sobre modelos de código aberto e customizada para o setor elétrico.
Como fundamento do trabalho, construiu-se uma Base da Verdade a partir da transcrição manual de cerca de 3.000 áudios operativos, empregada no treinamento dos modelos e na avaliação da qualidade da transcrição. A separação de interlocutores em áudios monocanais é realizada por diarização customizada, com fine-tuning do modelo de segmentação, de arquitetura convolucional integrada a redes LSTM, retreinado com dados do setor elétrico. Já a transcrição especializada resulta do fine-tuning de um modelo da OpenAI (Whisper) com áudios reais do ONS, capaz de reconhecer termos técnicos, nomes de subestações e equipamentos. Por fim, uma camada de pós-processamento com Modelos de Linguagem de Grande Porte (LLMs) padroniza o texto, gera resumos automáticos, reconhece entidades-chave como equipamentos, subestações, usinas e agentes, e classifica os assuntos tratados na ligação.
Os resultados medidos em ambiente produtivo demonstraram redução de cerca de 29% na taxa de erro de transcrição (WER) em relação à solução comercial anterior, elevação de 52% na percepção de qualidade pelos usuários, medida pela nota média atribuída às transcrições (de 2,5 para 3,8 em uma escala de 1 a 5), e redução de aproximadamente 50% dos custos da solução. Adicionalmente, a utilização dos resumos automáticos e dos mecanismos de busca e filtragem permitiu redução estimada de aproximadamente 80% no tempo de análise e apuração das informações. Por utilizar modelos de código aberto e possuir código-fonte e modelos especializados disponibilizados publicamente pelo ONS, apresenta elevado potencial de replicação por outros agentes do Sistema Elétrico Brasileiro (SEB), bem como de aplicação em diferentes sistemas e contextos operacionais. A abordagem também pode ser empregada por organizações de diferentes setores que enfrentam desafios relacionados à transcrição, estruturação e análise de grandes volumes de comunicações de voz, viabilizando análises mais rápidas, estruturadas e rastreáveis.
PALAVRAS-CHAVE
Pós-Operação. Transcrição Automática de Áudio. Diarização. Deep Learning. Inteligência Artificial. Modelos de Linguagem de Grande Porte (LLMs).
1. Introdução
A comunicação por voz entre os Centros de Operação do ONS e dos agentes de operação é um insumo fundamental para a operação do SIN. Este trabalho apresenta o Transcritor, solução especializada de transcrição e tratamento de áudios operativos, baseada em múltiplas camadas de Inteligência Artificial e concebida para o domínio do setor elétrico. Suas principais contribuições são a construção de uma Base da Verdade rotulada por especialistas, a customização de modelos de código aberto de diarização e de transcrição por meio de fine-tuning com áudios reais do ONS, a integração de uma camada de pós-processamento com LLMs e a validação da solução em produção.
O artigo está organizado da seguinte forma: desafios e motivação (Seção 2), metodologia adotada (Seção 3), arquitetura da solução (Seção 4), métrica de avaliação (Seção 5), resultados (Seção 6), aplicabilidade no setor elétrico (Seção 7), trabalhos futuros (Seção 8) e conclusão (Seção 9). Os termos técnicos empregados ao longo do texto estão definidos no Glossário, ao final do artigo.
2. Desafios e Motivação
A conversão automática de fala em texto (speech-to-text) é reconhecidamente complexa, dada a natureza não estruturada dos dados de áudio. Embora esses modelos tenham evoluído significativamente nos últimos anos, os áudios operativos do ONS apresentam particularidades que tornam ainda mais difícil o uso de soluções genéricas de mercado, sobretudo quanto à qualidade das transcrições e ao custo de processamento:
Quantidade e escalabilidade: elevado volume de chamadas, com média de 4.000 ligações diárias e picos de até 8.000 em cenários de grandes perturbações.
Áudios monocanais: os interlocutores compartilham um único canal, com trechos de fala simultânea, o que dificulta a separação e a atribuição correta dos segmentos a cada locutor.
Frequência de amostragem: os áudios são gravados a 8 kHz (banda estreita), abaixo dos 16 kHz para os quais os modelos de reconhecimento de fala são otimizados. A reamostragem adequa o formato, mas não recupera a informação acústica ausente, limitando a qualidade da transcrição.
Diversidade regional: variações de sotaque e pronúncia decorrentes da abrangência nacional da operação.
Terminologia especializada: uso frequente de termos técnicos (jargões), siglas e nomes de usinas, subestações e equipamentos.
Identificadores operativos: referências exclusivas da operação, como o número do SGI, essenciais para a rastreabilidade e frequentemente transcritas de forma incorreta por soluções genéricas.
Limitações inerentes às soluções comerciais: por serem genéricas, as ferramentas de transcrição disponíveis no mercado não reconhecem adequadamente o vocabulário do setor, não permitem ajustar o modelo ao domínio do ONS e não são treinadas com grandes volumes de amostras em português brasileiro.
Recursos adicionais: além da transcrição, há a necessidade de pós-processamento, classificação de assuntos, extração de entidades e geração de resumos.
Esses fatores resultavam em taxas elevadas de erro de transcrição, perda de contexto relevante e aumento do esforço manual de interpretação, motivando o desenvolvimento de uma solução própria e especializada.
3. Metodologia da Pesquisa
Esta seção descreve a metodologia adotada nas diferentes etapas que compõem o fluxo de processamento e desenvolvimento do Transcritor.
3.1. Construção da Base da Verdade
O desenvolvimento e a avaliação de todos os modelos que compõem o Transcritor basearam-se em uma base rotulada manualmente, denominada Base da Verdade (Ground Truth), elemento fundamental para o sucesso da iniciativa. As amostras foram distribuídas de forma homogênea entre os quatro centros de operação e as transcrições foram realizadas manualmente por profissionais com conhecimento do setor elétrico, o que assegurou o registro correto dos termos técnicos.
Por conter comunicações operativas reais e informações sensíveis da operação do SIN, a Base da Verdade não pode ser disponibilizada publicamente. Entretanto, a abordagem adotada para sua construção pode ser replicada por outras organizações em conjuntos de dados similares, utilizando especialistas do domínio para transcrição e rotulação das amostras.
A base contém 3.150 amostras de áudio transcritas e rotuladas, com 24 atributos por registro. Entre eles estão o texto de referência, o assunto tratado na ligação (classificado em 12 categorias principais), a qualidade do áudio (Adequado, Inadequado ou Neutro), os nomes dos operadores do ONS e do agente, o nome do agente (empresa), as instalações e os equipamentos envolvidos, o número do SGI e as marcações temporais por locutor.
Os registros classificados como adequados, isto é, aqueles que puderam ser compreendidos por um anotador humano, foram divididos em conjuntos distintos para treinamento e avaliação. Uma parcela dessas amostras foi empregada no ajuste fino (fine-tuning) dos modelos de transcrição e de segmentação, enquanto outra parcela foi reservada exclusivamente para avaliação.
A utilização de conjuntos independentes permitiu medir o desempenho dos modelos em dados não observados durante o treinamento, evitando vieses de avaliação. Com isso, foi possível comparar as transcrições de referência com as geradas pela solução anterior e pela nova versão, calcular métricas de desempenho, como a taxa de erro por palavra (Word Error Rate, WER), e acompanhar a evolução entre as diferentes versões e configurações da solução.
3.2. Modelo de Diarização
A diarização, etapa de determinar quem falou e quando, é necessária porque os áudios operativos são monocanais e reúnem os dois interlocutores em uma única faixa. Adotou-se o pipeline pré-treinado de diarização da biblioteca pyannote.audio [1], uma referência de código aberto (open source) amplamente utilizada na literatura de diarização, o que favorece a reprodutibilidade e a evolução contínua da solução.
Preservou-se a arquitetura original do pipeline, composta pelos estágios de segmentação, embeddings, agrupamento (clustering) e ressegmentação, conforme apresentado na Figura 1.
Figura 1: Pipeline de diarização. O componente de segmentação recebeu fine-tuning com dados do setor elétrico.
3.2.1 Segmentação
A segmentação percorre o áudio ao longo do tempo e delimita as regiões de fala, distinguindo os trechos com voz dos de silêncio ou ruído (detecção de atividade de voz - VAD) e identificando os instantes em que há sobreposição de falas ou troca de locutor.
A customização concentrou-se no componente mais crítico do pipeline, o modelo de segmentação, submetido a fine-tuning a partir do modelo base aberto pyannote/segmentation-3.0 [2], com as marcações temporais da Base da Verdade, a fim de melhorar a detecção das regiões de fala em áudios do ONS com dois interlocutores.
O modelo de segmentação segue a arquitetura PyanNet, composta por quatro blocos em sequência. Uma camada SincNet (ver Glossário) [3] processa diretamente a forma de onda bruta do áudio, a 16 kHz e com stride 10, extraindo as características do sinal. Em seguida, quatro camadas de LSTM (ver Glossário) bidirecional [4], com 128 unidades cada, modelam o contexto temporal em ambos os sentidos. Duas camadas lineares de 128 unidades consolidam a representação, e a camada de saída classifica, a cada instante, os locutores ativos em codificação powerset (ver Glossário) [5], capaz de representar múltiplos locutores simultâneos. O treinamento emprega janelas de 10 segundos, com até dois locutores por quadro, sob treinamento invariante a permutações (ver Glossário).
3.2.2 Embeddings
A extração de embeddings, realizada por um modelo pré-treinado, converte cada segmento de fala em um vetor numérico que resume as características da voz do interlocutor. Vozes semelhantes produzem vetores próximos entre si, o que permite comparar e distinguir os locutores de forma quantitativa.
3.2.3 Clustering
O agrupamento reúne os vetores semelhantes, formando um grupo por locutor. Cada segmento é então atribuído ao grupo correspondente, o que define quais trechos pertencem a cada interlocutor. No caso dos áudios operativos, o número de grupos é fixado em dois, o operador do ONS e o operador do agente. A semelhança entre dois embeddings eᵢ e eⱼ é medida pela distância do cosseno:
d(e_i,e_j) = 1 - (e_i · e_j)/(||e_i|| ||e_j||) (1)
3.2.4 Ressegmentação
A ressegmentação revisa as fronteiras temporais das falas atribuídas a cada locutor, corrigindo pequenas imprecisões no início e no fim de cada intervenção, sobretudo nas transições entre locutores.
A saída da diarização é uma segmentação rotulada do áudio: uma sequência de segmentos de fala, cada um associado a um locutor (SP0 ou SP1, do inglês speaker) e delimitado por instantes de início e fim. Derivada de uma única gravação monocanal, essa estrutura temporal constitui a entrada da etapa de transcrição, na qual os segmentos são extraídos do sinal e transcritos individualmente, preservando o vínculo entre cada trecho e o respectivo locutor.
3.3. Modelo de Transcrição
A camada de transcrição automática de fala parte do Whisper, modelo de código aberto disponibilizado pela OpenAI [6], na variante medium (openai/whisper-medium, cerca de 769 milhões de parâmetros). Em sua forma original, o Whisper adota a arquitetura encoder-decoder do tipo Transformer (ver Glossário) [7]. O encoder recebe o espectrograma log-mel (ver Glossário), calculado por transformada de Fourier de curto prazo (STFT) seguida de um banco de filtros Mel em escala logarítmica, a partir do sinal amostrado a 16 kHz em janelas de 30 segundos. O decoder gera a sequência de tokens de texto de forma autorregressiva, condicionado às representações produzidas pelo encoder.
O mecanismo central dessa arquitetura é a autoatenção, que pondera a relevância mútua entre posições da sequência:
Attention(Q,K,V) = softmax((QK^T)/√d_k)V (2)
em que Q, K e V são as matrizes de consultas, chaves e valores, e dₖ é a dimensão das chaves.
Sobre esse modelo original, aplicou-se um fine-tuning para o domínio do setor elétrico brasileiro. Trata-se de um treinamento supervisionado que minimiza a entropia cruzada na predição do próximo token, sobre os pares (áudio, transcrição) da Base da Verdade:
L(θ) = − ∑ log pθ(yt | y<t,x) (3)
O fine-tuning especializou o Whisper Medium no setor elétrico, visando ao reconhecimento de termos técnicos, nomes de instalações e equipamentos, identificadores operativos e variações regionais. Foram utilizados 1.000 áudios da Base da Verdade para treino, 200 para validação e 200 para teste. O treinamento, realizado com a biblioteca Hugging Face Transformers [8], adotou taxa de aprendizado de 1×10⁻⁵, 5.000 passos de otimização, lotes de 48 amostras por dispositivo, 500 passos de aquecimento (warmup) e checkpointing de gradiente. Executado em uma GPU NVIDIA A100 de 40 GB, o processo consumiu cerca de 12 horas, a um custo aproximado de R$ 80 por execução. O baixo custo computacional observado evidencia a viabilidade prática da aplicação de técnicas de fine-tuning para domínios especializados.
Na inferência, adotaram-se configurações específicas para o perfil dos áudios operativos, entre elas um limiar de não-fala de 0,3, para evitar a interrupção precoce em trechos de silêncio, e busca em feixe de largura 2.
3.4. Pós-Processamento com Regras
Após a transcrição, e antes do enriquecimento por LLM, o texto passa por uma correção baseada em regras, voltada a tratar os erros sistemáticos do transcritor no domínio do setor elétrico.
A definição das regras seguiu uma avaliação experimental. Comparando-se, de forma offline, as transcrições automáticas com as de referência da Base da Verdade, aplicaram-se técnicas de n-gramas (ver Glossário) para identificar os erros mais frequentes do transcritor, isto é, as substituições recorrentes de palavras e expressões. A partir desses padrões, as regras foram definidas sobre uma amostra de 1.600 transcrições de referência e testadas em uma amostra distinta de 1.400 transcrições.
Em produção, aplicou-se o conjunto de regras resultante, que compreende um dicionário de substituições que corrige variações fonéticas de siglas (como as diversas grafias de "ONS"), padroniza termos técnicos (subestação, tap, MW) e trata coloquialismos (está, para), além da conversão de números por extenso em dígitos e da inserção de espaço entre número e unidade (por exemplo, 230 kV).
3.5. Pós-Processamento com LLMs
A camada final emprega um Modelo de Linguagem de Grande Porte (LLM) da família Claude, acessado pelo serviço gerenciado AWS Bedrock, para enriquecer as transcrições em três etapas.
Beautify: melhora a legibilidade do texto da transcrição para leitura humana por meio da inserção de pontuação, capitalização e organização das falas. O processo utiliza um glossário técnico do setor elétrico para grafar corretamente nomes de operadores, instalações, localidades e equipamentos.
Extração de entidades-chave: identifica e extrai informações relevantes da conversa, incluindo os operadores envolvidos, o agente responsável (empresa), instalações, equipamentos, número do SGI e o assunto tratado.
Resumo: gera uma síntese objetiva do conteúdo da ligação, permitindo compreender rapidamente a tratativa sem a necessidade de ouvir o áudio integral.
3.6. Fluxo de Processamento Completo do Transcritor
A Figura 2 ilustra, com um exemplo, o percurso completo de um áudio operativo pelas etapas do pipeline, do sinal de entrada ao resultado estruturado.
Figura 2: Exemplo ilustrativo etapa a etapa do pipeline do Transcritor
4. Arquitetura da Solução
O Transcritor é um módulo de transcrição e análise de áudios operado sobre infraestrutura de nuvem, concebido para substituir a solução comercial anterior. A Figura 3 apresenta a visão geral da arquitetura: os usuários interagem com a solução por meio de um portal corporativo, os áudios são armazenados em repositório de objetos (S3) e o processamento é realizado por uma API dedicada, integrada aos componentes de armazenamento, busca textual e gestão de parâmetros.
Figura 3: Arquitetura da solução Transcritor
O núcleo de processamento é uma aplicação FastAPI executada em contêineres (ECS com GPU). O fluxo é assíncrono e orientado a eventos: o carregamento de um áudio no repositório dispara notificações que, por filas de mensagens (SQS) e funções Lambda, acionam a API. A API executa o pipeline completo e persiste um documento JSON estruturado, posteriormente indexado em mecanismo de busca textual (OpenSearch) para consulta do histórico de comunicações disponibilizado para os usuários através de um portal SharePoint. O estado de cada job de transcrição é rastreado em banco NoSQL (DynamoDB), e as instâncias de processamento escalam verticalmente de acordo com o tamanho da fila.
5. Avaliação Experimental
A avaliação da qualidade de transcrição baseou-se na comparação entre as saídas automáticas e as transcrições manuais da Base da Verdade, adotadas como referência. Para essa finalidade, foi empregado um conjunto de teste independente, composto por aproximadamente 1.000 áudios não utilizados no treinamento dos modelos. As métricas foram calculadas com o auxílio da biblioteca jiwer, tendo como principal indicador a taxa de erro por palavra (WER), que mede a proporção de palavras incorretamente reconhecidas em relação à transcrição de referência:
WER = (S + D + I)/N (4)
onde S, D e I são as substituições, deleções e inserções de palavras, e N é o número total de palavras da referência.
Complementarmente, foi realizada uma avaliação qualitativa por dez especialistas, que atribuíram notas de 1 a 5 a um conjunto de 200 áudios transcritos pela solução. A escala adotada considerou nota 5 para transcrições sem erros, nota 4 para transcrições com pequenos erros que não comprometem o entendimento, nota 3 para transcrições cujos erros começam a impactar a compreensão do conteúdo, nota 2 para transcrições com erros significativos em informações relevantes e nota 1 para transcrições com perda substancial de conteúdo.
Os indicadores apresentados na Seção 6 foram obtidos a partir de medições realizadas em ambiente produtivo e por meio da comparação entre a solução comercial anteriormente utilizada pelo ONS e o Transcritor, utilizando conjuntos independentes de avaliação e avaliações qualitativas conduzidas por especialistas.
6. Resultados
A solução foi implantada em ambiente produtivo e apresenta ganhos práticos relevantes em qualidade da transcrição e custo operacional. A Figura 4 apresenta uma captura de tela do Transcritor. Os nomes pessoais dos profissionais (operadores) do ONS e do agente de operação foram ocultados. É possível observar os Metadados, o Sumário (resumo da transcrição) e o tocador que permite realizar a oitiva do áudio.
Figura 4: Captura de tela do Transcritor
A implantação do transcritor customizado resultou em redução de aproximadamente 29% na taxa de erro de transcrição (WER) em relação à solução comercial anterior, cujo WER era de 55%.
A percepção dos usuários também melhorou, a nota média das transcrições subiu de 2,5 para 3,8, em escala de 1 a 5, o que representa um aumento de aproximadamente 52% na percepção de qualidade pelos usuários.
A substituição do serviço comercial de transcrição por modelos de código aberto executados em infraestrutura sob gestão do ONS proporcionou redução de custos da ordem de 50%.
A Tabela I consolida esses indicadores.
Tabela I: Indicadores Consolidados. Taxa de erro (WER): solução comercial anterior 55%, Transcritor 39% (redução de 29%). Nota média dos usuários (1–5): solução comercial anterior 2,5, Transcritor 3,8. Custo operacional: solução comercial anterior serviço em nuvem pay-as-you-go, Transcritor infraestrutura própria com redução de aproximadamente 50%.
Embora a taxa de erro observada possa parecer elevada à primeira vista, métricas dessa magnitude são comuns em aplicações reais de reconhecimento automático de fala e compatíveis com as obtidas pelos principais modelos de mercado em Automatic Speech Recognition (ASR). Diferentemente de bases de referência utilizadas em benchmarks acadêmicos, os áudios operativos apresentam desafios adicionais já descritos na Seção 2. Nesse contexto, a redução de aproximadamente 29% na métrica de WER representa um ganho expressivo de desempenho, refletindo uma melhoria substancial na qualidade das transcrições.
Do ponto de vista operacional, a solução possibilitou análises mais rápidas: os usuários passaram a compreender o conteúdo de uma ligação por meio de resumos automáticos, filtros, identificação de entidades-chave e classificação de assuntos, sem a necessidade de ouvir integralmente os áudios. Além disso, a transcrição estruturada dos áudios possibilitou a construção de uma base de dados com potencial de integração a sistemas e fluxos dos processos de apuração. Outro benefício relevante da solução desenvolvida é a disponibilização do acesso por meio de link/site, eliminando a necessidade de instalação de software nas máquinas dos usuários e ampliando a acessibilidade à ferramenta.
Por fim, a estruturação dos dados transcritos viabiliza o acompanhamento contínuo da qualidade das informações e dos assuntos tratados em tempo real, inclusive por meio de painéis em Power BI. Com isso, amplia-se a capacidade de monitoramento, análise e identificação de pontos de atenção, contribuindo para tratativas mais ágeis, objetivas e orientadas por dados.
Figura 5: Painel estruturado como um dos resultados práticos do Transcritor.
Em uma análise de ocorrência, por exemplo, foi possível identificar gravações de interações entre o ONS e os agentes com várias horas de diferença, cujas tratativas eram relevantes para o resultado da análise.
A partir da evolução já obtida na qualidade da transcrição, busca-se viabilizar novas funcionalidades que deem suporte mais direto às atividades de análise e apuração da operação, ampliando o aproveitamento dessas informações em processos, sistemas e demais soluções correlatas. Com isso, já é possível transformar a transcrição de áudio em insumo efetivo para os fluxos de trabalho da pós-operação, apoiando funcionalidades que dependam da identificação de gravações associadas a ocorrências, despacho de geração, coordenações de manobras e quaisquer eventos operativos que possam subsidiar as atividades de apuração e análise da operação. Dessa forma, pretende-se promover ganhos de desempenho, maior padronização, redução de esforço manual e ampliação da capacidade analítica dos processos conduzidos pela área.
Considerando que a análise de cada áudio via resumo gerado pelo Transcritor leva em média 10 segundos, o ganho estimado é de aproximadamente 80% de redução do tempo de análise/apuração dos áudios. A estimativa foi calculada a partir da comparação do tempo médio diário gasto pelos usuários na avaliação e apuração de gravações antes e após a implantação da solução. Por exemplo, um áudio cujo resumo indica tratativas não correlacionadas com a análise/apuração em questão não precisa sequer ser ouvido, indicando ganhos de performance na atividade. Ainda, com a aplicação de novas camadas de Inteligência Artificial utilizando a saída do Transcritor como insumo, será possível identificar para posterior oitiva apenas os áudios que sejam relevantes para o contexto desejado pelo colaborador.
7. Aplicabilidade para o Setor Elétrico
A solução apresenta alta aplicabilidade nas atividades de pós-operação do ONS, sobretudo na apuração de eventos e na análise e apuração de ocorrências, nas quais tempo e rastreabilidade são determinantes. A conversão de áudios não estruturados em informação organizada, passível de busca e filtragem, aliada ao ganho de precisão das transcrições, à extração automática de entidades, ao resumo e à classificação de assuntos, contribui diretamente para a redução do tempo de análise e apuração e para o historiamento dos eventos.
A abordagem possui elevado potencial de replicação em outras empresas do Sistema Elétrico Brasileiro (SEB), dado que a comunicação por voz entre Centros de Operação é parte do cotidiano da operação em tempo real. Embora os áudios originais utilizados na construção da Base da Verdade não possam ser divulgados por conterem informações operativas sensíveis, os modelos ajustados e o código-fonte da solução foram disponibilizados em repositórios do ONS [9][10]. Isso viabiliza a reutilização da arquitetura, a replicação da abordagem em conjuntos de dados equivalentes, o compartilhamento de conhecimento, a colaboração entre agentes e a evolução contínua da solução, ampliando seus benefícios para além do ONS.
Por fim, o baixo custo computacional observado no treinamento e na inferência evidencia a viabilidade prática da aplicação de técnicas de fine-tuning a domínios especializados, tornando a especialização de modelos de código aberto acessível a outras iniciativas do setor elétrico.
8. Trabalhos Futuros
Como evolução da solução, prevê-se a integração do Transcritor a outros processos e sistemas do ONS, de modo a incorporar as transcrições e as informações extraídas diretamente nos fluxos da pós-operação.
Entre as frentes previstas estão a correlação automática de eventos a partir das gravações de áudio da operação, a avaliação automática da qualidade da comunicação verbal na operação, o apoio à elaboração de relatórios de análise da operação e o levantamento estatístico de dados operacionais.
9. Conclusão
Este trabalho apresentou o Transcritor, solução de transcrição e análise de áudios operativos que integra diarização, transcrição especializada e pós-processamento com LLM, customizada para o setor elétrico a partir de uma Base da Verdade rotulada por especialistas.
Os resultados medidos em ambiente produtivo indicaram redução de aproximadamente 29% na taxa de erro de transcrição em relação à solução comercial anterior, elevação da nota média atribuída pelos usuários de 2,5 para 3,8 e redução dos custos operacionais em aproximadamente 50%. Adicionalmente, a utilização dos resumos automáticos e dos mecanismos de busca e filtragem permitiu uma redução estimada de aproximadamente 80% no tempo de análise e apuração dos áudios, medida a partir da comparação do tempo médio diário gasto pelos usuários na avaliação das gravações antes e após a implantação da solução.
Por apoiar-se em modelos de código aberto, apresentar baixo custo computacional e possuir código-fonte e modelos especializados disponibilizados publicamente pelo ONS, a solução apresenta elevado potencial de replicação no Sistema Elétrico Brasileiro e em organizações de diferentes setores que enfrentam desafios relacionados à transcrição, estruturação e análise de grandes volumes de comunicações de voz.
GLOSSÁRIO
Log-mel: representação do áudio em frequência na escala Mel e amplitude logarítmica, obtida a partir da STFT, usada como entrada do transcritor.
LSTM (Long Short-Term Memory): rede neural recorrente que processa sequências mantendo uma memória de longo prazo, adequada a sinais temporais como a fala. Na versão bidirecional, considera o contexto passado e futuro.
N-grama: sequência de n itens consecutivos (palavras) de um texto, usada para analisar padrões e frequências.
Powerset: formulação da saída do modelo de segmentação que classifica, a cada instante, as combinações possíveis de locutores ativos (nenhum, um ou ambos), tratando a fala simultânea como uma classe própria.
SincNet: camada convolucional para áudio que aprende filtros de frequência diretamente da forma de onda, dispensando a extração manual de características.
STFT (Short-Time Fourier Transform): transformada de Fourier de curto prazo, que decompõe o áudio em frequências ao longo do tempo; base para o espectrograma log-mel.
Transformer: arquitetura de rede neural baseada em mecanismos de atenção; no Whisper, adota a forma encoder-decoder para converter áudio em texto.
Treinamento invariante a permutações: estratégia de treino em que a função de custo independe da ordem de numeração dos locutores, adotando a melhor correspondência entre previsões e rótulos.
BIBLIOGRAFIA
[1] H. Bredin, "pyannote.audio: neural building blocks for speaker diarization", in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2020, pp. 7124-7128.
[2] H. Bredin and A. Laurent, "End-to-end speaker segmentation for overlap-aware resegmentation", in Proc. Interspeech, 2021, pp. 3111-3115.
[3] M. Ravanelli and Y. Bengio, "Speaker Recognition from Raw Waveform with SincNet", in Proc. IEEE Spoken Language Technology Workshop (SLT), 2018, pp. 1021-1028.
[4] S. Hochreiter and J. Schmidhuber, "Long Short-Term Memory", Neural Computation, vol. 9, no. 8, 1997, pp. 1735-1780.
[5] A. Plaquet and H. Bredin, "Powerset multi-class cross entropy loss for neural speaker diarization", in Proc. Interspeech, 2023.
[6] A. Radford, J.W. Kim, T. Xu, G. Brockman, C. McLeavey, and I. Sutskever, "Robust Speech Recognition via Large-Scale Weak Supervision", arXiv:2212.04356, 2022.
[7] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, L. Kaiser, and I. Polosukhin, "Attention Is All You Need", in Advances in Neural Information Processing Systems (NeurIPS), 2017, pp. 5998-6008.
[8] T. Wolf et al., "Transformers: State-of-the-Art Natural Language Processing", in Proc. EMNLP: System Demonstrations, 2020, pp. 38-45.
[9] Operador Nacional do Sistema Elétrico (ONS), "TIAGO Transcrição - Código-fonte da solução", GitHub. Disponível em: https://github.com/ONSBR/Tiago-Transcricao. Acesso em: 14 set. 2026.
[10] Operador Nacional do Sistema Elétrico (ONS), "TIAGO Transcrição - Modelo especializado para o setor elétrico", Hugging Face. Disponível em: https://huggingface.co/onsdevops/tiago-transcricao. Acesso em: 14 set. 2026.
Como citar
CARVALHO, Julia Herz de. Solução de Transcrição e Análise de Áudios Operativos Baseada em Múltiplas Camadas de Inteligência Artificial. Crivum, 2026. Disponível em: https://crivum.org/p/3glw5i89.
Carvalho, J. H. (2026). Solução de Transcrição e Análise de Áudios Operativos Baseada em Múltiplas Camadas de Inteligência Artificial. Crivum. https://crivum.org/p/3glw5i89
@misc{crivum_ma71,
author = {Julia Herz de Carvalho},
title = {Solução de Transcrição e Análise de Áudios Operativos Baseada em Múltiplas Camadas de Inteligência Artificial},
year = {2026},
publisher = {Crivum},
url = {https://crivum.org/p/3glw5i89},
note = {Crivum MA71},
}Viu um problema nesta obra?
Toda obra publicada aqui fica aberta ao exame de quem lê. Se você encontrou dado que não se sustenta, trecho sem crédito ou autoria que não confere, aponte. A editoria lê todos os apontamentos.
Apontar exige conta, para o registro ter um nome por trás. Entre antes de escrever, assim você não perde o texto. Entrar para apontar
Um apontamento vai direto à editoria e fica registrado. Quando 3 pessoas diferentes apontam a mesma obra, ela sai do ar na hora e o caso vai ao comitê. A avaliação e o registro permanecem em qualquer caso, o que muda é a disponibilidade.