Open-access BrPoliCorpus: Cidadania Política e de Dados por meio de Acesso Universal

BrPoliCorpus: Political and Data Citizenship through Universal Access

Resumo

Este artigo tem por objetivo apresentar o BrPoliCorpus, um corpus de linguagem política brasileira. O projeto segue uma perspectiva apoiada na reprodutibilidade de pesquisa, mais especificamente nos parâmetros da ciência aberta. Busca-se, com este projeto, tornar disponível para pesquisadores um conjunto de dados que pode ser utilizado em pesquisas interdisciplinares, especialmente a análise do discurso político. O artigo descreve os desafios da coleta e sistematização de dados, refletindo sobre seu desenho original, baseado em raspagem HTML para seu status atual, baseado na coleta por API.

Palavras-chave
Discurso Político; Linguística do Corpus; Raspagem de Dados; Ciência Aberta; Reprodutibilidade

Abstract

This article presents BrPoliCorpus, a corpus of Brazilian political language. The project is based on the principles of research replicability, particularly those within Open Science. Its main objective is to provide researchers with an accessible dataset that can support interdisciplinary research, especially studies of political discourse. The article describes the challenges involved in collecting and systematizing the data, reflecting on the project’s departure from its original architecture, based on HTML web scraping, to its current API-based framework.

Keywords
Political Discourse; Corpus Linguistics; Data Scraping; Open Science; Replicability

1.

Introdução

Este artigo tem por objetivo discutir os processos de compilação e caminhos futuros relacionados ao BrPoliCorpus (Lima-Lopes, 2025a). O BrPoliCorpus é uma base de dados constituída por documentos políticos oficiais brasileiros que, hoje, possui pouco mais de 243 milhões de palavras, agregando registros de diferentes áreas do governo brasileiro. Entre elas estariam pronunciamentos realizados no plenário e em comissões ordinárias da Câmara dos Deputados (2001–2023), discursos de posse de presidentes da República do Brasil (1889–2023), planos de governo de candidatos ao governo do estado e à presidência da república (2014–2022), uma única CPI (2022). Atualmente, os dados são distribuídos em dois formatos: texto simples em arquivos (extensão *.csv) e como um pacote modular de dados instalável localmente em formato R. Seus dados foram sistematicamente raspados de sítios de autarquias públicas brasileiras, os quais disponibilizam dados textuais por meio de diferentes formatos. Ele é o resultado de dois projetos realizados entre 2021 e 2024.

Em termos teóricos, a produção deste corpus se fia na noção de que a linguagem é uma tecnologia social que transforma nossa relação com o mundo, criando pontes de expansão de nossas relações e constituindo realidades. Para Flusser (2007), uma alavanca, por exemplo, potencializa a capacidade do braço de levantar objetos, simbolizando como a tecnologia amplifica nossas habilidades. A linguagem pode ser vista como nossa alavanca mais crucial, uma tecnologia que cria realidades e está presente como código-fonte em todas as tecnologias, inclusive digitais. Apesar dessa importância, Flusser explica que a linguagem é algo artificial: representa por meios simbólicos a natureza e a realidade representacional.

Coeckelbergh (2020) discute a interseção entre linguagem, tecnologia e filosofia, buscando compreender como elas influenciam nossa realidade e identidade. Da mesma forma que Flusser, Coeckelbergh observa o papel fundamental da linguagem na nossa interação com o mundo, uma ferramenta que molda nossa percepção e compreensão. Através dela, damos sentido às nossas experiências e às tecnologias que usamos. A tecnologia, assim, não seria neutra; ela carrega consigo formas específicas de entender e interagir com o mundo, sendo central a ideia de que a tecnologia e a linguagem estão intrinsecamente ligadas. Argumenta-se, assim, que o léxico que utilizamos para definir as tecnologias pode moldar como as percebemos e utilizamos, exemplos seriam metáforas como rede ou nuvem, que enfatizam aspectos de conexão e intangibilidade. Nesse sentido, Coeckelbergh e Flusser possuem um ponto em comum a ser notado: ambos os filósofos definem a linguagem como ponto de partida para a percepção cultural da tecnologia, sendo, ela mesma, uma tecnologia de construção de sentidos e de realidade.

Partindo de uma assunção muito próxima à proposta pelo filósofo canadense Marshall McLuhan (1964), Coeckelbergh coloca que a tecnologia, por vezes, se integra em nossas vidas de forma a se tornar quase imperceptível. Isso leva a uma mudança na nossa identidade, pois nossas capacidades e limitações são redefinidas pelas tecnologias que naturalizamos. A linguagem, nesse contexto, precisa se adaptar para descrever essas novas realidades e experiências, ao mesmo tempo que também possibilita a criação e a construção dessas realidades. É por isso que o autor sugere que precisamos de uma abordagem que considere não apenas os efeitos diretos das tecnologias, mas também as mudanças sutis na nossa percepção e nas relações humanas que elas provocam. Seu trabalho convida a refletir sobre como a linguagem e a tecnologia moldam nossa percepção uma da outra. Por extensão, este binômio também ajuda a desenhar nossa realidade, mostrando que precisamos considerar não apenas seus aspectos técnicos, mas também suas dimensões linguísticas. Consequentemente, se por um lado, é importante reconhecer o papel das plataformas e dos objetos digitais (Hui, 2016) como instâncias capitalistas de interação, por outro, vale observar que as possibilidades de reconfiguração interacional levaram a importantes mitigações diaspóricas (Lévy, 1998) e o acesso a dados da sociedade que podem transformar a nossa própria noção de cidadania (Gutiérrez, 2019). Fato que dá às plataformas e à dadificação — definida como o fenômeno de quantificação da experiência humana por meio de seus hábitos digitais, muitas vezes, com fins econômicos —, uma característica dialógica (Mejias; Couldry, 2019).

Busca-se, assim, oferecer às comunidades acadêmica e não-acadêmica uma base de dados centralizada que pode ajudar a compreender a inter-relação entre sociedade e o discurso político oficial na realidade contemporânea. A análise computacional de dados abertos da sociedade brasileira é utilizada para constituir tal relação, por acreditar-se que padrões linguísticos podem refletir questões ideológicas que vão além da simples oposição partidária, mas também refletem nossa organização sociotécnica. De forma a realizar este objetivo, este capítulo se inicia com uma reflexão sobre a relação entre a pesquisa por corpus e a ciência aberta. Parte-se, então, para uma discussão sobre a importância dos dados abertos e os atuais desafios de organização e distribuição destes dados em nosso contexto. Discute-se, a seguir, os processos de compilação e geração de dados, além das possibilidades de distribuição atuais. Encerra-se o capítulo com uma prospecção do futuro desta base de dados.

2.

O corpus e suas possibilidades para ciência aberta

É neste contexto que os dados abertos ganham um papel importante, dado que a construção da cidadania conteporânea envolve o levantamento, o tratamento, a representação e a interpretação de dados (Lima-Lopes, 2023). Uma perspectiva crítica é fundamental, ao negar a suposta neutralidade dos dados, promovendo conhecimentos transformativos e de resistência. A pesquisa como princípio orientador estimula uma reflexão dinâmica sobre a linguagem em diferentes contextos, desafiando a ideia tradicional de que a língua é totalmente aprendível, enfatizando sua construção constante. Essa abordagem favorece o letramento científico, permitindo que questões de linguagem sejam aprendidas por meio de ações de pesquisa.

Assim, a constituição de um corpus de linguagem política oficial se faz importante. Se procuramos compreender a forma como o Estado Brasileiro se constitui como entidade em suas diversas facetas, a construção de um corpus desta natureza pode contribuir para diversas áreas do conhecimento. Além dos estudos linguísticos, áreas como ciência política, história e sociologia também podem se beneficiar de uma base como o BrPoliCorpus. Cabe ressaltar que a possibilidade de analisar tais dados de forma conjunta pode transformar nossa percepção deste discurso, graças às diferentes ferramentas de análise de dados possibilitadas pelas Humanidades Digitais. No contexto deste trabalho, é preciso entender o movimento das Humanidades Digitais não apenas como um conjunto de soluções tecnológicas para as ciências humanas, mas como um campo epistêmico transdisciplinar que modifica as condições para a produção e distribuição de conhecimento. As HDs (Anderson; Blanke, 2012) propõem uma transformação na forma como compreendemos as ciências humanas, em um ambiente no qual o uso extensivo de técnicas de análise computacional (Busa, 2004) expande de forma qualitativa e quantitativa a compreensão de fenômenos sociais. (Svensson, 2013) Além da informatização de documentos, a abordagem das HDs permite indagar sobre a maneira como as infraestruturas digitais nos relacionam à linguagem e aos dados.

É por esta razão que esta pesquisa também tem como base filosófica a perspectiva da Ciência Aberta. Apesar de o conhecimento colaborativo não ter sua origem na internet (Fecher; Friesike, 2014), a Ciência Aberta caracteriza-se como uma abordagem que visa democratizar o acesso ao conhecimento, desafiando práticas científicas tradicionais. A CA se apoia em princípios como acesso livre e compartilhamento de dados, recursos e publicações científicas, promovendo uma integração entre academia e sociedade (Jomier, 2017).

Uma das principais contribuições da CA é possibilitar que pesquisas sejam amplamente replicadas e revisadas, o que fortalece a credibilidade científica (Bartling; Friesike, 2013). Além disso, a CA impulsiona a criação de Recursos Educacionais Abertos (REA), materiais disponíveis gratuitamente que enriquecem o ensino e permitem uma abordagem contextualizada e crítica do conhecimento (Lima-Lopes, 2023). Na Educação e Linguística Aplicada, esses recursos são especialmente valiosos, pois incentivam o desenvolvimento de práticas pedagógicas que respeitam e integram a diversidade linguística e cultural dos estudantes, promovendo uma formação crítica e cidadã. Apesar de esta pesquisa não prever o desenvolvimento de materiais didáticos, ela está em consonância com este movimento uma vez que tem como pressuposto a livre disponibilização dos dados e dos programas escritos para sua criação. Tal perspectiva visa contribuir para a reprodutibilidade e interdisciplinaridade, uma vez que tais produtos podem ser importantes para outras áreas do conhecimento, como história, sociologia, educação e ciência política. Autores que abordam desafios na gestão de dados linguísticos no contexto da Ciência Aberta (Freitag et al., 2021), mostram como tal perspectiva poderia contribuir para a transparência, a reutilização e o armazenamento ético de informações. Destaca-se a necessidade de políticas específicas para assegurar replicabilidade e acessibilidade em projetos acadêmicos. O corpus cuja compilação discute-se neste capítulo visa a contribuir para a criação de uma tradição de reprodutibilidade e livre distribuição dos dados de pesquisa.

2.1

Transparência e dados políticos: uniformização e distribuição

O BrPoliCorpus nasceu como um exercício de programação cujo objetivo principal foi sistematizar os dados e metadados dos discursos de posse dos presidentes brasileiros entre 1889 e 2023. A partir deste objetivo inicial, observou-se a possibilidade de expansão do projeto, constituindo um corpus sistematicamente organizado.

Sua inspiração foi a transformação que o setor público brasileiro passou após a abertura de dados possibilitada pela Lei de Acesso à Informação (doravante LAI) (Brasil, 2011). Sua publicação é um dos marcos da transformação do governo brasileiro, que, agora, é orientado pela geração e disponibilização de dados em suas diferentes plataformas. Com grande influência do movimento de governo aberto, a adesão a esta perspectiva poderia, assim, ser compreendida como parte de um ciclo de regulação do setor público pela sua interação com o cidadão comum (Cristóvam; Hahn, 2020).

A LAI (Possamai; Souza, 2020) foi uma das pioneiras em incorporar, por princípio, que os dados estejam em formatos eletrônicos não-proprietários e abertos para reutilização. Essa característica diferencia a legislação brasileira de muitas normas focadas apenas no acesso documental. Entretanto, evidencia-se que os desafios da transparência não são apenas jurídicos e políticos, mas também tecnológicos. Se, por um lado, há o pioneirismo, por outro, há um desafio importante a ser vencido. Isso porque a implementação dos dados abertos depende da adoção de formatos acessíveis e sistemas capazes de disponibilizar informações de maneira estruturada (Pedroso; Tanaka; Cappelli, 2013). Esta acaba por ser uma das questões mais relevantes para a compilação de uma base de dados como BrPoliCorpus, pois a disponibilização de dados linguísticos tende a não ser uniforme nas diferentes autarquias públicas brasileiras.

Parte da base de dados que já está disponível pode servir como exemplo. Os discursos de posse dos presidentes da república do Brasil — ver seção 3 para descrição e discussão —, coletados entre 1889 e 2023, tiveram sua origem em diferentes sítios html da presidência da república e em publicações em .pdf do Senado Federal. Ou seja, a base de dados é dispersa originalmente: deve-se acessar cada página de cada presidente e, dentro dela, cada discurso. Quando um presidente não possui seus discursos presentes nestas páginas, algo comum com os presidentes da primeira república, foi necessário buscar publicações oficiais do governo que pudessem conter tais textos (Bonfim, 2008). Outros exemplos seriam os sítios do Senado Federal e do Congresso Nacional. Ambos disponibilizam os discursos realizados em plenário para a população. Duas são as formas de pesquisa: por discursos individuais e por API. No caso do primeiro, há o acesso aos discursos realizados em uma determinada data, ou por um determinado representante. Como no caso dos presidentes da república, seu acesso é feito individualmente. No segundo, é necessário conhecer a linguagem de programação específica para cada API para a realização da tarefa.

A questão da infraestrutura de disponibilidade também é algo importante a ser observado. Em muitos casos, os sítios governamentais usam endereços dinâmicos, que se modificam a cada acesso, tornando a coleta de dados ainda mais difícil. Em termos práticos, cada vez que acessamos um discurso, o endereço será diferente. No caso dos dados do Congresso Nacional, eles variam de acordo com os metadados de cada pronunciamento.

3.

Corpus: Coleta e estrutura atual

3.1

Metodologias de coleta

Dadas as questões apontadas na seção anterior, o BrPoliCorpus passou por duas fases de organização e coleta. Na primeira, partiu-se de processos de raspagem de dados diretamente das páginas das autarquias selecionadas, uma vez que as APIs mostravam algumas inconsistências em seus resultados. Foram parte desta primeira etapa a Câmara dos Deputados e o Tribunal Superior Eleitoral, escolhidos graças à grande quantidade de dados disponibilizada por eles. Em um segundo momento, a mudança em algumas versões possibilitou a utilização do serviço de API,1 utilizado na expansão do corpus.

No caso da primeira fase, sua versão é representada pela figura 1.

Figura 1
Fluxograma Inicial

A figura 1 representa os processos realizados na primeira fase. Há dois caminhos a serem realizados, o primeiro (à direita) foi aplicado aos dados do Congresso Nacional e validado em outros estudos, (Lima-Lopes, 2025b) mostrando-se consistente. Já o segundo (à esquerda) foi aplicado aos dados do TSE, cuja análise ainda não foi publicada.

Ao se buscar os discursos no sítio oficial, pode-se observar que o código-fonte da página de uma amostra aleatória e determinar que a URL (ou endereço de cada discurso) continha todos os metadados necessários para sua coleta. Ou seja, se conseguíssemos determinar quais seriam os parâmetros presentes em cada conjunto regular de discursos (como um ano, por exemplo), seria possível extrair os textos e os metadados necessários. Criou-se, assim, um conjunto de scripts que, partindo da busca por data e incluindo o total de páginas, extraíam os textos diretamente de suas páginas. Estes scripts também extraem os metadados, salvando-os com texto em tabelas nas quais cada linha representa um discurso.

O procedimento se inicia com scripts de coleta que recuperam e validam as URLs dos dados. Define-se uma função para gerar as URLs raspadas com base em parâmetros específicos, como a página atual e as datas de início e fim, verificando-se sua validade por meio de uma solicitação HTTP. Dependendo da validade, elas são salvas em arquivos de texto em pastas específicas. O processo principal do script cria as pastas e os arquivos com os dados automaticamente. O próximo passo é automatizar a extração de dados das URLs, salvando os resultados que são organizados em pastas para criar os metadados para o corpus. O script utiliza solicitações HTTP para recuperar o código-fonte das páginas da web a partir das URLs fornecidas, identificando automaticamente a codificação das páginas.2 Ele utiliza expressões regulares para encontrar padrões no HTML e cria pastas para armazenar os fragmentos de dados extraídos em arquivos de texto.

A seguir, busca-se reconstruir as URLs para todos os textos. Apesar de elas já terem sido validadas, este passo permite verificar se os metadados obtidos correspondem aos endereços a serem acessados. Para isso, o script automatiza a construção de URLs a partir de metadados, permitindo que eles sejam acessados por meio dessas URLs. Definem-se as pastas de entrada e saída, leem-se os arquivos de texto e analisam-se seus conteúdos, convertendo-os em um dicionário de parâmetros. Por fim, constroem-se as URLs adicionando os parâmetros extraídos às URLs base, e as salva em arquivos de texto na pasta de saída, renomeando-os conforme necessário.

Após estas verificações, a extração de dados efetivamente acontece. Extrai-se o texto das páginas da web especificadas usando URLs previamente construídas. Os arquivos são, então, salvos em formato *.txt. Esta extração necessita de uma função específica para recuperar o conteúdo HTML de uma página web. A extração é feita página a página, em formato de looping. A partir dos arquivos de texto criados anteriormente, organizam-se e armazenam-se apenas os metadados previamente selecionados para a compilação do corpus. Define-se, assim, uma função utilizando-se expressões regulares para extrair metadados relevantes e armazená-los em novos arquivos de texto, lendo o conteúdo linha por linha. Um arquivo final em formato CSV é criado organizando os metadados necessários e extraindo o conteúdo dos arquivos de texto. Definem-se funções para analisar metadados, lendo-os em cada arquivo. Ou seja, a função encontra o arquivo de conteúdo correspondente na pasta, removendo campos desnecessários, adicionando metadados e texto, removendo dados duplicados, verificando a consistência dos registros e salvando em uma tabela gravada em CSV.

No caso do TSE, os sítios estavam disponíveis em uma tecnologia proprietária que não permitiu a exploração destas regularidades. Partiu-se assim, para uma coleta manual de URLs, que implicou na sua identificação e registro manual para cada um dos programas de governo de cada candidato estadual e federal. Partiu-se então para uma organização das URLs em uma lista estruturada para processamento posterior. Tal lista foi lida por um script que acessava de forma automatizada as páginas correspondentes.

Os metadados estavam disponíveis em uma tabela CSV referente a cada ano de eleição, sendo disponibilizada pelo site do TSE. Ela permitiu que alguns metadados, tais como nome do candidato, partido, número e a existência (ou não) de uma coalizão, e a situação da candidatura (eleito, não eleito, candidatura cassada ou não homologada), fossem colhidos. Entre os dados a serem considerados, descartaram-se aquelas candidaturas que não foram homologadas pelo tribunal. O próximo passo foi a recuperação dos arquivos PDF com os textos. Arquivos PDF em forma de texto foram extraídos diretamente, ao passo que, quando o texto estava disponível apenas como imagem, houve a aplicação de Reconhecimento Óptico de Caracteres (OCR), de forma a realizar a conversão das imagens em texto processável.

Seguiu-se, então, a consolidação dos dados, integrando os metadados e os textos extraídos em uma única planilha CSV com a padronização do nome dos campos.

Apesar de conseguir extrair os dados necessários, esta abordagem se mostrou problemática do ponto de vista técnico. A raspagem gerava um acúmulo grande de dados na memória dos computadores, atingindo rapidamente o limite de processamento da máquina utilizada. Por conta disso, alinhado a uma melhoria nas APIs de algumas autarquias, decidiu-se, em novas extrações, por uma negociação com as interfaces técnicas dos sistemas públicos a serem consultados em futuras extrações.

Foi assim que, para ampliações futuras ainda em andamento, que compreenderiam a coleta de dados do Senado Federal, foi desenvolvido um novo conjunto de scripts. Estes negociam de forma direta com as APIs das autarquias públicas. Como resultado, eles não apenas são reproduzíveis, como também possibilitam a coleta com maior estabilidade. Isso porque, não raramente, sítios de internet podem ter sua forma de codificação modificada periodicamente, sem aviso prévio e sem um manual de modificações no código. Uma vez que seu objetivo principal é oferecer ao usuário uma interface para navegação. Já as APIs, quando modificadas, possuem documentação que permite a tradução dos scripts para o novo padrão.

A figura 2 representa os processos a serem realizados na segunda fase.

Figura 2
Fluxograma coleta — API Senado Federal

Assim, como pode-se ver na parte superior (em azul) da figura 2, a coleta via API automatiza a obtenção de metadados dos pronunciamentos de senadores por meio da API oficial de Dados Abertos do Senado Federal. O script consulta as legislaturas selecionadas para recuperar a lista de senadores, elimina duplicidades entre legislaturas e, para cada parlamentar, realiza consultas adicionais ao cadastro oficial para obter informações estáveis de mandato, como unidade federativa e partido político. Em seguida, consulta os pronunciamentos realizados no período especificado, extraindo com tratamento de exceções os campos disponibilizados pela API — incluindo dados do parlamentar, informações do pronunciamento, sessão plenária, publicações oficiais e links para os textos completos. Os resultados são consolidados em um único arquivo CSV contendo os metadados estruturados. O passo seguinte seria a recuperação dos textos integrais dos pronunciamentos. Realiza-se a coleta dos pronunciamentos previamente identificados (seção verde na figura 2). A partir dos metadados gerados na etapa anterior, o script consulta três fontes em ordem decrescente de prioridade: a URL binária disponibilizada diretamente pela API, o endpoint de texto integral do sistema e, como mecanismo de contingência, a extração de conteúdo a partir da página HTML oficial do pronunciamento. O texto é associado ao respectivo código de pronunciamento e armazenado juntamente com o registro da fonte utilizada na recuperação, permitindo rastrear a origem de cada documento.

A fase de integração, normalização e deduplicação dos dados (seção violeta na figura 2) combina os metadados dos pronunciamentos com os textos integrais recuperados na etapa anterior. O processo normaliza os identificadores para evitar inconsistências decorrentes de diferentes formatos de armazenamento, realiza a junção entre os conjuntos de dados e elimina registros duplicados. Além disso, executa verificações de integridade, identifica pronunciamentos sem texto correspondente e reorganiza as colunas. O resultado é um corpus consolidado contendo metadados e conteúdo textual em arquivo único estruturado. Por fim, o pós-processamento, limpeza e exportação do corpus (seção marrom na figura 2) é um tratamento final do corpus consolidado, gerando um arquivo de saída para análise. O script verifica a existência de campos de resumo ou sumário e, quando disponíveis, remove do texto integral sequências de tokens já presentes nesses campos, reduzindo redundâncias de conteúdo. Identifica e remove colunas completamente vazias — cujo esvaziamento decorre da ausência de dados para o período coletado na API, e não de falha no processamento —, normaliza valores ausentes e exporta o corpus em formato CSV. O conjunto de dados resultante integra metadados parlamentares, informações legislativas, características dos pronunciamentos e textos completos, constituindo uma base estruturada para análises linguísticas, discursivas ou de processamento de linguagem natural, com rastreabilidade assegurada pelos identificadores e links oficiais do Senado Federal.

3.2

Estrutura atual do corpus

No momento, os dados podem ser acessados tanto como um pacote da plataforma R quanto por meio do download de planilhas CSV. Dado o volume de dados a ser distribuído, o pacote e as planilhas foram divididos em módulos de tempo manejáveis, de aproximadamente três meses cada. O pacote R e os dados gerados para este corpus podem ser acessados no repositório do projeto (Lima-Lopes, 2025a), enquanto os scripts para reproduzir e compilar o corpus.3

Tabela 1
BrPoliCorpus e sua composição

O BrPoliCorpus pode ser considerado um corpus grande. Como mostra a tabela 1, sua versão atual possui 506.351 mil documentos (textos), cerca de 243,7 milhões de palavras totais (tokens) e quase 1,97 milhão de palavras únicas (types).

Os discursos parlamentares são o maior componente do corpus. Este subcorpus responde por mais de 84% de todos os textos coletados (428.445 documentos) e por mais de 75% do volume total de palavras, com 184,1 milhões de tokens. Ele também possui a maior riqueza lexical absoluta, com mais de 1,2 milhão de types. As comissões parlamentares ordinárias, embora possuam um número relativamente pequeno de documentos (2.577), são o segundo maior subcorpus em volume de palavras, somando 44,6 milhões de tokens e 386.534 types. Isso indica que os documentos desse subcorpus (como atas de reuniões, relatórios ou transcrições longas) tendem a ser extensos, em contraste com os discursos de plenário, que variam muito em seu tamanho.

A única CPI (Comissão Parlamentar de Inquérito), a chamada CPI da vacina, apresenta 75.182 documentos, que possuem 3,7 milhões de tokens e 128.089 types. Os programas de governo contam com 112 documentos, reunindo 11,1 milhões de tokens e 218.783 types. O número de documentos, neste caso, pode ser o resultado de dois fatores. Primeiramente, eles representam as propostas de candidatos do executivo estadual e federal, algo naturalmente menor em volume. Além disso, ainda não foi realizada uma coleta referente aos municípios, devido à falta de pessoal e, consequentemente, ao grande volume de resultados. Por fim, os discursos de posse são o menor subcorpus, com 35 documentos que, juntos, somam 75.918 tokens e 15.103 types. Apesar disso, este é o mais representativo e abrangente do corpus, contendo 100% da amostra.

O total geral de palavras únicas (types: 1.967.435) em relação ao total de palavras (tokens: 243.786.993) resulta em uma Razão Type/Token (TTR) global baixa. Isso é um comportamento estatístico natural e esperado em corpora grandes (Zipf, 2012). À medida que o corpus cresce, palavras gramaticais (artigos, preposições, conjunções) e itens lexicais típicos do contexto legislativo — lembrando que este registro é o mais frequente do corpus — se repetem, o número de tokens pode crescer, ao passo que o número de palavras únicas (types) não segue a mesma razão.

4.

Caminhos futuros e o desenvolvimento

O trabalho de coleta e compilação de um recurso como o BrPoliCorpus (Lima-Lopes, 2025a) é um processo contínuo. Algumas perspectivas de ampliação podem ser importantes.

Apesar de seu tamanho, característica que o classificaria como um corpus grande, o BrPoliCorpus ainda possui um número reduzido de registros. No geral, seu foco está em dados do legislativo e de candidaturas para o executivo estadual. Tal ampliação poderia levar a uma melhor compreensão do espectro político brasileiro e da construção discursiva do Estado. Entre as ampliações necessárias estariam: (1) novos níveis dentro da esfera federal; (2) novas autarquias em nível estadual e municipal; (3) inclusão de dados do poder judiciário, em todas as suas instâncias. No caso do primeiro, observa-se a necessidade de obter-se documentos de secretarias especiais e ministérios, importantes para processos regulatórios do governo. Ampliar-se-ia, dessa forma, a compreensão de como os processos sociais se manifestam em diferentes contextos dentro da instância federal.

A falta de documentação oriunda dos governos estaduais e municipais não permite que os discursos políticos nestes níveis sejam estudados. Entre as possibilidades estariam transcrições das câmaras estaduais e municipais, assim como dados das suas diversas secretarias. Naturalmente, que dados do executivo estadual que já existem no corpus, como os planos de governo, deveriam também ser agregados. Vale ressaltar que o judiciário brasileiro, última possibilidade, também disponibiliza uma série de dados textuais à população. Se tomarmos em conta o objetivo do BrPoliCorpus, apenas documentos públicos devem fazer parte dele. Isso porque, o judiciário também pode disponibilizar uma série de documentos, como sentenças e juízos de processos privados que, se divulgados, poderiam ferir questões de privacidade.

Entretanto, tal ampliação necessitaria da construção de infraestrutura de coleta e armazenamento de dados. Hoje, no Brasil, existem 5.569 municípios e 26 estados. A variação técnica pode ser grande, uma vez que cada um seria autônomo para disponibilizar sua própria infraestrutura com sistemas de API próprios, ou mesmo códigos de html únicos. O mesmo pode ser colocado em relação ao judiciário, tornando o processo de coleta único em cada um dos diversos tribunais em diferentes estados e áreas da justiça. Certamente, os processos de programação deveriam contar com uma equipe capaz de analisar cada um dos padrões de distribuição de dados, algo que criaria uma massa de código significativa. Além disso, tais coletas fariam com que os dados crescessem deveras, gerando a necessidade de infraestrutura de armazenamento e distribuição dos dados, que também cresceria em volume.

1

Uma API (Application Programming Interface, ou interface de programação de aplicativo) é uma conexão lógica entre computadores ou entre programas. Essas interfaces oferecem serviços por meio de uma negociação padronizada entre um computador/software que solicita informações e outro que as entrega. Ou seja, elas permitem que um computador/programa interaja com demandas externas. Exemplos seriam nossos clientes de e-mail, ou mesmo o acesso que realizamos em sítios de bancos e de universidades. Estes sistemas negociam com nossos computadores permitindo-nos realizar certas ações. Neste caso, a coleta de dados.

2

Apesar de todas as páginas serem em português brasileiro, a verificação de codificação de caracteres foi necessária.

Declaração de disponibilidade de dados

Não se aplica.

Declaração de uso de inteligência artificial

Declaramos que não foram utilizadas tecnologias de IA para/na produção deste artigo.

AGRADECIMENTOS

Rodrigo Esteves de Lima Lopes gostaria de agradecer ao CNPq (processo 303996/2024-2) pelo financiamento desta pesquisa.

Referências

  • ANDERSON, S.; BLANKE, T. Taking the Long View: From e-Science Humanities to Humanities Digital Ecosystems. Historical Social Research / Historische Sozialforschung, [s. l.], v. 37, n. 141, p. 147–164, 2012. Disponível em: https://www.jstor.org/stable/41636602 Acesso em: 30 nov. 2018.
    » https://www.jstor.org/stable/41636602
  • BARTLING, S.; FRIESIKE, S. (Org.). Opening science. New York: Springer, 2013.
  • BONFIM, J. B. B. Palavra de presidente: os discursos presidenciais de posse, de Deodoro a Lula. [S. l.]: Senado Federal, 2008. Disponível em: http://www2.senado.leg.br/bdsf/handle/id/91988
    » http://www2.senado.leg.br/bdsf/handle/id/91988
  • BRASIL. Lei Nº 12.527: Lei de Acesso à Informação, LAI. Brasília-DF: Câmara dos Deputados, 18 nov. 2011. Disponível em: https://www2.camara.leg.br/legin/fed/lei/2011/lei-12527-18-novembro-2011-611802-norma-pl.html Acesso em: 16 nov. 2022.
    » https://www2.camara.leg.br/legin/fed/lei/2011/lei-12527-18-novembro-2011-611802-norma-pl.html
  • BUSA, R. A. Foreword: Perspectives on the Digital Humanities. In: SCHREIBMAN, S.; SIEMENS, R.; UNSWORTH, J. (org.). Companion to Digital Humanities. Malden: Blackwell Publishing, 2004.
  • COECKELBERGH, M. Using Words and Things: Language and Philosophy of Technology. [S. l.]: Routledge, 2020.
  • CRISTÓVAM, J. S. da S.; HAHN, T. M. Administração pública orientada por dados: Governo aberto e infraestrutura nacional de dados abertos. Revista de Direito Administrativo e Gestão Pública, [s. l.], v. 6, n. 1, p. 1–24, 2020. https://doi.org/https://doi.org/10.26668/IndexLawJournals/2526-0073/2020.v6i1.6388
    » https://doi.org/10.26668/IndexLawJournals/2526-0073/2020.v6i1.6388
  • FECHER, B.; FRIESIKE, S. Open Science: One Term, Five Schools of Thought. In: BARTLING, S.; FRIESIKE, S. (org.). Opening Science. Cham: Springer International Publishing, 2014. p. 17–47. DOI 10.1007/978-3-319-00026-8_2 Disponível em: http://link.springer.com/10.1007/978-3-319-00026-8_2 Acesso em: 6 jul. 2022.
    » https://doi.org/10.1007/978-3-319-00026-8_2
  • FLUSSER, V. O mundo codificado. São Paulo: Cosac Naif, 2007.
  • FREITAG, R. M. K.; MARTINS, M. A. R.; ARAÚJO, A.; BATTISTI, E.; COELHO, I. M. W. da S.; SOUSA, M. D. A. F.; SILVA, R. G. da; LIMA-LOPES, R. E. de. Desafios da gestão de dados linguísticos e a Ciência Aberta. Cadernos de Linguística, [s. l.], v. 2, n. 1, p. 1–19, 26 abr. 2021. DOI 10.25189/2675-4916.2021.v2.n1.id307 Disponível em: https://cadernos.abralin.org/index.php/cadernos/article/view/307 Acesso em: 14 nov. 2021.
    » https://doi.org/10.25189/2675-4916.2021.v2.n1.id307
  • GUTIÉRREZ, M. Participation in a datafied environment: questions about data literacy. Comunicação e sociedade [Online], [s. l.], v. 36, 2019.
  • HUI, Y. On the existence of digital objects. Minneapolis: University of Minnesota Press, 2016(Electronic mediations, 48).
  • JOMIER, J. Open science – towards reproducible research. Information Services & Use, [s. l.], v. 37, n. 3, p. 361–367, 7 nov. 2017. DOI 10.3233/ISU-170846 Disponível em: https://www.medra.org/servlet/aliasResolver?alias=iospress&doi=10.3233/ISU-170846 Acesso em: 13 fev. 2021.
    » https://doi.org/10.3233/ISU-170846
  • LÉVY, P. A revolução contemporânea em matéria de comunicação. Revista FAMECOS, [s. l.], v. 9, p. 37–49, 1998. https://doi.org/10.15448/1980-3729.1998.9.3009
    » https://doi.org/10.15448/1980-3729.1998.9.3009
  • LIMA-LOPES, R. E. de. BrPoliCorpus: Brazilian political corpus. [S. l.]: Repositório de Dados de Pesquisa da Unicamp, a2025. DOI 10.25824/REDU/YCFPIV Disponível em: https://github.com/rll307/BrPoliCorpus [doi:10.25824/REDU/YCFPIV] Acesso em: 11 ago. 2025.
    » https://doi.org/10.25824/REDU/YCFPIV» https://github.com/rll307/BrPoliCorpus
  • LIMA-LOPES, R. E. de. Ciência Aberta e suas Contribuições para a Educação Aberta. Revista Linguagem & Ensino, [s. l.], v. 25, n. especial, p. 141–155, 22 dez. 2022. DOI 10.15210/10.15210/RLE.V25especial.4441 Disponível em: https://periodicos.ufpel.edu.br/index.php/rle/article/view/24771 Acesso em: 2 jan. 2023.
  • LIMA-LOPES, R. E. de. Letramento de dados e suas possibilidades para a educação científica em linguagem. Revista Leia Escola, [s. l.], v. 23, n. 1, p. 62–81, 28 abr. 2023. Disponível em: https://revistas.editora.ufcg.edu.br/index.php/leia/article/view/613/3972 Acesso em: 26 jun. 2023.
    » https://revistas.editora.ufcg.edu.br/index.php/leia/article/view/613/3972
  • LIMA-LOPES, R. E. de. Vaccine and vaccination in parliamentary discourse in Brazilian Portuguese during COVID-19: Analysis of relational processes. Applied Corpus Linguistics, [s. l.], v. 5, n. 2, p. 100133, ago. b2025. DOI 10.1016/j.acorp.2025.100133 Disponível em: https://linkinghub.elsevier.com/retrieve/pii/S2666799125000164 Acesso em: 15 maio 2025.
    » https://doi.org/10.1016/j.acorp.2025.100133
  • MCLUHAN, M. The Media is the Message. Understanding Media: Extensions of Man. Cambridge (US): MIT Press, 1964. p. 7–21.
  • MEJIAS, U. A.; COULDRY, N. Datafication. Internet Policy Review, [s. l.], v. 8, n. 4, 29 nov. 2019. DOI 10.14763/2019.4.1428 Disponível em: https://policyreview.info/concepts/datafication Acesso em: 30 ago. 2021.
    » https://doi.org/10.14763/2019.4.1428
  • PEDROSO, L.; TANAKA, A.; CAPPELLI, C. A Lei de Acesso à Informação brasileira e os desafios tecnológicos dos dados abertos governamentais. 22 maio 2013. Anais do IX Simpósio Brasileiro de Sistemas de Informação (SBSI 2013) […]. Brasil: Sociedade Brasileira de Computação, 22 maio 2013. p. 523–528. DOI 10.5753/sbsi.2013.5718 Disponível em: https://sol.sbc.org.br/index.php/sbsi/article/view/5718 Acesso em: 7 jun. 2026.
    » https://doi.org/10.5753/sbsi.2013.5718
  • POSSAMAI, A. J.; SOUZA, V. G. de. Transparência e Dados Abertos Governamentais: Possibilidades e Desafios a Partir da Lei De Acesso À Informação. Administração Pública e Gestão Social, [s. l.], v. 12, n. 2, 2020. Disponível em: https://www.redalyc.org/articulo.oa?id=351562414012 Acesso em: 7 jun. 2026.
    » https://www.redalyc.org/articulo.oa?id=351562414012
  • SVENSSON, P. Humanities Computing as Digital Humanities. In: TERRAS, M. M.; NYHAN, J.; VANHOUTTE, E. (org.). Defining digital humanities: a reader. Farnham, Surrey, England: Burlington, VT: Ashgate Publishing Limited ; Ashgate Publishing Company, 2013. p. 35–48.
  • ZIPF, G. K. Human behavior and the principle of least effort: an introduction to human ecology. Mansfield Centre, Conn: Martino Publishing [u.a.], 2012.

Declaração de conflito de interesses

Os autores declaram não haver conflito de interesse.

Editora-chefe

Simone Tieme Hashiguti
Érica Lima

Disponibilidade de dados

Citações de dados

Lima-Lopes R. E. de BrPoliCorpus: Brazilian political corpus Repositório de Dados de Pesquisa da Unicamp 2025 10.25824/REDU/YCFPIV https://github.com/rll307/BrPoliCorpus 11 ago. 2025

Datas de Publicação

  • Publicação nesta coleção
    24 Ago 2026
  • Data do Fascículo
    2026

Histórico

  • Recebido
    20 Jul 2026
  • Aceito
    24 Jul 2026
location_on
UNICAMP. Programa de Pós-Graduação em Linguística Aplicada do Instituto de Estudos da Linguagem (IEL) Rua Sérgio Buarque de Holanda, n.571 - Cidade Universitária - CEP: 13083-859, Telefone: (+55) 19 - 3521-6729 - Campinas - SP - Brazil
E-mail: tla@unicamp.br
rss_feed Acompañe los números de esta revista en su lector de RSS
Ir para arriba Notificar error