Por Sorsa Editorial

Atualizado em 11 de julho de 2026: verificamos as tarifas atuais de pagamento por uso da API do X e o teto mensal de 2 milhões de posts após a mudança de preço de 20 de abril, e atualizamos os cenários de custo de coleta contra elas.

Em resumo: Os dados políticos no Twitter (X) se dividem em posts de contas oficiais, discurso eleitoral público, sinais de engajamento e pontuações derivadas. Desde que a trilha acadêmica gratuita da API fechou em 2023, a maioria dos projetos coleta seus próprios dados por uma API de terceiros: buscas por palavra-chave, hashtag ou @, extrações delimitadas por data e acompanhamento de menções, escopadas e re-hidratadas conforme necessário.

O X continua sendo o lugar onde políticos anunciam, jornalistas dão furos e eleitorados discutem em público, o que o torna uma das fontes mais ricas de dados políticos que existe. A parte difícil agora é o acesso. A trilha gratuita de pesquisa acadêmica que alimentou uma década de artigos de ciência política acabou, a API oficial é medida e precificada para empresas, e os datasets públicos com que os pesquisadores contavam são snapshots congelados que não re-hidratam mais de forma limpa.

A Sorsa API, uma API alternativa do Twitter (X) para dados públicos, é feita para esse tipo de coleta de leitura intensa. Ela lê posts públicos, perfis, resultados de busca e engajamento por uma única chave de API em um cabeçalho, sem handshake OAuth e sem fila de aplicação, a tarifas efetivas a partir de US$ 0,02 por 1.000 tweets e a partir de US$ 0,01 por 1.000 perfis. Você busca por palavra-chave, hashtag ou @ por /search-tweets, delimita uma coleta a uma janela eleitoral com filtros de data e acompanha menções de um candidato por /mentions, tudo em cobrança fixa por requisição que permanece previsível quer um dataset seja alguns milhares de posts ou alguns milhões.

Índice

O que conta como dado político no X {#what-counts-as-political-data-on-x}

Dado político no X é um rótulo solto cobrindo vários datasets distintos que por acaso compartilham uma plataforma, e um plano de coleta tem de nomear qual deles ele busca. Confundi-los é o primeiro erro, porque cada um precisa de uma consulta diferente e de um orçamento de volume diferente.

A produção de contas oficiais são os posts de políticos, partidos, órgãos de governo e candidatos: um registro limpo e de alto sinal do que os atores oficiais disseram e quando. Este é um dataset pequeno, muitas vezes alguns milhares de posts por mês para uma legislatura inteira.

O discurso de pauta e eleitoral é tudo que o público posta sobre um candidato, um projeto de lei, uma hashtag ou uma eleição. É muito maior e muito mais ruidoso, chegando a milhões de posts em torno de uma votação nacional, e é a base da maioria do trabalho de sentimento e de opinião pública.

Engajamento e difusão é quem amplificou o quê, quão rápido e quão longe: reposts, respostas, quote posts e o tempo entre eles. É assim que os pesquisadores estudam influência e a propagação de narrativas.

Sinais derivados são pontuações de sentimento, posicionamento, tópico e probabilidade de bot computadas em cima dos posts brutos. Estas são produzidas pela sua análise em vez de te serem entregues, e costumam ser o resultado de pesquisa de fato.

A diferença de volume entre a primeira e a segunda categoria é o problema de planejamento inteiro. Um dataset de contas de políticos é pequeno e barato; a coleta ampla de discurso eleitoral é onde os custos e os rate limits começam a importar.

De onde vêm os dados políticos do X em 2026 {#where-political-x-data-comes-from-in-2026}

Há três rotas reais para dados políticos do X, e projetos sérios costumam combiná-las: a API oficial do X, datasets públicos de pesquisa congelados, e coletar os dados você mesmo por uma API de terceiros.

A API oficial do X é autoritativa e completa porque é o dado first-party do próprio X. Ela deixou de ser a resposta realista para a maioria dos orçamentos de pesquisa em 2023. O X rodou uma trilha dedicada de Pesquisa Acadêmica por anos, gratuita e generosa com busca de arquivo completo, e uma grande fatia da literatura de ciência política publicada foi construída sobre ela. Essa trilha foi desmontada, documentado em um estudo de 2024 sobre a contribuição da API para a pesquisa que contou mais de 27.000 artigos construídos sobre dados do Twitter desde 2006 antes de o acesso ser cortado. Novos desenvolvedores agora recebem a mesma API medida e de pagamento por uso que todo mundo, e volume em escala de pesquisa esbarra em um contrato Enterprise que historicamente começou em torno de US$ 42.000 por mês.

Datasets públicos de pesquisa são a segunda rota: grandes, revisados por pares, já coletados. Pesquisadores publicaram coletas de milhões de posts em torno de grandes eleições, como o dataset Election2020 de mais de 600 milhões de tweets, junto com bancos de dados curados de contas de legisladores em muitos países. Dois limites se aplicam. Eles são congelados a uma janela fixa, então não conseguem responder nada sobre o que aconteceu após o fim da coleta, e a maioria é distribuída como IDs de tweet em vez de posts completos, para cumprir os termos da plataforma. Você recebe uma lista de IDs e precisa re-hidratá-los buscando cada um por uma API. A re-hidratação costumava ser gratuita e completa; agora ela roda por uma API paga, e todo post apagado desde que o dataset foi construído volta vazio. Como posts politicamente sensíveis são apagados a uma taxa alta, um dataset eleitoral de anos atrás pode re-hidratar para uma fração do seu tamanho original, enviesado rumo ao que quer que nunca tenha sido derrubado.

A terceira rota é coletar os dados você mesmo: pagamento por uso, atual e moldado à sua pergunta exata, em troca de construir a coleta. Uma combinação comum usa um dataset público como linha de base histórica, a sua própria coleta para a frente para tudo depois do fim da janela daquele dataset, e extrações direcionadas da API oficial apenas onde a completude first-party é inegociável. Para grupos acadêmicos especificamente, a Sorsa roda um programa de pesquisa acadêmica com acesso com desconto em cima dos endpoints somente leitura padrão.

Quanto custa coletar dados políticos do Twitter {#how-much-does-collecting-political-twitter-data-cost}

Coletar tweets políticos por uma API fixa por requisição custa a partir de US$ 0,02 por 1.000 tweets e a partir de US$ 0,01 por 1.000 perfis, com um plano mensal completo a partir de US$ 49. A API oficial do X cobra por recurso buscado em vez disso, então o custo escala diretamente com o tamanho do dataset: a coleta ampla de discurso eleitoral rapidamente esbarra em quatro dígitos ou atinge o teto mensal de 2 milhões de posts do X, acima do qual só um contrato Enterprise se aplica.

A tabela mapeia três trabalhos comuns de coleta política em cada modelo. Os números da Sorsa são no nível de plano; os números da API oficial do X usam as tarifas atuais por recurso do detalhamento completo de preços da API do X de 2026.

Trabalho de coletaAPI oficial do XPlano fixo da Sorsa
Watchlist de legislatura (~500 contas, perfis mais posts recentes)Posts US$ 0,005 cada, perfis US$ 0,010 cada; uma atualização mensal de alguns milhares de posts sai a dezenas de dólaresCabe no Starter, US$ 49/mês por 10.000 requisições
Discurso de noite de debate (~200.000 posts em uma hashtag)~200.000 posts a US$ 0,005 cada é cerca de US$ 1.000 por uma noite, contado contra o teto mensal de 2MCabe no Pro, US$ 199/mês por 100.000 requisições
Discurso de campanha completa (2M+ posts por mês)Excede o teto de 2M de leituras de post; exige um contrato Enterprise, historicamente a partir de ~US$ 42.000/mêsEnterprise, US$ 899/mês por 500.000 requisições

Uma requisição da Sorsa retorna até 100 tweets nos endpoints de lote ou até 200 perfis, então o contador de requisições de um plano se estende muito mais longe do que um contador por post sugere. É aí que o modelo fixo vence na coleta política de leitura intensa: até 50x mais barato do que a API oficial na mesma carga, e sem um medidor por recurso contando rumo a um teto.

Duas cifras por 1.000 se aplicam, dependendo do endpoint, e vale ver as duas. Os endpoints de lote (/tweet-info-bulk e /info-batch, até 100 itens por requisição) colocam o custo efetivo a partir de US$ 0,02 por 1.000 tweets e a partir de US$ 0,01 por 1.000 perfis. Os endpoints de busca e de linha do tempo (/search-tweets, /user-tweets, /mentions) retornam cerca de 20 posts por requisição, o que dá cerca de US$ 0,10 por 1.000 tweets no plano Pro. A coleta de discurso usa os endpoints de busca, então faça o orçamento contra a cifra de busca; consultas de perfil e extrações por ID conhecido usam os endpoints de lote e caem muito mais baixo. Os detalhes completos ficam na página de preço fixo por requisição.

Coletando posts de políticos e contas oficiais {#collecting-posts-from-politicians-and-official-accounts}

O dataset político mais limpo de construir você mesmo é a produção de contas oficiais. Você começa de uma lista de @s, uma câmara de uma legislatura, um gabinete ou uma chapa de candidatos, e puxa os posts de cada conta por /user-tweets por nome de usuário, link de perfil ou ID numérico de usuário. O volume é pequeno e constante, bem abaixo do que a coleta de discurso custa, e dá um registro first-party completo do que esses atores postaram.

Duas práticas tornam esse dataset confiável. A primeira é uma watchlist curada em vez de um filtro de selo. Depois de 2022, o selo azul de verificado virou uma assinatura paga em vez de uma checagem de identidade, então a flag verified em um perfil não confirma mais que uma conta é uma genuína oficial. O método confiável é construir uma lista de @s a partir de uma fonte autoritativa, como um site de dados abertos parlamentar ou um banco de dados acadêmico de legisladores, e validá-la uma vez. Datasets reais são construídos assim: uma coleta de 1,1 milhão de posts de 692 deputados federais brasileiros começou de contas recuperadas e validadas manualmente contra o site de dados abertos da Câmara dos Deputados, e depois rotuladas pelo resultado eleitoral de cada deputado.

A segunda são identificadores estáveis. Nomes de usuário mudam; IDs numéricos de usuário não. Resolva cada @ para o seu ID uma vez por /username-to-id/{handle} e armazene o ID, para que uma watchlist sobreviva a um político rebrandizando uma conta no meio da campanha. Para atualizar os dados de perfil da watchlist inteira de uma tacada, /info-batch aceita até 100 @s ou IDs por requisição e retorna perfis completos, o que mantém os contadores de seguidores e as mudanças de bio atuais em uma legislatura por um punhado de requisições. Quando você precisa do catálogo inteiro de uma única conta, o mesmo endpoint de linha do tempo pagina por ele, a abordagem coberta no guia de puxar o histórico completo de postagem de um usuário.

Coletando discurso eleitoral e de pauta {#collecting-election-and-issue-discourse}

O discurso público, o que todos postam e não só os oficiais, é a coleta maior e mais difícil. É um problema de palavra-chave: você define uma consulta a partir de nomes de candidatos, hashtags e frases de pauta, fixa um idioma e pagina pelos resultados. O endpoint /search-tweets da Sorsa aceita a sintaxe completa de busca avançada do Twitter, então from:, frases exatas entre aspas, hashtags e OR booleano todos funcionam dentro de uma consulta, a mecânica detalhada no guia de buscar tweets pela API.

O enquadramento da consulta é em si uma decisão que molda o dataset antes de um único post ser coletado. As hashtags e frases que você escolhe decidem a conversa de quem você captura: busque só a hashtag de um lado e você mediu um lado. A correção é um conjunto de palavras-chave balanceado e documentado cobrindo a chapa inteira. Um exemplo bem citado coletou 2,2 milhões de tweets em torno da eleição dos EUA de 2016 usando um filtro simétrico de palavras-chave em ambos os principais candidatos, e depois usou as próprias hashtags como semente para construir um conjunto de treino rotulado. Para manter um conjunto de palavras-chave atual durante uma campanha ao vivo, puxe os trending topics da região por WOEID por /trends e incorpore os politicamente relevantes na consulta, uma técnica que estudos reais de referendo usaram para pegar hashtags emergentes conforme surgiam.

Para construir e testar essas consultas sem escrever código primeiro, o construtor visual de consulta de busca compõe uma string de busca avançada no navegador, e a referência de operadores de busca avançada lista cada operador que o endpoint aceita. O escopo importa tanto quanto o enquadramento: uma consulta focada sobre uma janela apertada, uma única noite de debate ou o ciclo de notícias de um projeto de lei, muitas vezes é um dataset melhor do que um esparramado, mais barato de coletar e apontado a uma pergunta mais afiada.

Extrações delimitadas por data e acompanhamento de menções {#date-bounded-pulls-and-mention-tracking}

Limites de data transformam uma consulta aberta e cara em um trabalho escopado. A Sorsa os trata de duas formas. Dentro de /search-tweets, os operadores de busca avançada since: e until: vão direto na query string, então uma janela de campanha completa coleta como uma única passada datada. Para coletar menções de um candidato ou conta específica, /mentions expõe filtros nativos no corpo da requisição: since_date e until_date no formato YYYY-MM-DD, mais min_likes, min_replies e min_retweets para descartar ruído de baixo engajamento antes que entre no dataset. O fluxo em si é coberto no guia de acompanhar menções de uma conta.

O script abaixo coleta cada post que casa com uma consulta política dentro de uma janela de data, paginando pelos resultados com o cursor da resposta e escrevendo cada linha no seu próprio armazenamento. Troque a query por uma cadeia from: de @s oficiais e o mesmo loop vira um coletor de contas de políticos.

python
import requests

BASE = "https://api.sorsa.io/v3"
HEADERS = {"ApiKey": "YOUR_API_KEY"}

# Any political query works here: a hashtag, an issue phrase, a candidate's
# handle with from:, or a Boolean combination. since:/until: bound the
# window, so a debate night or a full campaign collects as one dated job.
query = "(#election OR ballot OR vote) since:2026-10-20 until:2026-11-05 lang:en"

def collect(query, order="latest", max_pages=50):
    rows, cursor = [], None
    for _ in range(max_pages):
        body = {"query": query, "order": order}
        if cursor:
            body["next_cursor"] = cursor
        r = requests.post(f"{BASE}/search-tweets", json=body,
                          headers=HEADERS, timeout=30)
        r.raise_for_status()
        data = r.json()
        for t in data.get("tweets", []):
            rows.append({
                "id": t["id"],
                "created_at": t["created_at"],
                "lang": t["lang"],
                "author": t["user"]["username"],
                "verified": t["user"]["verified"],
                "text": t["full_text"],
                "retweets": t["retweet_count"],
                "likes": t["likes_count"],
            })
        cursor = data.get("next_cursor")
        if not cursor:
            break
    return rows

rows = collect(query)
print(f"collected {len(rows)} posts")
# Persist rows to your own storage. That file is your political dataset.

O acompanhamento de menções em tempo real tem uma vantagem que nenhuma coleta a posteriori consegue igualar: ele captura posts antes que possam ser apagados. Políticos apagam posts a uma taxa alta, e uma exclusão é em si um achado, não apenas dado faltante. Fazer polling de contas oficiais e menções de candidatos para a frente, em uma programação, transforma o problema da exclusão de perda silenciosa de dados em um ponto de dado que você pode estudar. Entre as coletas de janela eleitoral que rodamos, as contas que mais vale acompanhar de perto tendem a ser as que mais apagam, então uma watchlist apertada de candidatos e um intervalo curto de polling costumam andar juntos. O fixo de 20 requisições por segundo da Sorsa em todo plano é folga suficiente para fazer polling de uma watchlist de candidatos por uma noite eleitoral sem uma janela de rate limit por endpoint resetando no meio da coleta.

Montando um dataset político rotulado {#building-a-labeled-political-dataset}

A coleta te dá posts brutos; o resultado de pesquisa é quase sempre um dataset rotulado. A montagem é a parte direta: rode as consultas acima, deduplique por ID de tweet e armazene os campos de que precisa, o que para a maioria do trabalho político significa o texto do post, o @ do autor, o timestamp, o idioma e os contadores de engajamento. Cada resposta de tweet já carrega o perfil completo do autor sem requisição extra, então features no nível de conta como contador de seguidores e idade da conta estão lá sem uma segunda chamada. A mecânica completa de transformar uma extração bruta em um corpus de treino é coberta no guia de montar um dataset do Twitter para machine learning.

A rotulagem é onde vivem as escolhas de método. A anotação manual por codificadores treinados é o padrão-ouro para posicionamento e sentimento, mas não escala além de alguns milhares de posts. Um atalho comum na literatura de ciência política semeia rótulos a partir de hashtags: um tweet carregando uma hashtag claramente partidária é tratado como um rótulo fraco, e esses rótulos treinam um classificador que então rotula o resto. O dataset da eleição dos EUA de 2016 acima fez exatamente isso, derivando categorias de opinião de sinais de hashtag para construir um conjunto de treino de centenas de milhares de tweets. Para sentimento e posicionamento especificamente, o passo a passo de classificar o sentimento de tweets cobre da coleta à classificação de ponta a ponta.

Para linhas de base históricas mais antigas do que uma janela de coleta ao vivo, os endpoints de busca alcançam o arquivo completo de tweets até 2006, então um dataset pode puxar contexto datado de ciclos passados em vez de começar em hoje. O guia de buscar tweets antigos no arquivo completo cobre extrações históricas com intervalo de data em profundidade.

Armadilhas que arruínam um dataset político {#pitfalls-that-wreck-a-political-dataset}

Cinco modos de falha arruínam silenciosamente datasets políticos construídos sem tê-los em mente, e eles se aplicam não importa qual rota de coleta você escolha.

Usuários do X não são o eleitorado. A base de usuários da plataforma é enviesada por idade, geografia, escolaridade e política, e não é a população que vota. Trate dados do X como uma medida de discurso online, não uma pesquisa eleitoral. Previsões que confundiram as duas têm um histórico ruim.

Bots e atividade coordenada. Tópicos políticos atraem postagem automatizada e coordenada mais do que quase qualquer outro assunto. Contadores brutos de post e sentimento bruto são inflados por isso, então um filtro de probabilidade de bot não é opcional para trabalho sério, e reportar o que você filtrou é parte do método.

Posts apagados e editados. Um dataset coletado a posteriori silenciosamente omite exclusões, e as exclusões de posts politicamente sensíveis são altas. Só a coleta para a frente captura um post antes que ele possa sumir, que é o argumento para polling em tempo real em vez de extrações históricas de uma tacada.

Viés de enquadramento de palavra-chave. A consulta é uma hipótese. Um conjunto de palavras-chave desbalanceado produz um dataset desbalanceado que nenhuma quantidade de análise posterior consegue consertar, então a consulta balanceada e documentada da seção de discurso é a decisão upstream mais importante isolada.

Reprodutibilidade. Se um dataset foi construído a partir de uma amostra opaca, outros não conseguem reconstruí-lo. Documente a sua própria coleta, a consulta exata, as datas, a tarifa e o endpoint, para que o seu trabalho seja reprodutível mesmo quando as suas fontes upstream não foram.

Um exemplo de coleta na prática

Um grupo de pesquisa universitário estudando uma eleição nacional precisou de uma janela de campanha completa de discurso público, cerca de 3 milhões de posts ao longo de seis semanas rastreando duas chapas de candidatos e um conjunto de hashtags de pauta. Na API oficial do X esse volume excede o teto mensal de 2 milhões de posts, o que empurra o projeto para um contrato Enterprise começando historicamente em torno de US$ 42.000 por mês, fora de alcance para a verba. Mover a mesma coleta para um plano fixo por requisição trouxe o orçamento de dados para abaixo de US$ 900 por mês, um corte de mais de 90 por cento, e o grupo rodou a coleta para a frente pela noite eleitoral em vez de reconstruí-la depois, então posts apagados foram capturados antes de desaparecerem. O tradeoff foi honesto e declarado logo de cara: o plano fixo é somente leitura, então qualquer fluxo que precise de escritas ficou na API oficial, mas nenhuma parte da coleta de discurso eleitoral precisa de uma escrita.

Perguntas frequentes {#faq}

Ainda dá para coletar dados políticos do Twitter para pesquisa?

Sim, mas a rota mudou. A trilha gratuita de API de pesquisa acadêmica foi descontinuada em 2023, então a maioria dos pesquisadores agora trabalha a partir de datasets públicos coletados antes ou coleta os seus próprios por uma API de terceiros que cobra por requisição. A API oficial do X ainda é autoritativa e first-party, mas volume em escala de pesquisa é precificado para empresas em vez de projetos individuais.

Como coletar tweets de uma lista de políticos?

Comece de uma lista curada de @s oficiais validada contra uma fonte autoritativa, e depois puxe os posts de cada conta por um endpoint de linha do tempo de usuário por @ ou ID numérico. Por uma API de tarifa fixa isso é barato porque o volume é pequeno, alguns milhares de posts por mês para uma legislatura inteira, e um endpoint de perfil em lote atualiza até 100 contas por requisição.

Quanto custa coletar tweets políticos?

Por uma API fixa por requisição, a coleta custa a partir de US$ 0,02 por 1.000 tweets e a partir de US$ 0,01 por 1.000 perfis, dentro de planos mensais a partir de US$ 49 por 10.000 requisições. Um dataset de contas de políticos são alguns dólares por mês. O discurso eleitoral amplo chega a milhões de posts, então escope o intervalo de data e o conjunto de palavras-chave para controlar a conta em vez de deixar uma consulta aberta rodar.

Como limitar uma coleta de tweets políticos a um intervalo de data específico?

De duas formas. Dentro de uma busca por palavra-chave, os operadores de busca avançada since: e until: vão na query string, então uma janela de campanha coleta como uma única passada datada. Para menções de uma conta específica, o endpoint de menções aceita os campos since_date e until_date no formato YYYY-MM-DD, mais filtros de engajamento mínimo, então uma noite de debate ou um único ciclo de notícias coleta de forma limpa sem puxar a linha do tempo inteira.

Dados do Twitter podem prever resultados de eleição?

Trate essa alegação com cautela. Usuários do X não são uma amostra representativa do eleitorado, enviesando por idade, geografia e política, então dados do X medem discurso online em vez de intenção de voto. É genuinamente valioso para estudar narrativas, agenda-setting e reação pública a eventos, e não confiável como uma previsão eleitoral isolada.

Como lidar com bots em dados políticos do Twitter?

Assuma que estão presentes, porque tópicos políticos atraem postagem automatizada e coordenada mais do que a maioria dos assuntos. Contadores brutos de post e de sentimento são inflados por isso, então aplique um filtro de probabilidade de bot antes da análise e reporte o que você removeu. Tratar volume bruto como opinião pública genuína é um erro comum e sério no trabalho de mídia social política.

Coletar e analisar posts públicos para pesquisa ou jornalismo é amplamente aceito, e contas políticas de interesse público são claramente públicas. Siga os termos do provedor de API, respeite exclusões e contas protegidas, e trate qualquer dado pessoal sob as regras que se aplicam a você. Discurso político público em uma plataforma pública é a categoria menos controversa de dado social para estudar.

Primeiros passos {#getting-started}

A coleta política é barata de começar e fácil de testar antes de se comprometer. Toda conta nova recebe 100 requisições grátis: única vez, sem cartão de crédito, que nunca expiram e são válidas em todos os 40 endpoints, o bastante para rodar uma extração real de contas de políticos ou uma consulta escopada de discurso de ponta a ponta. Isso equivale a até 10.000 tweets ou 20.000 perfis, muito mais do que os pequenos créditos de teste típicos de provedores de pagamento por uso.

Experimente uma consulta no navegador primeiro por o playground da API, e depois conecte a mesma chamada em um script com um único cabeçalho ApiKey. Quando uma coleta cresce além de um teste escopado, os planos fixos escalam de 10.000 a 500.000 requisições por mês a um preço fixo, então um projeto de ciclo eleitoral tem um orçamento de dados previsível desde o início.


Revisado por Keksich, fundador da Sorsa, profissional de marketing e pesquisador da API do X.

Este guia se apoia na operação prática dos endpoints de busca, de linha do tempo e de menções da Sorsa API, no preço atual de pagamento por uso da API do X verificado contra as tarifas do developer console do X em 11 de julho de 2026, e na literatura de ciência política sobre coleta de dados do Twitter, incluindo o estudo de contribuição da API para a pesquisa (arXiv 2404.07340), o dataset Election2020 (arXiv 2010.00600), o dataset de legisladores brasileiros (arXiv 1805.01589) e o estudo de opinião da eleição dos EUA de 2016 (arXiv 2002.00854). Dois modelos de coleta foram comparados: a API oficial do X e a API fixa por requisição da Sorsa.