Por Sorsa Editorial

Atualizado em julho de 2026: adicionada a opção inicial de 100 requisições grátis, preço reapresentado por 1.000 tweets e 1.000 perfis e reconfirmados o início do arquivo completo em março de 2006 e o teto de 3.200 tweets da timeline.

Em resumo: Os dados históricos do Twitter (X), cada tweet público desde março de 2006, são alcançáveis por cinco caminhos: a Busca Avançada gratuita do X, a busca de arquivo completo da API oficial do X, scrapers de código aberto, datasets acadêmicos ou uma API de dados de terceiros. Para acesso programático em escala, a API de dados é a rota prática, porque não existe arquivo completo público para baixar.

O caminho oficial estreitou bruscamente nos últimos três anos. O X fechou a trilha gratuita Academic Research para novos candidatos em 2023, abandonou os planos de nível fixo para novos desenvolvedores no início de 2026 e agora cobra por recurso lido, o que encarece coletas históricas grandes. A Sorsa API, uma API alternativa do Twitter (X), tem outro formato. Seu endpoint /search-tweets roda busca por palavra-chave no arquivo completo desde 2006 com os operadores padrão since: e until:, retorna o objeto de tweet completo com o perfil do autor em uma única chamada e cobra uma taxa fixa por requisição, e não por tweet lido. O preço parte de US$ 0,02 por 1.000 tweets e US$ 0,01 por 1.000 perfis nos endpoints em lote, com um limite fixo de 20 requisições por segundo em todos os planos e sem aprovação de conta de desenvolvedor. Contas novas ainda ganham 100 requisições grátis para testar o arquivo antes: concedidas uma única vez, sem cartão, e elas nunca expiram.

Nós construímos e operamos essa API e reconstruímos pipelines históricos que saíram dos endpoints oficiais com frequência, então as comparações aqui vêm de trabalho feito, não de resumo de documentação.

Dados históricos do Twitter em resumo

Cinco métodos cobrem quase todos os casos reais. Eles diferem em profundidade de arquivo, custo, esforço de configuração e em quanto dado dá para puxar de verdade.

MétodoProfundidade do arquivoCusto (2026)ConfiguraçãoMelhor para
Busca Avançada do X (web)Desde 2006GrátisNenhumaAchar à mão um tweet antigo específico
Arquivo completo da API oficial do XDesde 2006Pagamento por uso, cerca de US$ 0,005 por post lido, teto de 2 milhões/mêsAlta (conta de desenvolvedor, créditos por uso)Equipes com verba e volume baixo
Scrapers de código abertoVaria, geralmente rasaGrátis (tempo de engenharia)Média, quebra com frequênciaTrabalho pontual com orçamento apertado
Datasets acadêmicosRecortes de eventos específicosGrátisMédia (reidratação de IDs de tweets)Datasets prontos de eventos conhecidos
Sorsa API (endpoints de busca)Desde 2006Planos fixos a partir de US$ 0,02 por 1.000 tweets (US$ 49 / US$ 199 / US$ 899 por mês)Baixa (uma chave de API)Pipelines de produção, pesquisa contínua

Índice


Por que os dados históricos do Twitter ficaram mais difíceis em 2026? {#why-is-historical-twitter-data-harder-to-get-in-2026}

Os dados históricos do Twitter estão mais difíceis de obter em 2026 porque não existe arquivo completo público para baixar e as rotas programáticas baratas de que os pesquisadores dependiam fecharam. O catálogo completo de tweets públicos existe, desde março de 2006, mas você só o alcança por busca ou acesso pago, e as opções acessíveis encolheram entre 2023 e 2026.

Três viradas de plataforma remodelaram o acesso. Em fevereiro de 2023, o plano gratuito da API virou um toco somente de escrita e planos pagos o substituíram. Em meados de 2023, a trilha Academic Research que sustentava a maior parte da pesquisa publicada sobre o Twitter parou de aceitar novos candidatos. No início de 2026, o X moveu novos desenvolvedores para créditos de pagamento por uso, em que leituras custam cerca de US$ 0,005 por recurso e contas por uso têm teto de dois milhões de leituras por mês. O nível Pro legado, a US$ 5.000 por mês, ainda inclui busca de arquivo completo, mas está fechado para novas inscrições. Para o quadro completo nível a nível, veja nossa análise de preços da API do Twitter em 2026.

Também não há atalho institucional. A Biblioteca do Congresso dos EUA chegou a se comprometer a preservar cada tweet público, recebendo o catálogo completo do Twitter desde 2006, mas parou o arquivamento abrangente no fim de 2017 e hoje coleta apenas seletivamente, e essa coleção de 2006 a 2017 segue embargada ao acesso público. Nenhum órgão externo guarda uma cópia consultável do arquivo. É por isso que APIs de dados de terceiros e scrapers de código aberto absorveram a maior parte do volume deslocado.


Os cinco métodos em detalhe {#the-five-methods-in-detail}

Busca Avançada do X

A Busca Avançada do X é a rota manual e gratuita, e alcança 2006 direto na interface web. Ela aceita os operadores since: e until: e é útil para achar um tweet conhecido ou amostrar uma janela pequena. Não exporta, não retorna dados estruturados e é inviável em qualquer escala, porque os resultados são paginados e você os rola à mão. Intervalos antigos também trazem resultados ruidosos, já que o ranqueamento de relevância despriorizará conteúdo velho.

Busca de arquivo completo da API oficial do X

O endpoint oficial search/all oferece a mesma profundidade de arquivo de uma API de terceiros, mas com três atritos em 2026. Novos desenvolvedores precisam usar créditos por uso, sem custo mensal fixo. A resposta v2 retorna campos mínimos por padrão, então você precisa pedir explicitamente as métricas de engajamento, o perfil do autor e a mídia de que precisa. E o teto mensal de dois milhões de leituras no pagamento por uso é um limite rígido que orçamentos reais de pesquisa atingem rápido. A autenticação é OAuth 2.0 com bearer token, que adiciona sua própria sobrecarga antes da primeira consulta ao arquivo.

Scrapers de código aberto

Scrapers de código aberto alcançam tweets antigos por engenharia reversa dos endpoints web do X, o que os torna gratuitos e frágeis. Os nomes conhecidos, snscrape e twint, estão na prática mortos: o snscrape sem manutenção há anos e o twint arquivado. Restam algumas bibliotecas mantidas, mas com o mesmo modo de falha: um scraper funcional quebra no momento em que o X gira os tokens do frontend, sem caminho de migração. Para o estado atual dessas ferramentas, veja nossa análise de quais scrapers de Twitter ainda funcionam em 2026.

Datasets acadêmicos

Arquivos prontos distribuem IDs de tweets, e não tweets completos, para eventos específicos. Você reidrata os IDs em uma API para recuperar o conteúdo atual, o que significa que, a cada ano desde a montagem do dataset, mais tweets foram apagados, suspensos ou tornados privados e somem. Repositórios como o TweetSets, da George Washington University, e o catálogo do DocNow cobrem grandes eventos, e o banco de pesquisa da Wharton oferece uma amostra de cerca de 1% de todos os tweets consultável por SQL. A reidratação ainda exige acesso a uma API, o que volta à questão do preço; para equipes que perderam a trilha Academic Research, nosso acesso para pesquisa acadêmica cobre as mesmas consultas por janelas de data em planos gratuitos ou com desconto.

API de dados de terceiros

Uma API de dados de terceiros é a rota mais confiável para acesso programático: uma única chave, JSON estruturado e paginação sobre o arquivo completo. A Sorsa é uma dessas alternativas à API do Twitter (X). Seu endpoint /search-tweets cobre o arquivo desde março de 2006, retorna todos os campos por padrão, incluindo o perfil do autor embutido em cada tweet, e cobra uma taxa fixa por requisição, não por tweet lido. Esse modelo fixo é a principal razão de um backfill grande, que chega aos milhares de dólares na API oficial, cair para poucas centenas aqui.


O que "arquivo completo" realmente significa (e o que você não consegue) {#what-full-archive-actually-means-and-what-you-cannot-get}

"Arquivo completo" é a expressão mais desgastada desse mercado. Todo provedor a promete, e nenhum deles, incluindo a própria API oficial, consegue retornar quatro categorias de dados. São limites da plataforma, não lacunas de uma ferramenta específica, e valem igualmente para a API oficial do X, para a Sorsa API e para qualquer outro provedor.

Tweets apagados. Quando um tweet é apagado, ele sai do índice de busca do X e nenhuma API o recupera. O Wayback Machine às vezes guarda uma captura de tela de uma página de perfil muito visitada, mas isso é uma imagem, não o tweet.

Tweets de contas protegidas. Contas com posts protegidos ficam fora dos endpoints públicos de busca e timeline. A única forma de ler esses tweets é ser um seguidor aprovado e autenticado.

Fotografias históricas de perfil. Os dados de perfil refletem o estado atual. Um tweet de 2014 retornado hoje mostra o nome de usuário e a bio de 2026 do autor, não o que ele tinha em 2014. Se o @ mudou três vezes desde então, você vê o atual.

Fotografias históricas de engajamento. É esta que derruba pesquisas de sentimento e influência. Um tweet de 2018 recuperado hoje mostra o contador de curtidas atual, não o que ele tinha em 2018. Não existe endpoint de máquina do tempo em nenhum canto do ecossistema X. Se você precisa de engajamento de um momento específico, ingira os tweets na hora em que são postados e armazene as métricas você mesmo. Os padrões para isso estão na documentação de monitoramento em tempo real.


Como buscar tweets históricos com a API {#how-to-search-historical-tweets-with-the-api}

Dois endpoints cobrem o trabalho histórico, conforme você busca por palavra-chave entre usuários ou puxa a timeline completa de uma conta.

EndpointO que fazPaginaçãoTamanho da página
POST /v3/search-tweetsBusca por palavra-chave no arquivo completo com os operadores de busca do X, incluindo since:, until:, from:, min_faves:next_cursor~20 tweets
POST /v3/user-tweetsO histórico completo de posts de um usuário, do mais novo ao mais antigonext_cursor~20 tweets

A autenticação é um único cabeçalho ApiKey. Toda resposta é JSON plano com o objeto de tweet completo, incluindo o perfil do autor embutido, as entidades de mídia e as métricas de engajamento. Uma requisição mínima:

bash
curl -X POST https://api.sorsa.io/v3/search-tweets \
  -H "ApiKey: YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "query": "\"climate change\" since:2015-06-01 until:2015-12-31 lang:en min_faves:10",
    "order": "latest"
  }'

Isso retorna tweets em inglês com a frase "climate change" entre junho e dezembro de 2015 e pelo menos 10 curtidas, em ordem cronológica. O conjunto completo de operadores (from:, to:, filter:, min_retweets:, frases exatas, lógica booleana) está na nossa referência de operadores de busca do Twitter, que cobre a sintaxe necessária para estreitar qualquer consulta ao arquivo.

Buscar um intervalo de datas com paginação (Python)

O fluxo histórico mais comum é análise de eventos: puxar cada tweet em inglês sobre um tema em uma janela definida. Itere sobre next_cursor até ele voltar vazio.

python
import requests
import time

API_KEY = "YOUR_API_KEY"
URL = "https://api.sorsa.io/v3/search-tweets"

def search_historical(query, max_pages=50):
    """Search the full tweet archive with automatic pagination."""
    all_tweets = []
    next_cursor = None

    for page in range(max_pages):
        body = {"query": query, "order": "latest"}
        if next_cursor:
            body["next_cursor"] = next_cursor

        resp = requests.post(
            URL,
            headers={"ApiKey": API_KEY, "Content-Type": "application/json"},
            json=body,
        )
        resp.raise_for_status()
        data = resp.json()

        tweets = data.get("tweets", [])
        all_tweets.extend(tweets)
        print(f"Page {page + 1}: {len(tweets)} tweets (total: {len(all_tweets)})")

        next_cursor = data.get("next_cursor")
        if not next_cursor:
            break
        time.sleep(0.1)

    return all_tweets


tweets = search_historical("SpaceX since:2015-06-01 until:2015-07-01 lang:en")

Cada objeto de tweet inclui o texto completo sem truncamento de 140 caracteres, o código de idioma, o ID da conversa para reconstruir threads, os seis contadores de engajamento, as URLs das entidades de mídia e o perfil completo do autor. Você nunca precisa de uma segunda chamada para buscar o usuário. Para mais padrões em Python, incluindo retentativas e detalhes em escala, veja nosso guia da API do Twitter em Python.

Encontrar conteúdo histórico de alto engajamento (JavaScript)

Para pesquisa de conteúdo, ordene por popularidade em vez de cronologia. Combine order: "popular" com min_retweets: e -filter:nativeretweets para revelar os tweets originais que de fato repercutiram em um período, em vez de uma enxurrada de retweets.

javascript
const API_KEY = "YOUR_API_KEY";
const URL = "https://api.sorsa.io/v3/search-tweets";

async function searchHistorical(query, maxPages = 10) {
  const allTweets = [];
  let nextCursor = null;

  for (let page = 0; page < maxPages; page++) {
    const body = { query, order: "popular" };
    if (nextCursor) body.next_cursor = nextCursor;

    const resp = await fetch(URL, {
      method: "POST",
      headers: { "ApiKey": API_KEY, "Content-Type": "application/json" },
      body: JSON.stringify(body),
    });
    if (!resp.ok) throw new Error(`API error: ${resp.status}`);

    const data = await resp.json();
    const tweets = data.tweets || [];
    allTweets.push(...tweets);

    nextCursor = data.next_cursor;
    if (!nextCursor) break;
    await new Promise((r) => setTimeout(r, 100));
  }

  return allTweets;
}

// Viral Tesla tweets from 2019, originals only
searchHistorical(
  'Tesla since:2019-01-01 until:2019-12-31 min_retweets:1000 -filter:nativeretweets lang:en'
).then((t) => console.log(`Collected ${t.length} tweets`));

O sinalizador -filter:nativeretweets importa aqui. Sem ele, buscas por popularidade retornam o mesmo tweet viral dezenas de vezes em forma de retweet e enterram o original embaixo.

Exportar para CSV e Pandas

Um pipeline de produção coleta os tweets, grava em CSV e depois carrega para análise. A mesma estrutura de resposta cai direto em um DataFrame:

python
import pandas as pd

def to_dataframe(tweets):
    rows = []
    for t in tweets:
        u = t.get("user", {})
        rows.append({
            "created_at": pd.to_datetime(t["created_at"]),
            "username": u.get("username"),
            "followers": u.get("followers_count", 0),
            "text": t["full_text"],
            "likes": t.get("likes_count", 0),
            "retweets": t.get("retweet_count", 0),
            "views": t.get("view_count", 0),
            "lang": t.get("lang"),
        })
    return pd.DataFrame(rows)

df = to_dataframe(tweets)
df.to_csv("historical_tweets.csv", index=False)

Daí em diante você tem um frame limpo para séries de taxa de engajamento, pontuação de sentimento ou regressão. Para um fluxo completo de sentimento, veja nosso guia complementar de análise de sentimento no Twitter, e, para montar um corpus rotulado, o de montagem de um dataset do Twitter para machine learning.


Estratégias para coleta histórica em grande escala {#strategies-for-large-scale-historical-collection}

Alguns padrões se sustentam para qualquer backfill acima de alguns milhares de tweets.

Divida intervalos grandes em janelas mensais. Uma única consulta sobre um ano inteiro não dá controle sobre o tamanho do lote nem ponto limpo de retomada se uma requisição falhar no meio. Dividir por mês permite paralelizar, repetir e auditar com limpeza, e você quebra ainda mais em janelas semanais ou diárias para períodos voláteis como uma eleição ou um crash de mercado.

Filtre o ruído de retweets. Buscas históricas por popularidade retornam uma enxurrada de retweets. Adicione -filter:nativeretweets quando quiser conteúdo original, ou -filter:retweets para também descartar reposts no estilo antigo "RT @user".

Combine filtros de engajamento com intervalos de datas. Juntar since: e until: com min_faves: ou min_retweets: traz só os tweets que ganharam tração na sua janela, o que corta ruído e volume de requisições ao mesmo tempo. Para dicas de como aparar chamadas desnecessárias e lidar bem com a mecânica de cursor, veja otimização do uso da API.

Faça o backfill uma vez e monitore dali em diante. Contadores de engajamento são totais atuais, não fotografias de um momento, então, para pesquisa contínua, o padrão mais forte é fazer o backfill da janela histórica uma vez e ligar um monitor em tempo real daí para frente. Assim você tem a linha de base histórica e métricas precisas de momento para tudo que é novo.


Raspando a timeline completa de uma conta {#scraping-a-full-account-timeline}

Se o objetivo é o histórico completo de posts de uma conta, e não uma busca por palavra-chave entre usuários, use /user-tweets. Ele percorre a timeline do mais novo ao mais antigo até o cursor esvaziar, sem equivalente ao teto de 3.200 tweets que limita o endpoint de timeline da API oficial.

python
import requests

resp = requests.post(
    "https://api.sorsa.io/v3/user-tweets",
    headers={"ApiKey": "YOUR_API_KEY", "Content-Type": "application/json"},
    json={"username": "naval"},
)

Esse é um fluxo diferente da busca no arquivo, com um cálculo de custo próprio e uma comparação contra ferramentas visuais e scrapers. Nosso guia dedicado de como baixar todos os tweets de um usuário cobre tudo de ponta a ponta. O restante deste artigo fica na busca histórica entre usuários.


Na prática: reconstruindo o histórico fora da API oficial {#in-practice-rebuilding-history-off-the-official-api}

As equipes que mais sentem o aperto de 2026 são as que recarregam anos de dados com orçamento limitado. Um fundo quantitativo com quem trabalhamos queria um sinal de momentum de sentimento a partir de tweets de cripto, testado contra cinco anos de preços. O primeiro passo era um backfill de cada tweet de uma lista curada de cerca de 400 contas mais os tweets em inglês de 30 palavras-chave, de 2019 a 2024. Nos níveis oficiais, o teto de leitura era a restrição decisiva, e a conta projetada passava com folga dos cinco dígitos. Reconstruído sobre uma API de arquivo com taxa fixa, o mesmo backfill terminou em três dias de paginação por poucas centenas de dólares, e a estratégia roda ao vivo desde então.

Outro formato, mesma lição: um grupo acadêmico com um estudo longitudinal de discurso tinha construído toda a metodologia sobre a trilha Academic Research. Quando a trilha fechou para novos candidatos, a substituição rodou as mesmas consultas de from: e palavra-chave em um plano fixo e revalidou os resultados contra o dataset menor coletado durante o acesso original. A reconstrução custou um único mês de Starter. Nos dois casos, o bloqueio era a economia do acesso, não os dados em si, e o modelo fixo por requisição o removeu.


Perguntas frequentes {#frequently-asked-questions}

Até onde vai a busca no arquivo do Twitter (X)?

Até 21 de março de 2006, a data do primeiro tweet público. Tanto a busca de arquivo completo da API oficial do X quanto o endpoint /search-tweets da Sorsa API cobrem o arquivo público inteiro daquela data em diante. Tweets que foram apagados ou tornados privados pelos autores ficam fora de qualquer resultado, porque não existem mais no índice de busca da plataforma.

Dá para obter tweets apagados por alguma API?

Não. Quando um tweet é apagado, ele é removido do índice de busca do X e nenhuma API pública o recupera. As únicas opções são capturas externas feitas antes da exclusão, como telas do Wayback Machine ou um serviço de monitoramento que ingeriu o tweet em tempo real. Se preservar conteúdo apagável importa, ingira os tweets na hora da publicação e armazene do seu lado.

A API Academic Research do Twitter ainda é gratuita?

Não para novos candidatos. O X parou de aceitar novas inscrições na trilha Academic Research em 2023. Pesquisadores que tinham acesso antes disso o mantêm por ora, mas nenhuma vaga acadêmica nova é emitida. A maioria dos projetos acadêmicos em 2026 usa uma vaga remanescente, trabalha com datasets prontos ou migra para uma API de arquivo de terceiros com taxa fixa para rodar as mesmas consultas por janelas de data.

Quanto custa buscar no arquivo completo em 2026?

No modelo de pagamento por uso da API oficial do X, leituras saem por volta de US$ 0,005 cada, com teto mensal de dois milhões de leituras, e o nível Pro legado, que incluía busca de arquivo completo por US$ 5.000 mensais, está fechado para novas inscrições. A Sorsa API usa planos mensais fixos: US$ 49 por 10.000 requisições, US$ 199 por 100.000 e US$ 899 por 500.000, com cada requisição de busca retornando até 20 tweets.

Dá para recuperar as métricas de engajamento de um tweet em uma data passada específica?

Não. Os contadores de engajamento de qualquer tweet retornado, as curtidas, retweets, respostas, visualizações, quotes e itens salvos, refletem totais atuais, não os totais de uma data passada. A plataforma não guarda fotografias históricas de engajamento. Se você precisa de métricas de um momento específico, é preciso ingerir o tweet em tempo real e registrar os números naquele instante.

Como buscar tweets entre duas datas específicas?

Use os operadores since:YYYY-MM-DD e until:YYYY-MM-DD na consulta. O since inclui a data inicial e o until exclui a data final, então since:2020-01-01 until:2020-02-01 retorna o mês completo de janeiro de 2020. Combine com lang:, min_faves: e -filter:retweets para resultados mais limpos no arquivo.

Existe uma API acessível de dados históricos do Twitter sem cobrança por tweet?

Sim. A Sorsa API cobra uma taxa fixa por requisição, e não por tweet lido, então uma busca que retorna 20 tweets custa o mesmo sejam eles de 2024 ou de 2009. A US$ 199 por mês por 100.000 requisições no plano Pro, isso dá cerca de dois milhões de tweets, então um backfill histórico grande custa alguns dólares em vez dos milhares que um modelo por recurso cobra.


Primeiros passos {#getting-started}

Para testar a busca no arquivo antes de escrever código, o Sorsa API Playground dispara requisições contra /search-tweets e /user-tweets do navegador sem exigir chave, e o construtor visual de consultas deixa você montar os operadores à mão. Quando estiver pronto para integrar, crie uma chave no painel e siga o início rápido: sem aprovação, sem OAuth, uma única chave de API e um limite fixo de 20 requisições por segundo em todos os planos. Toda conta nova começa com 100 requisições grátis, concedidas uma única vez e sem cartão, que nunca expiram e cobrem todos os 40 endpoints, o suficiente para validar uma consulta por janela de datas antes de decidir. O plano Starter, a US$ 49 por 10.000 requisições, cobre a maioria dos backfills pontuais, incluindo análise de eventos ou o estudo de um único tema em uma janela de um ano.

Revisado por Keksich, fundador da Sorsa, profissional de marketing e pesquisador da API do X.

Este guia se apoia no nosso próprio trabalho operando uma API alternativa do Twitter (X) desde 2022 e reconstruindo pipelines históricos que saíram dos endpoints oficiais. Verificamos o início do arquivo completo em março de 2006 e os limites da coleta abrangente contra o relato da Biblioteca do Congresso sobre seu arquivo do Twitter, reconferimos as taxas de pagamento por uso da API oficial do X nos preços de desenvolvedor publicados pelo X e tiramos comportamento de endpoints, operadores e custos por requisição da documentação da Sorsa API e da nossa análise de preços de 2026. Cinco métodos de acesso foram comparados para este texto. Mais sobre a equipe está na nossa página sobre a Sorsa. Última verificação: 4 de julho de 2026.