2026年7月11日更新:2026年4月20日の料金変更後の現行の X API 従量課金レートと月200万投稿の上限を確認し、それに対して収集コストのシナリオを刷新しました。
要点: Twitter/X の政治データは、公式アカウントの投稿、公開の選挙の言説、エンゲージメントのシグナル、そして導出されたスコアに分かれます。無料の学術 API のトラックが2023年に閉じて以来、ほとんどのプロジェクトはサードパーティ API を通じて自分のデータを収集します。キーワード、ハッシュタグ、またはハンドルの検索、日付で区切った取得、そしてメンション追跡で、必要に応じて範囲を絞りリハイドレートします。
X(旧Twitter)は、政治家が発表し、ジャーナリストがニュースを速報し、有権者が公然と議論する場所であり続けており、それがそれをどこにおいても最も豊かな政治データのソースの1つにします。難しい部分は今やアクセスです。10年分の政治学の論文を動かした無料の学術研究のトラックはなくなり、公式 API は計測されエンタープライズ向けに値付けされ、研究者が頼った公開データセットは、もはやきれいにリハイドレートしない凍結されたスナップショットです。
公開データのための代替の Twitter/X API である Sorsa API は、この種の読み取りの多い収集のために作られています。OAuth のハンドシェイクも審査待ちの行列もなく、ヘッダーの中の1つの API キーを通じて、1,000ツイートあたり$0.02、1,000プロフィールあたり$0.01からの実効レートで、公開の投稿、プロフィール、検索結果、そしてエンゲージメントを読みます。/search-tweets を通じてキーワード、ハッシュタグ、またはハンドルで検索し、日付フィルターで収集を選挙の窓に区切り、/mentions を通じて候補者のメンションを追跡します。すべて、データセットが数千の投稿でも数百万でも予測しやすいままのフラットなリクエスト単位の課金でです。
目次
- X で何が政治データとして数えられるか
- 2026年に政治的な X データはどこから来るか
- 政治的な Twitter データの収集はいくらかかるか
- 政治家と公式アカウントからの投稿の収集
- 選挙と争点の言説の収集
- 日付で区切った取得とメンション追跡
- ラベル付きの政治データセットの構築
- 政治データセットを壊す落とし穴
- よくある質問
- 始め方
X で何が政治データとして数えられるか {#what-counts-as-political-data-on-x}
X 上の政治データは、たまたまプラットフォームを共有するいくつかの異なるデータセットをカバーするゆるいラベルで、収集の計画はそれがその後どれであるかを名指ししなければなりません。それらを混同することが最初の間違いです。それぞれが異なるクエリと異なる量の予算を必要とするからです。
公式アカウントの出力 は、政治家、政党、政府機関、候補者の投稿です。公式のアクターが何をいつ言ったかの、きれいな、高シグナルの記録です。これは小さなデータセットで、しばしば議会全体で月に数千の投稿です。
争点と選挙の言説 は、候補者、法案、ハッシュタグ、または選挙について公衆が投稿するすべてです。はるかに大きく、はるかにノイズが多く、全国投票の周りで数百万の投稿になり、ほとんどの感情と世論の作業の基礎です。
エンゲージメントと拡散 は、誰が何を、どれだけ速く、どれだけ遠くに増幅したかです。リポスト、返信、引用投稿、そしてそれらの間のタイミングです。これが、研究者が影響力と物語の広がりを研究する方法です。
導出されたシグナル は、生の投稿の上に計算された感情、スタンス、トピック、そしてボットらしさのスコアです。これらは渡されるのではなく自分の分析によって生成され、通常は実際の研究の出力です。
最初と2番目のカテゴリの間の量のギャップが、計画の問題のすべてです。政治家アカウントのデータセットは小さく安いです。広い選挙の言説の収集こそ、コストとレート制限が重要になり始めるところです。
2026年に政治的な X データはどこから来るか {#where-political-x-data-comes-from-in-2026}
政治的な X データへの3つの本当の経路があり、真剣なプロジェクトは通常それらを組み合わせます。公式 X API、凍結された公開の研究データセット、そしてサードパーティ API を通じて自分でデータを収集することです。
公式 X API は、X 自身のファーストパーティのデータなので、権威があり完全です。それは2023年にほとんどの研究予算にとって現実的な答えでなくなりました。X は何年も専用の学術研究のトラックを、完全アーカイブ検索とともに無料で気前よく運用し、公開された政治学の文献の大きな割合がその上に構築されました。そのトラックは解体され、アクセスが切られる前に2006年以来 Twitter データの上に構築された27,000を超える論文を数えた API の研究貢献の2024年の研究 に文書化されています。新規開発者は今、他の全員と同じ計測された従量課金の API を得て、研究規模の量は、歴史的に月約$42,000から始まった Enterprise 契約になります。
公開の研究データセットが2番目の経路です。大きく、査読済みで、すでに収集されたものです。研究者は、6億を超えるツイートの Election2020 データセット のような、主要な選挙の周りの数百万投稿の収集を、多くの国にまたがる議員のアカウントのキュレーションされたデータベースとともに公開しました。2つの制限が適用されます。それらは固定の窓に凍結されているため、収集が終わった後に起きたことについては何も答えられず、ほとんどはプラットフォームの規約に準拠するために、完全な投稿ではなくツイート ID として配布されます。ID のリストを得て、それぞれを API を通じて取得することでリハイドレートしなければなりません。リハイドレートはかつて無料で完全でした。今は有料の API を通じて動き、データセットが構築されて以来削除されたすべての投稿は空で返ってきます。政治的に敏感な投稿は高い率で削除されるため、数年前の選挙データセットは元のサイズの何分の1かにリハイドレートされ、決して取り下げられなかったものに向けて歪みます。
3番目の経路は、自分でデータを収集することです。従量課金で、現在の、そして自分の正確な質問に合わせて形づくられ、収集を構築することと引き換えにです。よくある組み合わせは、歴史的なベースラインとして公開データセットを、そのデータセットの窓が終わった後のすべてに自分の前向きの収集を、そしてファーストパーティの完全性が譲れないところだけに標的を絞った公式 API の取得を使います。特に学術グループには、Sorsa が標準の読み取り専用のエンドポイントの上に 割引アクセス付きの学術研究プログラム を運用しています。
政治的な Twitter データの収集はいくらかかるか {#how-much-does-collecting-political-twitter-data-cost}
フラットなリクエスト単位の API を通じて政治的なツイートを収集するのは、1,000ツイートあたり$0.02、1,000プロフィールあたり$0.01から、完全な月次プランは$49からです。公式 X API は代わりに取得したリソース単位で課金するため、コストはデータセットのサイズに直接スケールします。広い選挙の言説の収集はすぐに4桁ドルになるか、X の月200万投稿の上限に当たり、それを超えると Enterprise 契約だけが適用されます。
表は、3つのよくある政治収集のジョブを各モデルに対応付けます。Sorsa の数字はプランレベルで、公式 X API の数字は 完全な2026年版 X API 料金の内訳 からの現行のリソース単位のレートを使います。
| 収集ジョブ | 公式 X API | Sorsa フラットプラン |
|---|---|---|
| 議会のウォッチリスト(約500アカウント、プロフィールに最近の投稿) | 投稿各$0.005、プロフィール各$0.010;数千投稿の月次更新は数十ドルになる | Starter に収まる、10,000リクエストで$49/月 |
| ディベート当夜の言説(ハッシュタグ上の約200,000投稿) | 各$0.005で約200,000投稿は一晩で約$1,000、200万の月次上限にカウント | Pro に収まる、100,000リクエストで$199/月 |
| フルキャンペーンの言説(月200万投稿以上) | 200万投稿読み取りの上限を超える;Enterprise 契約が必要、歴史的に約$42,000/月から | Enterprise、500,000リクエストで$899/月 |
1つの Sorsa リクエストは、バッチエンドポイントで最大100ツイート、または最大200プロフィールを返すため、プランのリクエスト数は、投稿単位の数が示唆するよりはるかに伸びます。それが、読み取りの多い政治収集でフラットなモデルが勝つところです。同じワークロードで公式 API より最大50分の1のコストで、上限に向かって数えるリソース単位のメーターはありません。
エンドポイントによって2つの1,000あたりの数字が適用され、両方を見る価値があります。バッチエンドポイント(/tweet-info-bulk と /info-batch、リクエストあたり最大100項目)は、実効コストを1,000ツイートあたり$0.02、1,000プロフィールあたり$0.01からにします。検索とタイムラインのエンドポイント(/search-tweets、/user-tweets、/mentions)はリクエストあたり約20投稿を返し、それは Proプランで1,000ツイートあたりおよそ$0.10になります。言説の収集は検索エンドポイントを使うため、検索の数字に対して予算を組みます。プロフィール照会と既知の ID の取得はバッチエンドポイントを使い、はるかに低く着地します。完全な詳細は フラットなリクエスト単位の料金ページ にあります。
政治家と公式アカウントからの投稿の収集 {#collecting-posts-from-politicians-and-official-accounts}
自分で構築する最もきれいな政治データセットは、公式アカウントの出力です。ハンドルのリスト、議会の院、内閣、または候補者の名簿から始め、各アカウントの投稿を /user-tweets を通じてユーザー名、ユーザーリンク、または数値のユーザー ID で取得します。量は小さく着実で、言説の収集がかかるものをはるかに下回り、それらのアクターが投稿したものの完全なファーストパーティの記録を与えます。
2つの慣行がこのデータセットを信頼できるものにします。最初は、バッジのフィルターではなくキュレーションされたウォッチリストです。2022年以降、青い認証バッジは、アイデンティティのチェックではなく有料のサブスクリプションになったため、プロフィール上の verified フラグは、もはやアカウントが本物の公式のものであることを確認しません。頼れる方法は、議会のオープンデータのサイトや学術の議員データベースのような権威ある情報源からハンドルのリストを構築し、それを一度検証することです。実際のデータセットはこうやって構築されます。692人のブラジル連邦下院議員からの110万投稿 の収集は、下院のオープンデータのウェブサイトに対して取得され手動で検証されたアカウントから始まり、それから各議員の選挙結果でラベル付けされました。
2番目は安定した識別子です。ユーザー名は変わり、数値のユーザー ID は変わりません。各ハンドルを /username-to-id/{handle} を通じて一度その ID に解決して ID を保存すれば、ウォッチリストは政治家がキャンペーンの途中でアカウントをブランド変更しても生き延びます。ウォッチリスト全体のプロフィールデータを一発で更新するには、/info-batch がリクエストあたり最大100件のハンドルまたは ID を受け付け完全なプロフィールを返し、それがフォロワー数とプロフィール文の変更を議会全体でひと握りのリクエストで最新に保ちます。単一のアカウントの全バックカタログが必要なとき、同じタイムラインエンドポイントがそれをページネーションします。ユーザーの完全な投稿履歴を取得する ガイドで扱うアプローチです。
選挙と争点の言説の収集 {#collecting-election-and-issue-discourse}
公共の言説、つまり公式のアクターだけでなく全員が投稿するものは、より大きく難しい収集です。それはキーワードの問題です。候補者の名前、ハッシュタグ、争点のフレーズからクエリを定義し、言語を固定し、結果をページネーションします。Sorsa の /search-tweets エンドポイントは完全な Twitter の高度な検索の構文を受け付けるため、from:、引用符の中の完全一致のフレーズ、ハッシュタグ、そしてブールの OR がすべて1つのクエリの中で動きます。仕組みは API を通じてツイートを検索する ガイドで詳しく扱っています。
クエリの枠組みそれ自体が、1つの投稿が収集される前にデータセットを形づくる決定です。選ぶハッシュタグとフレーズが、誰の会話を捉えるかを決めます。片側のハッシュタグだけを検索すれば、片側を測ったことになります。修正は、完全な名簿をカバーするバランスの取れた、文書化されたキーワードのセットです。よく引用される一例は、2つの主要な候補者にまたがる対称的なキーワードフィルターを使って 2016年の米国選挙の周りの220万ツイート を収集し、それからハッシュタグ自体をラベル付きの訓練セットを構築する種として使いました。ライブのキャンペーン中にキーワードのセットを最新に保つには、/trends を通じて WOEID で地域のトレンドトピックを取得し、政治的に関連するものをクエリに折り込みます。実際の国民投票の研究が、出現するハッシュタグが起きるとそれを捕まえるために使った技術です。
まずコードを書かずにこれらのクエリを構築してテストするには、ビジュアルな検索クエリビルダー がブラウザで高度な検索の文字列を組み立て、高度な検索コマンドのリファレンス がエンドポイントが受け付けるすべてのコマンドを列挙します。範囲は枠組みと同じくらい重要です。きつい窓、単一のディベートの夜や1つの法案のニュースサイクルにわたる焦点を絞ったクエリは、しばしば広大なものより良いデータセットで、収集が安く、より鋭い質問に向けられています。
日付で区切った取得とメンション追跡 {#date-bounded-pulls-and-mention-tracking}
日付の境界は、開いた高価なクエリを範囲を絞ったジョブに変えます。Sorsa はそれらを2つの方法で扱います。/search-tweets の中では、高度な検索の since: と until: のコマンドがクエリ文字列にまっすぐ入るため、フルキャンペーンの窓が1つの日付付きのパスとして収集します。特定の候補者やアカウントのメンションの収集には、/mentions がリクエストボディの中にネイティブのフィルターを公開します。YYYY-MM-DD 形式の since_date と until_date、加えて低エンゲージメントのノイズがデータセットに入る前に落とす min_likes、min_replies、min_retweets です。ワークフロー自体は アカウントのメンションを追跡する ガイドで扱っています。
以下のスクリプトは、日付の窓の中で政治的なクエリに一致するすべての投稿を、レスポンスのカーソルで結果をページネーションし、各行を自分のストレージに書きながら収集します。query を公式ハンドルの from: のチェーンに入れ替えれば、同じループが政治家アカウントの収集器になります。
import requests
BASE = "https://api.sorsa.io/v3"
HEADERS = {"ApiKey": "YOUR_API_KEY"}
# Any political query works here: a hashtag, an issue phrase, a candidate's
# handle with from:, or a Boolean combination. since:/until: bound the
# window, so a debate night or a full campaign collects as one dated job.
query = "(#election OR ballot OR vote) since:2026-10-20 until:2026-11-05 lang:en"
def collect(query, order="latest", max_pages=50):
rows, cursor = [], None
for _ in range(max_pages):
body = {"query": query, "order": order}
if cursor:
body["next_cursor"] = cursor
r = requests.post(f"{BASE}/search-tweets", json=body,
headers=HEADERS, timeout=30)
r.raise_for_status()
data = r.json()
for t in data.get("tweets", []):
rows.append({
"id": t["id"],
"created_at": t["created_at"],
"lang": t["lang"],
"author": t["user"]["username"],
"verified": t["user"]["verified"],
"text": t["full_text"],
"retweets": t["retweet_count"],
"likes": t["likes_count"],
})
cursor = data.get("next_cursor")
if not cursor:
break
return rows
rows = collect(query)
print(f"collected {len(rows)} posts")
# Persist rows to your own storage. That file is your political dataset.
リアルタイムのメンション追跡には、事後の収集が決して並べられない1つの利点があります。投稿が削除される前にそれらを捕まえることです。政治家は高い率で投稿を削除し、削除はそれ自体が、単に欠けているデータではなく1つの発見です。公式アカウントと候補者のメンションを前向きに、スケジュールでポーリングすることが、削除の問題を静かなデータの損失から、研究できるデータポイントに変えます。これまで実行した選挙の窓の収集全般で、最も緊密にポーリングする価値のあるアカウントは、最も削除するものである傾向があるため、きつい候補者のウォッチリストと短いポーリング間隔は通常一緒に行きます。Sorsa のすべてのプランでの一律の毎秒20リクエストは、収集の途中でエンドポイント別のレートの窓がリセットすることなく、選挙の夜を通して候補者のウォッチリストをポーリングするのに十分な余裕です。
ラベル付きの政治データセットの構築 {#building-a-labeled-political-dataset}
収集は生の投稿を与えます。研究の出力はほぼつねにラベル付きのデータセットです。組み立てはまっすぐな部分です。上のクエリを実行し、ツイート ID で重複排除し、必要なフィールドを保存します。ほとんどの政治的な作業には、それは投稿テキスト、作者のハンドル、タイムスタンプ、言語、そしてエンゲージメントの数を意味します。各ツイートのレスポンスがすでに完全な作者プロフィールを追加のリクエストなしで運ぶため、フォロワー数やアカウントの年齢のようなアカウントレベルの特徴は、2回目の呼び出しなしにそこにあります。生の取得を訓練コーパスに変える完全な仕組みは、機械学習のための Twitter データセットを組み立てる ガイドで扱っています。
ラベル付けこそ、手法の選択が住むところです。訓練されたコーダーによる手動のアノテーションは、スタンスと感情のゴールドスタンダードですが、数千の投稿を超えてスケールしません。政治学の文献でよくあるショートカットは、ハッシュタグからラベルを種付けします。明確に党派的なハッシュタグを運ぶツイートは弱いラベルとして扱われ、それらのラベルが分類器を訓練し、それが残りをラベル付けします。上の2016年の米国選挙のデータセットはまさにこれをして、ハッシュタグのシグナルから意見のカテゴリを導出し、数十万のツイートの訓練セットを構築しました。感情とスタンスに特に、ツイートの感情を分類する 案内が、収集から分類まで端から端まで扱います。
ライブの収集の窓より古い歴史的なベースラインには、検索エンドポイントが2006年まで遡る完全なツイートアーカイブに到達するため、データセットは今日から始めるのではなく過去のサイクルから日付付きの文脈を取得できます。完全なアーカイブにまたがって古いツイートを検索する ガイドが、日付範囲の歴史的な取得を詳しく扱っています。
政治データセットを壊す落とし穴 {#pitfalls-that-wreck-a-political-dataset}
5つの故障モードが、それらを念頭に置かずに構築された政治データセットを静かに台無しにし、どの収集の経路を選んでも適用されます。
X のユーザーは有権者ではありません。 プラットフォームのユーザーベースは年齢、地理、教育、政治で偏っており、投票する人口ではありません。X データを、世論調査ではなくオンラインの言説の尺度として扱います。2つを混同した予測は、貧しい実績を持ちます。
ボットと協調した活動。 政治的なトピックは、ほぼ他のどの主題よりも自動化された協調的な投稿を引き寄せます。生の投稿数と生の感情はそれによって水増しされるため、ボットらしさのフィルターは真剣な作業には任意ではなく、何をフィルターしたかを報告することが手法の一部です。
削除され編集された投稿。 事後に収集されたデータセットは削除を静かに省き、政治的に敏感な投稿の削除は高いです。前向きの収集だけが、投稿が消える前にそれを捕まえ、それが一発限りの歴史的な取得よりリアルタイムのポーリングを支持する論拠です。
キーワードの枠組みのバイアス。 クエリは仮説です。バランスの取れていないキーワードのセットは、後のどんな分析の量も修正できないバランスの取れていないデータセットを生むため、言説のセクションからのバランスの取れた、文書化されたクエリが、単一の最も重要な上流の決定です。
再現性。 データセットが不透明なサンプルから構築されたなら、他の人はそれを再構築できません。自分の収集、正確なクエリ、日付、レート、そしてエンドポイントを文書化して、上流の情報源がそうでなかったときでも、自分の作業が再現可能であるようにします。
実践からの収集の例 {#a-collection-example-from-practice}
全国選挙を研究する大学の研究グループが、公共の言説のフルキャンペーンの窓、つまり2つの候補者名簿と一連の争点のハッシュタグを追跡する6週間にわたるおよそ300万投稿を必要としました。公式 X API では、その量は月200万投稿の上限を超え、それがプロジェクトを、歴史的に月約$42,000から始まる Enterprise 契約に押しやり、助成金には手が届きませんでした。同じ収集をフラットなリクエスト単位のプランに移すことで、データ予算は月額$900未満、90%を超える削減となり、グループは収集を後で再構築するのではなく選挙の夜を通して前向きに実行したため、削除された投稿は消える前に捕まえられました。トレードオフは正直で前もって述べられました。フラットなプランは読み取り専用なので、書き込みを必要とするどんなワークフローも公式 API に留まりましたが、選挙の言説の収集のどの部分も書き込みを必要としません。
よくある質問 {#faq}
研究のためにまだ Twitter から政治データを収集できる?
はい、ただし経路が変わりました。無料の学術研究の API のトラックは2023年に廃止されたため、ほとんどの研究者は今、以前に収集された公開データセットから作業するか、リクエスト単位で課金するサードパーティ API を通じて自分のものを収集します。公式 X API はまだ権威がありファーストパーティですが、研究規模の量は、個々のプロジェクトではなくエンタープライズ向けに値付けされています。
政治家のリストからツイートをどう収集する?
権威ある情報源に対して検証された公式ハンドルのキュレーションされたリストから始め、それから各アカウントの投稿をユーザータイムラインのエンドポイントを通じてハンドルまたは数値の ID で取得します。フラットレートの API を通じて、これは量が小さいため安いです。議会全体で月に数千の投稿で、バッチプロフィールのエンドポイントがリクエストあたり最大100アカウントを更新します。
政治的なツイートを収集するのにいくらかかる?
フラットなリクエスト単位の API を通じて、収集は1,000ツイートあたり$0.02、1,000プロフィールあたり$0.01から、10,000リクエストで$49からの月次プランの中でかかります。政治家アカウントのデータセットは月に数ドルです。広い選挙の言説は数百万の投稿になるため、開いたクエリを走らせるのではなく、請求を制御するために日付範囲とキーワードのセットの範囲を絞ります。
政治的なツイートの収集を特定の日付範囲にどう制限する?
2つの方法です。キーワード検索の中では、高度な検索のコマンド since: と until: がクエリ文字列に入るため、キャンペーンの窓が1つの日付付きのパスとして収集します。特定のアカウントのメンションには、メンションエンドポイントが YYYY-MM-DD 形式の since_date と until_date のフィールド、加えて最小エンゲージメントのフィルターを取るため、ディベートの夜や単一のニュースサイクルが、タイムライン全体を取得せずにきれいに収集します。
Twitter データは選挙結果を予測できる?
その主張は慎重に扱ってください。X のユーザーは有権者の代表的なサンプルではなく、年齢、地理、政治で偏っているため、X データは投票意図ではなくオンラインの言説を測ります。物語、アジェンダ設定、そしてイベントへの公衆の反応を研究するには本当に価値があり、単体の選挙予測としては信頼できません。
政治的な Twitter データのボットをどう扱う?
存在すると仮定してください。政治的なトピックは、ほとんどの主題より自動化された協調的な投稿を引き寄せるからです。生の投稿と感情の数はそれによって水増しされるため、分析の前にボットらしさのフィルターを適用し、何を取り除いたかを報告します。生の量を本物の世論として扱うことは、政治的なソーシャルメディアの作業でよくある深刻な誤りです。
政治的なツイートを収集するのは合法?
研究やジャーナリズムのために公開の投稿を収集し分析することは広く受け入れられており、公共の利益の政治的なアカウントはまさに公的です。API プロバイダーの規約に従い、削除と保護されたアカウントを尊重し、自分に適用されるルールの下で個人データを扱います。公開のプラットフォーム上の公的な政治的発言は、研究する最も論争の少ないカテゴリのソーシャルデータです。
始め方 {#getting-started}
政治的な収集は始めるのが安く、コミットする前にテストするのが簡単です。すべての新規アカウントは100回分の無料リクエストを得ます。1回限り、クレジットカード不要・有効期限なしで、40個のエンドポイントすべてで有効で、実際の政治家アカウントの取得や範囲を絞った言説のクエリを端から端まで実行するのに十分です。それは最大10,000ツイートまたは20,000プロフィールに等しく、従量課金のプロバイダーに典型的な小さな試用クレジットをはるかに超えます。
まず API playground を通じてブラウザでクエリを試し、それから同じ呼び出しを単一の ApiKey ヘッダーでスクリプトに組み込みます。収集が範囲を絞ったテストを超えて成長したら、フラットなプランが月10,000から500,000リクエストに固定の価格でスケールするため、選挙サイクルのプロジェクトは最初から予測しやすいデータ予算を持ちます。
監修:Keksich(Sorsa創業者、マーケター兼X APIリサーチャー)
本ガイドは、Sorsa API の検索、タイムライン、メンションのエンドポイントの実地の運用、2026年7月11日時点で X の開発者コンソールのレートに対して確認した現行の X API 従量課金の料金、そして Twitter データ収集に関する政治学の文献に基づいています。API の研究貢献の研究(arXiv 2404.07340)、Election2020 データセット(arXiv 2010.00600)、ブラジルの議員のデータセット(arXiv 1805.01589)、そして2016年の米国選挙の意見の研究(arXiv 2002.00854)を含みます。2つの収集モデルを比較しました。公式 X API と Sorsa のフラットなリクエスト単位の API です。