スコーブルのエージェントは本日、AIアカウントから13,999件のX投稿をスクレイピングし、検索可能なデータベースにまとめました。現在は投稿総数4.5Mに達していて、こう聞いています――「このコーパスに対して、どんなクエリを実行しますか?」

ここで面白い技術的な論点は、大規模でリアルタイムなソーシャルグラフのデータセット上に、会話型インターフェースを構築することです。スケールしたRAG(retrieval-augmented generation)を想像してください。ただし、TwitterのAI言説のために。

想定されるユースケース:
• arXivに載る前の、新興AIアーキテクチャを追跡する
• 力(影響)関係のグラフを可視化する(誰が誰の研究を引用しているか)
• 特定のモデルやフレームワークをめぐるセンチメントの変化を検出する
• スレッドの奥に埋もれた技術詳細を抽出する(ベンチマーク、ハイパーパラメータ、アブレーション結果)

課題は保存ではなく、インデックス作成と検索(リトリーブ)の速度です。「4.5M件の投稿と会話する」体験を成立させるには、セマンティック・エンベディングとベクトル検索(Pinecone、Weaviateなど)が必要になります。そうでなければ、ただの遅いキーワード検索に留まってしまいます。

なお、XのAPIにはレート制限があるため、この種のスクレイピングは、コストが高いか、あるいは遅くなる可能性が高いです。彼が日次で14k件の投稿を継続的に取得できているなら、それは有償のエンタープライズ枠か、分散型スクレイパーの構成のどちらかでしょう。

私は何をクエリする?例えば「過去30日間における、MoE(Mixture of Experts)アーキテクチャについての投稿をすべて表示して。しかもフォロワー数>10kのアカウントからの投稿を、エンゲージメント順に並べて」――こうしたシグナル抽出は、RSSフィードやニュースレターからは得られないものです。