自律型AIが陰謀論の投稿意図を文脈から判定
ヘブライ語ツイートを用いた研究チームが、社会的文脈をツールで調べながら陰謀論的投稿の意図を判定するエージェント型AIを提案した。文面のみの分類を上回り、SNS運営や広告業界の監視業務の効率化につながる可能性がある。

研究の概要
Lior Biton氏とOren Tsur氏は、SNS上の陰謀論的言説を検出するエージェント型の枠組みを論文で発表した。同じ文面でも、賛同、正当な懸念、批判、風刺、嘲笑のいずれにもなり得る。論文は、課題が陰謀論的な主張を見つけることにとどまらず、発話者の意図、すなわち発話内行為の力を推定することにあると指摘する。
提案手法は、社会的文脈を照会するツール群を備えたAIエージェントである。エージェントは投稿を読み、推論の各段階で必要になった証拠だけをツールで取得する。検証には、2018年後半から2023年前半までの4年間に公開されたヘブライ語の公開ツイートの**80〜90%**を網羅するデータセットを用いた。複数回の選挙、新型コロナ流行期、ワクチン接種キャンペーンの期間を含み、多様な社会的文脈を再現できる点が特徴である。
評価は、人手で注釈を付けた敵対的データセットで行われた。文脈を利用するワークフローは、文面のみの分類を一貫して上回った。エージェント型は、同じ文脈をあらかじめ全て与えた非エージェント型モデルを含む他の枠組みよりも有意に高い性能を示した。文脈を多く与えるだけでは不十分であり、事例ごとに必要な情報を選んで取りに行く適応的な推論が効くというのが、著者らの結論である。誤りの傾向やトークン消費の効率とのトレードオフも併せて分析されている。
ビジネスへの示唆
最も直接的な影響を受けるのは、SNS運営会社のトラスト&セーフティ部門である。従来のキーワードや文面分類では、陰謀論を批判する投稿や風刺まで誤って拾う恐れがあった。意図を踏まえた判定が可能になれば、次のようなKPIの改善が見込まれる。
- 誤検出率の低下と、人手審査に回す件数の削減
- 審査1件当たりの処理コストと、対応までの所要時間
- 正当な批判や風刺を誤って削除することによる苦情件数
広告業界では、ブランドセーフティの精度向上が期待できる。単語単位で掲載を除外する手法は、広告枠の機会損失を招きやすい。投稿の意図まで読み分けられれば、除外の粒度が細かくなり、広告在庫の稼働率とブランド毀損リスクの両立に寄与すると考えられる。
製薬やヘルスケア企業では、ワクチンや医薬品を巡る誤情報の監視が広報・リスク管理部門の業務にあたる。賛同と批判を区別できれば、対応が必要な拡散と放置してよい言及を切り分けやすくなる。金融機関や上場企業のIR部門にとっても、風説の流布や不安をあおる言説の早期把握に応用できる可能性がある。
一方、費用面の検討は欠かせない。エージェント型は必要な文脈だけを取得するため、全文脈を投入する方式よりトークン消費を抑えられる余地があるが、ツール呼び出しの回数が増えれば遅延やAPI費用も増す。導入企業は、精度の向上幅と1件当たりの推論コストを比べて評価する必要がある。
今後の展望
本研究の限界も明確である。対象はヘブライ語のツイートに限られ、日本語や他のプラットフォームで同様の効果が得られるかは示されていない。また、この手法の強みは、投稿者の過去の発言や周辺の議論といった文脈を照会できることにある。実務で同様の構成を取るには、投稿データを検索できる基盤の整備が前提になる。網羅的な投稿アーカイブを持たない事業者は、利用できる文脈の範囲が限られ、効果も小さくなり得る。
それでも、意図の解釈を社会的文脈に埋め込まれたタスクとして扱う視点は、陰謀論以外にも広がるとみられる。ハラスメント、詐欺の勧誘、ステルスマーケティングの判定など、文面だけでは判断できない領域が該当する。企業がAIによるコンテンツ審査を設計する際は、モデルの大型化に頼るのではなく、どの文脈をどの順序で参照させるかという設計が競争力を左右することになる。
関連トピック
同セクションの記事
自然な文脈で意思決定AIの判断が反転する
短く自然な文脈を付け足すだけで、正解していた意思決定AIの判断を高確信度の誤答へ誘導できるとの研究結果が公表された。AIの確率出力を業務判断の根拠とする企業に、運用の再考を促す内容である。

COSA-GS、3D空間データの圧縮と端末間の復号一致を両立
研究チームは、3次元ガウシアン・スプラッティング(3DGS)の容量を圧縮しつつ、機種が異なっても復号結果がビット単位で一致する手法COSA-GSを開発した。3D空間の配信や保存の実用化を後押しする成果である。

勾配送信から軌跡を復元、新攻撃TRACE登場
ロボットなど身体性を持つ強化学習エージェントが送る方策勾配から、非公開の観測と行動の時系列を高速に復元する攻撃手法TRACEが提案された。生データを端末に残す分散学習のプライバシー前提を揺るがす成果である。
