天然変性領域の設計AIが機能制御を実現
天然変性タンパク質領域を生成する言語モデルIDiomと、解釈可能な特徴を報酬とする強化学習RL-SAEが発表された。標的特徴の活性化率は平均90%に達し、創薬や合成生物学の設計手法に影響を与える可能性がある。

研究の概要
Jason X. Liu氏らの研究チームは、天然変性領域(IDR)の設計に特化した自己回帰型タンパク質言語モデル「IDiom」と、その事後学習手法「RL-SAE」を発表した。IDRは固定した立体構造を持たないタンパク質領域であり、転写制御、シグナル伝達、細胞内局在といった基本的な細胞機能を担う。一方、構造に基づく設計手法は適用しにくく、既存のタンパク質言語モデルも全長配列で学習されているため、折りたたまれたドメインに偏った事前分布を学習しているという課題があった。
研究チームはAlphaFold Databaseから予測されたIDR 5,400万件を抽出し、データセット「IDiom-DB」を構築した。IDiomはこれを用いて学習され、天然IDRの組成、配列パターン、モチーフ、予測される無秩序性を再現する多様な配列を生成できるとされる。
RL-SAEは、スパースオートエンコーダ(SAE)が抽出した解釈可能な特徴を報酬に用いる強化学習手法である。指定した特徴群を活性化する配列を生成するほど報酬が高まる仕組みである。8種類のIDR設計タスクで、30の標的特徴のうち平均**90%を活性化した。活性化ステアリングの24%**を大きく上回る。さらに、予測される細胞内局在と転写活性も、ステアリングや教師あり微調整より改善した。異なる生物学的機能に関わる特徴を、単一配列内で組み合わせることも可能である。
ビジネスへの示唆
最大の影響を受けるのは、バイオ医薬品や合成生物学を手がける企業の研究開発部門である。従来、IDRの機能改変は変異体ライブラリの網羅的なスクリーニングに依存しており、試行錯誤のコストが大きかった。特徴単位で設計目標を指定できれば、候補配列の絞り込みが計算段階で進み、実験回数の削減につながる可能性がある。
想定される活用領域と指標は次の通りである。
- 創薬研究部門:IDRを標的とする治療戦略の候補探索。ヒット率やリード化合物到達までの期間
- 遺伝子治療・細胞治療の開発部門:転写活性を調整する制御配列の設計。発現制御の精度や候補あたりの検証コスト
- 合成生物学・産業酵素の部門:細胞内局在を制御する配列の設計。1設計サイクルあたりの所要日数
特に、特徴が「解釈可能」である点は実務上の意味が大きい。生成された配列がなぜ機能すると予測されるかを、特徴を通じて説明しやすくなる。社内の意思決定や規制当局・投資家への説明において、ブラックボックス型の生成AIよりも根拠を示しやすいと考えられる。また、複数機能の特徴を一つの配列に組み合わせられるため、多機能型の制御部品を設計する際の開発期間短縮が期待できる。
ただし、報告された成果は予測モデルに基づく評価が中心である。局在や転写活性の改善も予測値での比較であり、実際の細胞内での効果は別途の実験検証を要する。事業化に向けては、計算上の指標と実測値の乖離を測る検証体制の整備が不可欠である。
今後の展望
研究チームはコードを公開しており、企業は自社データと組み合わせた検証に着手しやすい。RL-SAEはIDRに限らず、解釈可能な特徴が設計目標となり得る他のタンパク質設計にも拡張できる可能性が示されている。抗体や酵素の設計など、特徴を軸とした制御が有効な領域への展開が焦点となる。
今後は、湿式実験による機能の裏付けと、設計候補の知的財産としての保護範囲の整理が課題となる。計算設計と実験検証を迅速に往復できる体制を築いた企業が、IDRという未開拓の設計空間で先行する公算が大きい。
関連トピック
同セクションの記事
脳解読AI、時間の近道除去で精度向上
非侵襲の脳波などから単語を復元する有力手法の精度向上は、脳データなしでもほぼ再現できることが判明した。研究チームは近道を除く簡素な改良で、単語誤り率36.6%を達成した。

順位指標でAI診断プロンプトを最適化
医療向けマルチモーダルAIのプロンプト改善で、正解率ではなくAUROCを最適化する手法Ranking-PEが提案された。不均衡な臨床データで診断の順位付け精度を最大16.2ポイント高めた。

耳と足のセンサー融合、信頼度を学習し精度維持
英国などの研究チームが、イヤホンとスマートインソールの慣性センサーから下半身の3D姿勢を推定する際、各信号の信頼度を学習して重み付けする手法を提示した。故障時の精度低下を抑え、実用化の壁を下げる成果である。
