Virtual Cellは何を予測できたのか――標的遺伝子と評価指標の落とし穴

Daiki Kumakura · 2026-10-06 · Blog · 1.0

標的遺伝子の直接効果と摂動応答の予測を分け、最新研究と合成例からVirtual Cellの評価指標を点検する。

Summary in English

What did the Virtual Cell predict? Target genes and evaluation shortcuts

A Japanese review of perturbation forecasting, target-gene masking and recent benchmarks, with a reproducible synthetic example distinguishing evaluation shortcuts from downstream prediction. The example does not establish real-data performance or the superiority of pairwise masking.

The full article is in Japanese.

On this page

文献確認日:2026年10月6日。文献の報告と、本記事で作成した合成データの計算例を区別する。

遺伝子を抑えた後の細胞を予測するモデルが、その遺伝子の発現低下を当てた。それだけで、細胞の応答を理解したと言えるだろうか。

Eric Kernfeldの2025年12月のブログ記事は、この素朴な疑問から、細胞への介入後の応答を計算上で予測するVirtual Cellの評価を問い直している。本記事はその問題提起を出発点に、最近の摂動予測研究と評価仕様を読み、どこまで結論を支持できるかを整理する。検討の中心は、CRISPRiの転写応答と、平均応答を候補へ照合する評価である。Virtual Cell全体の評価ではない。

先に私の判断を書く。標的遺伝子の直接的な変化を当てる能力と、他の遺伝子の応答を当てる能力は分けて評価したい。さらに、候補と照合する指標では、正解の標的の直接効果だけを除き、不正解候補の標的の直接効果を残す非対称な扱いを避けたい。 ただし、これを理由にsingle-cell foundation model全体の有用性を否定することはできない。

1. 背景:細胞の表現を学ぶことと、介入後を予測すること

Perturb-seqは、遺伝子への介入とsingle-cell RNA-seqを組み合わせ、介入後の転写状態を測定する。未実験の標的や細胞背景へ予測を広げられれば、次に行う実験の選択に使える。その期待が、Virtual Cellという言葉の魅力の一つになっている。

ここで、single-cell foundation model(scFM)は、大量の細胞データで事前学習し、その表現を複数の解析に利用するモデルを指す。Geneformerは転写データからの転移学習、scFoundationは大規模な事前学習と複数の下流タスクを報告した。しかし、細胞状態の表現が良いことと、未知の介入後の発現量を正しく予測できることは、別の検証問題である。Geneformer、scFoundation

評価の前に、何を未知にするかを決める必要がある。

予測したい状況 テストで未知にするもの その結果だけでは示せないこと
同じ細胞背景で、新しい標的を試す 摂動標的 新しい細胞型への移植可能性
既知の摂動を、別の細胞背景で試す 細胞型・細胞株・ドナーなど 未知の標的への予測能力
単独摂動から、組合せを予測する 摂動の組合せ 未知の単独摂動の予測能力
他の実験で測った応答を新しい実験へ移す データセット・実験条件 摂動応答を一切観測しない予測能力

これは本記事での整理であり、論文ごとの分割方法はさらに確認する必要がある。Weiらの広範なベンチマークも、未知の摂動と未知の細胞背景を区別している。論文は2025年12月にオンライン公開され、2026年の巻に掲載された。Wei et al.

細胞をランダムに分け、同じ標的・同じ実験の細胞が学習と評価の両側にある設定を、未知標的への汎化と呼ぶことはできない。また、事前学習に評価対象の実験が入っていないかも、可能な範囲で監査したい。これは標的遺伝子のマスクとは別の問題である。

2. 標的の発現低下は、どの能力の証拠か

CRISPRiでは、標的遺伝子の転写を抑えるように実験を設計する。その直接効果が強いと、発現変化の大きい遺伝子に重みを置く評価は、標的を下げるだけの予測を高く評価しうる。

Csendesらは、scGPTとscFoundationを単純な基準モデルと比較し、Top-20 DE(差次的発現の検定で選ばれた上位20遺伝子)の評価からCRISPR標的を除く解析も実施した。標的を含むTop-20の評価ではscGPTがTrain Mean(学習摂動の平均応答を、すべてのテスト摂動へ共通に使う予測)を上回る一方、その評価には標的自身の変化が混ざる。ここで問われるのは、得点の改善がどの遺伝子の予測に由来するかである。Csendes et al.

Wongらも、深層学習との比較に適切な単純baselineを置く重要性と、既存ベンチマーク用データの修正を報告した。本記事では、その原著の要旨で確認できる範囲を参照する。Wong et al.

ただし、標的の応答を「生物学ではない」と全面的に切り捨てるのも強すぎる。ノックダウン効率、残存発現、ガイド差が予測目的なら、それ自体が研究対象になる。私が分離したいのは、介入の効き具合を予測する課題と、その条件下で起こる応答を予測する課題である。

CRISPR knockoutについても、機能喪失とmRNAの消失は同じではない。mRNAが残る場合に、その測定値を一律にゼロとすることは、目的に応じたモデル上の仮定であり、観測事実ではない。PEREGGRNの論文も、knockoutではmRNAが残ったり増加したりする可能性を記載している。Kernfeld et al.

3. 「leakage」で一括りにしない

議論を明確にするため、介入ラベルを \(I\)、介入後の標的発現を \(Z\)、それ以外の発現を \(X\)、細胞背景を \(c\) とする。

介入ラベルから応答全体を予測するなら、対象は例えば

\[ p(Z,X\mid I,c) \]

である。一方、標的をどの程度抑えたかが既知で、その先の応答を予測したいなら、

\[ p(X\mid Z,I,c) \]

を評価する。後者は前者より多くの情報を条件として与えている。

PEREGGRNでは、closest-controlを使う設定で、標的の値を介入後の発現量へ置き換えて予測する。これは、標的の変化を条件として扱う設定の例である。ただし、未知の実験を事前に予測する用途で、その介入後の実測値が入手できるとは限らない。PEREGGRNの方法

問題 何が起きるか 確認すること
標的の直接効果が得点を支配する 下流応答を外しても高得点になる 標的込み・除外後を併記する
入力の入手条件が用途と合わない 予測時には未知の実測値を与える 何を事前に利用可能としたかを明示する
学習・評価データの混入 同じ実験などが両側に入る 分割単位と事前学習データを監査する
正解と競合候補の標的の扱いが非対称 不正解候補の標的の直接効果だけが残る どの標的を距離計算から除くかを点検する

標的名をモデルに与えること自体は、通常の摂動予測では情報漏洩ではない。 何を介入したかは正当な入力である。「target-gene leakage」という表現を使う場合も、入力の漏洩なのか、評価の近道なのかを説明したい。

4. 自分の標的だけを除くと、照合の近道ができる

Retrieval型の評価は、予測を観測候補へ照合して正解を順位付けする評価である。摂動 \(i\) の予測 \(\hat x_i\) を、正解 \(x_i\) と他の摂動の観測 \(x_j\) に照合し、正解の方が近ければ高得点になる。

問題のあるrow-mask(予測ごとに、その標的だけを除く方法)では、query側の標的 \(i\) だけを、すべての比較から除く。同じqueryの中では座標は共通だが、正解の標的と競合候補の標的を対等に扱っていない。

\[ d_{-i}(\hat x_i,x_i),\qquad d_{-i}(\hat x_i,x_j). \]

候補 \(j\) には、その標的 \(j\) の強い低下が残る。予測側で、他の標的を逆方向に大きくしておけば、不正解候補との距離を押し上げられる。

Arcの公開仕様には、この近道を使った予測の pds_cosine が、3つのvalidation contextで0.798、0.757、0.761となったと記載されている。対応するbaselineは0.530、0.528、0.510だった。これはArcの報告値であり、本記事で実データから再計算した値ではない。cell-eval2 metrics reference

2026年8月19日付の競技仕様では、pds_cosine はpanel内の全標的を固定的に除外する。候補ごとに残る座標が変わらない方法である。なお、競技の6指標すべてが全標的を除くわけではない。他の5指標では、その摂動自身の標的を除く。VCC2026 metrics brief

この資料の日付を、実際の運用変更日と同一視することは避ける。また、raw PDSの0.5という基準と、baseline・replicateで正規化した競技得点の0という基準は別である。

5. 3摂動の計算例で確かめる

大規模データを読む前に、問題が成立する最小限の例を作った。遺伝子A・B・Cをそれぞれ抑える3摂動と、下流遺伝子D・Eを用意する。以下はcontrol(非標的対照)との差を表す合成値であり、実験データではない。

摂動 A B C D E
Aを抑える −5 0 0 1 0
Bを抑える 0 −5 0 0 1
Cを抑える 0 0 −5 −1 −1

評価の近道だけを使う予測は、D・Eを常にゼロとし、自分以外の標的を+10にする。例えばA摂動の予測は \((0,10,10,0,0)\) となる。下流応答の情報を使っていない。

合成データの観測値と、他の標的だけを増加させた予測。行は摂動、列は遺伝子を表す。

図1:本記事で作成した合成例。青は負、茶は正、灰はゼロ。色は符号だけを表し、大きさは各セルの数値で示す。自分以外のpanel標的だけを増加させた予測であり、D・Eの下流応答は予測していない。数値の単位は任意。

cosine距離を使うと、Aを除いた正解との内積はゼロで、距離は1になる。しかしB摂動との内積には \(10\times(-5)\) が入り、距離は1より大きくなる。Cとの比較も同様である。正解を当てたように見えるが、起きているのは不正解候補を遠ざける操作である。

比較したのは、row-mask、panel-mask(panelの全標的を一括除外)、次節のpairwise-mask(二者比較ごとに両標的を除外)である。同点は0.5点、ゼロベクトルのcosine距離は1と定義した。計算上は距離の差が \(10^{-12}\) 以下の場合を同点として扱った。rowとpanelでは、正解と各候補の勝敗を平均することが、同点補正した正規化順位に対応する。旧実装の同点処理や前処理を完全再現する実験ではない。

予測 Row-mask Panel-mask Pairwise-mask
Controlのまま:全効果ゼロ 0.50 0.50 0.50
他の標的を+10にする 1.00 0.50 0.50
D・Eだけ正解を与えるoracle 1.00 1.00 1.00
全遺伝子の正解を与えるoracle 1.00 1.00 1.00

同じ予測の得点がマスク方法で変わる。標的のspikeはrow-maskだけで満点になる。

図2:合成データでの計算結果。得点は3摂動の平均。oracleは正解を使う陽性対照であり、学習した予測モデルではない。すべての棒は0〜1の同一尺度。

この例が示すのは、下流応答を予測しない出力が、特定の評価規則で満点になりうることである。実際のモデルの順位、実データでの効果量、pairwise法の優越性は示していない。計算コードと結果CSVを公開し、入力・依存ライブラリ・図を含む再実行資料ZIPも用意した。

6. 全標的を消す方法と、二者比較で消す方法

panel-maskには、同じ固定座標を使える利点がある。一方、Aを抑えたときにBが変わるという応答も、Bが別の摂動の標的なら評価から消える。これは、本来測りたい情報を減らす可能性がある。

Kernfeldのappendixは、正解 \(i\) と候補 \(j\) の二者比較ごとに、両方の標的を除く案を提示する。以下では、原案に同点の扱いを明示的に加える。

\[ S_i=\frac{1}{N-1}\sum_{j\ne i} \left[ \mathbf 1\{a_{ij}<b_{ij}\} +\frac12\mathbf 1\{a_{ij}=b_{ij}\} \right], \]

\[ a_{ij}=d_{-(i,j)}(\hat x_i,x_i),\qquad b_{ij}=d_{-(i,j)}(\hat x_i,x_j). \]

この式と以下の解釈は、原記事の提案を基にした本記事の整理である。各二者比較では同じ遺伝子を使い、最後に勝率を平均する。候補ごとに違う座標で求めた距離を、そのまま一列に並べて順位付けする方法とは異なる。

AUCに似た勝率と考えると理解しやすいが、通常のROC-AUCや、一つの固定距離から作る順位と同じものではない。比較ごとに座標が変わるため、全候補に共通する距離順序があるとも限らない。

この方法では、比較に無関係な第三の標的を残せる。ただし、それが常に有利とは言えない。残る標的の直接効果、遺伝子間の依存、複数標的の摂動、弱い応答、cosine距離のノルム依存を含めた検証が必要である。合成例で同じspikeを防げたことだけでは、本命や最適解とは断定できない。

7. 最近の論文は、何を支持し、何を支持しないか

2025年のAhlmann-Eltzeらは、検討した遺伝子摂動予測で深層学習が単純な線形baselineを上回らないと報告した。Systemaは、多くの摂動に共通する系統的変動と、摂動固有の応答を区別して評価する必要を示した。これらは、単純な基準モデルを省略できない理由になる。Ahlmann-Eltze et al.、Systema

一方、2026年10月のMillerらは、14データセット・18指標を用い、陽性対照と陰性対照を区別できるかという意味で指標を点検した。感度の良い指標では、複数の深層学習モデルがbaselineを上回った。これは予測確率の校正ではなく、評価指標が有用な予測を識別する能力の点検である。論文も、未知の細胞背景への予測は扱っていないと述べる。Miller et al.

この二つの見方は、単純に片方が他方を否定する関係ではない。全遺伝子の平均誤差は弱い応答を埋もれさせることがあり、変化の強い遺伝子だけの指標は標的の直接効果を強調することがある。何を検出したい指標なのか、陽性対照を識別できるか、近道でも高得点になるかを、それぞれ調べる必要がある。

最近のモデルも、同じ課題を解いているわけではない。

研究・モデル 主に報告する能力 今回の問題との関係
UCE、Nature 2026 多様な細胞の共通表現 良い埋め込みだけでは未知介入の予測は保証されない
State、Cell 2026 細胞集団の異質性を考慮した、文脈をまたぐ摂動予測 平均だけでなく、集団の応答をどこまで評価するかが重要
Stack、2026年プレプリント 推論時の細胞プロンプトを用いたin-context learning どの条件の細胞をプロンプトとして観測済みかが重要
PIE、2026年10月のプレプリント 生物学的な知識を入力し、集団レベルの摂動効果を予測 未知標的・未知文脈・両者が未知の設定を区別する必要がある
Millerら、Nature Biotechnology 2026 指標の感度点検と、未知標的・未知組合せのモデル比較 高得点・低得点を指標の性質と切り離して解釈できない

各論文が報告する能力の概要は、UCE、State、Stack、Millerらを参照した。表の「今回の問題との関係」は本記事の解釈である。Stackは、この調査ではプレプリントとして扱う。

PIEは2026年10月5日に公開された新しい例である。公開READMEと発表資料では、知識源、対象文脈のcontrol、学習データ内の摂動応答を利用すると説明されている。未知条件を予測するという主張も、何も観測せずに予測するという意味ではない。本記事では公開資料で確認できる設計の紹介に留め、詳細な性能値や独立検証を済ませたという主張は採用しない。PIEの公開実装説明、原著者による発表

データ側では、2026年9月のTahoe-100Mが、50のがん細胞株・1,100のdrug-dose条件を含む大規模な薬剤摂動アトラスを報告した。ただし、薬剤によるタンパク質の阻害と、CRISPRiによる標的mRNAの抑制は同じ介入ではない。本記事の標的マスクを、薬剤摂動へそのまま適用する根拠にはならない。Tahoe-100M

さらに、Nicolらの2026年プレプリントは、予測側と観測側から同じcontrol推定値を引くと、共有される推定誤差で相関が膨らむ問題を報告した。Nicol et al.

直感を得るため、互いに独立な推定誤差 \(\epsilon_p,\epsilon_t,\epsilon_c\) を仮定する。本記事での代数的な説明では、

\[ \operatorname{Cov}(\epsilon_p-\epsilon_c,\epsilon_t-\epsilon_c) =\operatorname{Var}(\epsilon_c) \]

となる。独立な予測誤差と観測誤差にも、同じcontrolを引くことで共通成分が入る。この式は一般の細胞データで常に独立性が成立するという主張ではない。標的を除くことだけでは、こうした別の評価上の問題は解決しない。

8. 私なら何をそろえて評価するか

第一に、利用場面を先に決める。例えば「標的の介入後発現を測らず、未知の単独CRISPRiが同じ細胞株の下流転写へ与える平均応答を予測する」と書く。これなら、必要な入力、未知にする対象、評価する出力を点検できる。

第二に、単純な基準を置く。controlのまま、学習摂動の平均、単純な線形モデルを、同じ分割で比較する。予測値を全摂動に共通化した対照と、標的だけを操作した対照も置き、何を学ばなくても得点できるか確認する。

第三に、役割の異なる指標を併記する。下流遺伝子の絶対誤差、摂動固有の差分、retrieval、必要なら経路や細胞集団の分布を評価する。retrievalだけ良くても、発現量が不自然なら、その予測を実験設計には使いにくい。

第四に、前処理と評価の仕様を固定する。controlの利用法、遺伝子集合、DE選択、標的マスク、ゼロノルム、同点処理、平均方法、実装版を保存する。Top-DEを観測結果から選ぶことは診断として可能だが、その選択情報を予測器へ渡していないか、将来の未知摂動にも同じ評価が成立するかは別途確認する。

SchäferらのscPertEvalプレプリントも、評価をrepresentation、metric、score transformation、reporting strategyへ分解する枠組みを提示している。この整理は、違う前処理や正規化を使った「同じ指標名」の数値を安易に比較しないために役立つ。後半は本記事の解釈である。scPertEval

最後に、実データでpanel-maskとpairwise-maskを比較するなら、同じ予測を両方で採点する。標的spikeの陰性対照とreplicateの陽性対照を含め、摂動単位の差を示す。細胞数を増やしただけで独立な摂動数が増えたように扱わず、実験の反復構造に応じて不確実性を評価する。

9. この「謎」について言えること

Kernfeldの問いは、標的を下げることを当てた得点を、下流の応答を理解した証拠として読んでよいか、という問いだった。Arcの公開仕様は、retrievalでの標的の扱いの非対称性が実際に得点の近道になることも示している。

本記事の合成例でも、その仕組みを再現できた。しかし、そこから「scFMは役に立たない」「pairwise-maskで評価問題は解決した」とは言えない。

私は、モデルの名前や規模よりも、予測前に何を知っていて、何を未知にし、どの応答を、どの対照より良く予測したのかを読みたい。その条件を明示すれば、Virtual Cellの進歩と限界を、同じ土台で議論できる。

参考資料

本文中のリンクを一次資料として使用した。原ブログ以外の長い引用や、既存論文の図の転載は行っていない。

  1. Kernfeld E. ブログ、2025-12-05:標的遺伝子の予測とretrievalの問題提起.
  2. Theodoris CV et al. Nature, 2023. 10.1038/s41586-023-06139-9.
  3. Hao M et al. Nature Methods, 2024. 10.1038/s41592-024-02305-7.
  4. Csendes G et al. Benchmarking foundation cell models for post-perturbation RNA-seq prediction. BMC Genomics, 2025. 10.1186/s12864-025-11600-2.
  5. Kernfeld E et al. A comparison of computational methods for expression forecasting. Genome Biology, 2025. 10.1186/s13059-025-03840-y.
  6. Ahlmann-Eltze C et al. Deep-learning-based gene perturbation effect prediction does not yet outperform simple linear baselines. Nature Methods, 2025. 10.1038/s41592-025-02772-6.
  7. Viñas Torné R et al. Systema. オンライン公開2025-08-25. 10.1038/s41587-025-02777-8.
  8. Wei Z et al. Nature Methods 23, 2026(オンライン公開2025-12-11). 10.1038/s41592-025-02980-0.
  9. Miller HE et al. Deep learning perturbation models can outperform baselines on calibrated metrics. Nature Biotechnology, 2026. 10.1038/s41587-026-03307-w.
  10. Rosen Y et al. UCE. Nature, 2026. 10.1038/s41586-026-10689-z.
  11. Adduri AK et al. State. Cell, 2026. 10.1016/j.cell.2026.07.052.
  12. Dong M et al. Stack. bioRxiv, 2026、プレプリント. 10.64898/2026.01.09.698608.
  13. Nicol PB et al. bioRxiv, 2026、プレプリント. 10.64898/2026.05.07.723486.
  14. Arc Institute. cell-eval2 metrics reference、2026-08-19付 competition brief. 参照先は確認したコミット0ce25cfに固定。競技briefが参照する実装版は0.15.0、rule versionは3。
  15. Verma R et al. PIE. bioRxiv, 2026、プレプリント. 10.64898/2026.10.02.756297. 本記事では原著者の発表・公開READMEを確認。要旨も参照。原著本文の詳細な検証は行っていない。
  16. Zhang J et al. Tahoe-100M. Cell, 2026. 10.1016/j.cell.2026.08.035.
  17. Wong DR, Hill AS, Moccia R. Bioinformatics, 2025. 10.1093/bioinformatics/btaf317. 要旨はPubMedで確認。
  18. Schäfer PSL et al. scPertEval. bioRxiv, 2026、プレプリント. 10.64898/2026.07.23.740433.

計算例の再実行と限界

再実行資料ZIPを展開し、Python 3.11以上で、展開先のフォルダから以下を実行する。NumPyとPillowの確認済みの版は同梱したrequirements.txtに固定した。フォントが環境によって異なる場合、図の文字の見た目は変わるが計算値は変わらない。

python -m pip install -r requirements.txt
python toy_metrics.py

toy-results.csv、toy-data.json、図1・2を生成する。3摂動・5遺伝子の人工的な平均効果を直接与えており、実データの取得、scFMの学習、single-cell分布の再現、Arc競技パイプラインの再実行は行っていない。

陽性対照2種類と、共通予測100種類の基準得点を検査した。pairwise法については、この計算例と数式上の性質の確認までであり、実データでの比較検証は今後の課題である。