配列スクリーニングと地理・時間メタデータを組み合わせ、生物脅威の兆候と起源を調べる計算手法が、最大800テラバイトを24時間以内に処理する条件で実証された。
検出と起源判定を二つの段階で評価
大量のゲノム・環境データから生物イベントの起源を調べる計算ツールを競うため、米国防高等研究計画局(DARPA)は仮想競技「Bio-Attribution Challenge」を実施した。課題は、複雑な環境試料の背景に埋もれた病原体を見つけ、その由来を計算によって絞り込む処理を対象とした。
第1段階では、複雑な環境試料中の病原体を検出し、特徴を明らかにする能力を評価した。第2段階では、人工的に設計された病原体に固有の物理的、化学的、設計上の特徴を探し、起源を判定する課題へ進んだ。
配列の特徴を場所と時点の情報へ接続
最終の「Determination – Attribution」段階では、詳細な配列スクリーニングと正確な地理・時間メタデータを組み合わせる必要があった。配列に現れる特徴だけでなく、その試料に対応する場所と時点を同じ解析へ取り込む構成である。
参加者に事前提供された試料情報は、現実に近い解析条件とするため最小限に抑えられた。詳しい背景説明を手掛かりにせず、ゲノム情報と環境情報の中から判定材料を抽出する条件が設定された。
600〜800テラバイトを24時間以内に処理
最終段階の参加者は、600〜800テラバイトのデータセットを24時間以内に処理した。評価対象は処理量や速度だけではなく、病原体が放出または操作された可能性を示す指標を正確に特定できるかどうかだった。
この条件下で8チームが最終段階を完了した。これにより、配列スクリーニングと地理・時間情報を接続する処理が、数百テラバイト規模のデータを扱う計算課題として実行された。
模擬データを政府管理環境で解析
米ローレンス・リバモア国立研究所(Lawrence Livermore National Laboratory、LLNL)は、現実的で複雑な起源特定シナリオを模した評価データを作成した。実際の病原体や生物材料を使わず、機密情報を開示しない計算競技として解析条件を構成した。
参加者のソフトウェアは、政府管理の安全な環境で実行された。DARPAは、この評価を通じて上位参加者が既存ツールに対して桁単位の改善をもたらす手法を実証したとしている。