AI

CTの3次元画像2万2022件に167種の解剖構造を注釈したデータセット

この記事のポイント

  1. 実現したこと

    CADS-datasetでは、2万2022件のCTの3次元画像について、167種の解剖構造の注釈を利用できる。

  2. 実現の仕組み

    公開データと病院データを集め、擬似ラベル付けと教師なしの品質管理を組み合わせて注釈を作成した。

  3. 得られた結果

    付属する自動セグメンテーションモデルの性能は、公開チャレンジと病院の患者集団で検証されたと記載されている。

  4. 従来との違い

    公開ページの比較では、既存のコレクションに対してCT件数は18倍、対象構造の種類は60%増となった。

頭部から膝までのCT画像に解剖構造の領域マスクを重ねた図
AI生成画像

頭部から膝までの167種の解剖構造を、2万2022件のCTの3次元画像で注釈したCADS-datasetが公開されている。擬似ラベル付けと教師なしの品質管理を組み合わせ、広い範囲のCT画像を一つのデータセットにまとめた。

2万2022件のCTで頭部から膝までを扱う

CADS-datasetには2万2022件のCTボリュームが収録され、各画像に167種の解剖構造の注釈が付いている。対象は頭部から膝までに及び、複数の解剖領域を同じデータセットで扱う。

複数の収集元を自動処理で注釈する

画像の収集元には、16カ国の100以上の撮像施設に由来する公開データと病院データが含まれる。CADSの構築には、画像へ暫定的な注釈を与える擬似ラベル付けと、教師なしの品質管理を組み合わせた自動処理が使われた。

元の画素間隔を保って画像とマスクを提供

元のCT画像と、構造ごとの位置を示すセグメンテーションマスクは、画素間隔を保ったNIfTI形式で提供される。Hugging Faceで公開されているCADS-datasetの説明では、既存のコレクションとの比較でCT件数は18倍、対象構造の種類は60%多いとされている。

注釈データを使う自動セグメンテーションモデル

CADS-modelは、全身CTの自動セグメンテーションに使うモデル群として提供される。公開ページには、公開チャレンジと病院の患者集団で性能を検証したと記載されている。

モデルはPythonスクリプトからコマンドラインで実行でき、医用画像ソフトウェアの3D Slicer向けプラグインからも操作できる。画像と注釈に加え、セグメンテーションを実行する手段まで公開されている。