スペクトルデータ増強手法とその応用進展

TANG Lei ,  

MAO Ye-hui ,  

CAI Jing ,  

LIU Hengqin ,  

MIN Hong ,  

AN Ya-rui ,  

LIU Shu ,  

摘要

機械学習がスペクトル解析に深く応用されるにつれて、モデルの訓練はデータサンプルの不足やクラス分布の不均衡といった課題に直面し、モデルの汎化性能を制限し過学習のリスクを引き起こしている。本論文は2017年以降の国内外の公開文献を概観し、スペクトルデータ増強手法を非深層学習によるデータ増強方法と深層学習によるデータ増強方法の二つに分類し、浅層のデータ拡張から深層生成モデリングへの進化傾向を明らかにした。非深層学習のデータ増強方法はスペクトル変換およびスペクトル合成によりデータ拡張を実現し、その計算効率の利点により、産業プロセスの監視、漢方薬のトレーサビリティおよび医薬品・食品の品質検査などの小規模サンプルシナリオで良好な適用性を示す。深層生成モデルは主に生成対抗ネットワーク(GAN)およびその派生手法や改良型オートエンコーダ(AE)を指す。GANは対抗的ゲームメカニズムにより、原データと構造的類似性および分布の一貫性を持つ増強サンプルを生成し、医療画像診断、精密農業、材料分類などの高精度モデリングシナリオで広く活用されている。改良型AEは潜在空間表現学習を通じてデータの本質的特徴を捉え、生成データは原分布特性を維持しつつ特徴の頑強性も備え、化学物質同定や土壌成分検出などの高次元データ処理タスクにおいて有利である。本総説は既存のデータ増強手法の限界を指摘し、今後の発展方向を考察した。

关键词

データ増強; スペクトル解析; 深層学習; 生成対抗ネットワーク; 変分オートエンコーダ

阅读全文