材料科学とデータ科学・機械学習を組み合わせ、望む性質を持つ材料を効率よく発見・設計する研究分野です。従来は実験と勘に頼っていた材料開発を、データとアルゴリズムで加速します。新材料の探索期間を大幅に短縮できると期待されています。
詳しく学ぶ:MI入門「」に一致する用語は見つかりませんでした。
①MIの基本概念
「この構造・組成の材料はどんな性質を持つか」を予測するのが順問題、「この性質を得るにはどんな材料を作ればよいか」をさかのぼって求めるのが逆問題です。MIの最終目標は逆問題を解くこと、すなわち欲しい性能から材料を設計することにあります。
詳しく学ぶ:MI入門実験・計算・文献から集めたデータを起点に、統計モデルや機械学習で材料開発を進めるアプローチです。理論式や経験則だけに頼らず、蓄積されたデータそのものから傾向やルールを引き出します。MIの中核となる考え方です。
詳しく学ぶ:データ駆動材料科学入門膨大な数の候補材料を、計算や自動実験で一気に評価し、有望なものを絞り込む手法です。人手では扱いきれない何万・何十万もの候補を短期間でふるいにかけられます。有望候補を機械学習で予測してから絞り込むことで、さらに効率が高まります。
詳しく学ぶ:ハイスループット計算入門考えうる組成・構造・プロセス条件のすべての組み合わせが作る、探索の対象となる巨大な空間のことです。元素の種類や比率、結晶構造などを変数と考えると、その組み合わせは天文学的な数になります。この広大な空間を効率よく探索することがMIの主要な課題です。
材料の原子配列や組成といった「構造」と、強度・導電性・触媒活性などの「物性」との対応関係を指します。この相関を理解・モデル化できれば、構造から物性を予測したり、逆に望む物性から構造を設計したりできます。材料科学とMIの根幹をなす概念です。
2011年に米国が開始した、新材料の開発期間とコストを半減することを目指す国家プロジェクトです。計算・実験・データ基盤を連携させる考え方を世界に広め、各国のMI推進の起点となりました。日本を含む各国が類似の国家戦略を展開しています。
詳しく学ぶ:世界のMI研究プロジェクト多数の材料を性質や特徴量に基づいて地図のように配置し、全体の傾向や空白領域を可視化する手法です。次元削減などを使って高次元のデータを2次元・3次元に落とし込み、未開拓の有望領域を見つけ出します。探索戦略の立案に役立ちます。
詳しく学ぶ:材料特性マッピング入門ある物理量が別の量に対して規則的な比例・べき乗関係を示す経験則です。触媒科学の分野では、異なる反応中間体の吸着エネルギーどうしが直線関係を持つことが知られ、材料設計の指針として使われます。単純な指標から複雑な性能を予測する手がかりになります。
②データと特徴量
材料を機械学習が扱える数値のベクトルに変換したものです。組成・構造・電子状態などの情報を数値化することで、モデルは材料どうしを比較し性質を予測できます。良い記述子を設計することがMIの精度を左右する重要なステップです。
詳しく学ぶ:組成ベース特徴量入門材料の化学組成(含まれる元素とその比率)だけから計算する特徴量です。原子量・電気陰性度・価電子数などの元素特性を統計処理して作ります。結晶構造が未知でも計算できるため、初期スクリーニングで広く使われます。
詳しく学ぶ:組成ベース特徴量入門原子の三次元的な配置や結合の様子など、結晶・分子構造の情報を反映した特徴量です。組成特徴量より多くの情報を含むため予測精度が高くなりやすい一方、構造データが必要になります。グラフニューラルネットワークとの相性が良い表現方法です。
詳しく学ぶ:GNN特徴量比較入門組成情報から標準的な特徴量セットを自動生成する、代表的な特徴量ライブラリです。各元素の物理的・化学的性質を組成比で重み付けして統計量を計算します。matminerなどを通じて手軽に利用でき、組成ベースMIの定番となっています。
詳しく学ぶ:組成ベース特徴量入門ある原子の周囲の局所環境を、なめらかな関数で表現する構造記述子です。回転や並進に対して不変で、原子配置の微妙な違いを連続的に捉えられます。機械学習ポテンシャルや構造の類似度計算で広く使われます。
分子構造の中に特定の部分構造が存在するかどうかを、0と1のビット列で表した記述子です。分子どうしの類似度を素早く計算でき、化合物の検索やスクリーニングに使われます。ケモインフォマティクスの基本的な分子表現の一つです。
詳しく学ぶ:ケモインフォマティクス入門「元素名」や「結晶系」といったカテゴリ情報を、該当する要素だけを1、他を0とするベクトルに変換する方法です。数値に大小の意味を持たせずにカテゴリを表現できます。単純ですが、種類が多いと次元が大きくなる点に注意が必要です。
元のデータからモデルが学習しやすい有用な特徴量を作り出したり選んだりする作業です。ドメイン知識を活かして良い特徴量を設計すると、少ないデータでも高い予測精度が得られます。MIではモデル選択と並んで成否を分ける工程です。
詳しく学ぶ:特徴量エンジニアリング入門多数の特徴量(高次元データ)を、情報をなるべく保ったまま少数の変数に圧縮する手法です。PCAやt-SNE、UMAPなどが代表的で、データの可視化やノイズ除去に役立ちます。材料空間の全体像を2次元の地図として眺めるときに使われます。
詳しく学ぶ:材料特性マッピング入門誤り・重複・外れ値・単位の不一致などを取り除き、分析に使える状態にデータを整える作業です。実験データや文献データには不完全なものが多く、この前処理が予測精度を大きく左右します。「ゴミを入れればゴミが出る」を避けるための基本工程です。
詳しく学ぶ:データ駆動材料科学入門データの一部が測定されていなかったり記録が抜けていたりする、値が存在しない箇所のことです。そのままでは多くの機械学習モデルが扱えないため、削除するか、平均値やモデルで推定して補完(インピュテーション)します。扱い方が結果に影響するため慎重な判断が必要です。
特徴量ごとに単位やスケールが異なると学習が偏るため、値の範囲や分布をそろえる前処理です。標準化は平均0・分散1に変換し、正規化は0〜1などの範囲に収めます。距離や勾配を使うモデルでは特に重要な下ごしらえです。
③機械学習の基礎用語
入力データと正解ラベル(例:組成と実測物性)の組を与えて、入力から出力を予測するモデルを学習させる方法です。材料の物性予測はほとんどが教師あり学習にあたります。十分な数の正解データを用意できるかが鍵になります。
詳しく学ぶ:教師あり学習入門正解ラベルを使わず、データそのものに潜む構造やグループを見つけ出す方法です。クラスタリングや次元削減が代表例で、材料をタイプ別に分類したり隠れた傾向を発見したりします。ラベル付けが難しい探索初期に役立ちます。
詳しく学ぶ:教師なし学習入門連続的な数値(例:融点、バンドギャップ、強度)を予測する教師あり学習のタスクです。入力と出力の間の関係を関数として近似します。材料物性の多くは連続量なので、MIでは回帰が最もよく使われます。
詳しく学ぶ:教師あり学習入門データをあらかじめ決めたカテゴリのどれかに振り分ける教師あり学習のタスクです。「金属か絶縁体か」「安定か不安定か」といった予測がこれにあたります。出力が離散的なラベルである点が回帰との違いです。
詳しく学ぶ:教師あり学習入門モデルが訓練データに過度に適合し、未知のデータではうまく予測できなくなる状態です。データの本質的な傾向ではなくノイズまで覚えてしまうことで起こります。データが少ないMIでは特に起きやすく、交差検証や正則化で対策します。
詳しく学ぶ:モデル評価入門データを複数の組に分け、一部を検証用にしながら学習と評価を繰り返してモデルの性能を見積もる手法です。限られたデータを有効に使い、過学習を見抜くのに役立ちます。少数データが多いMIでは標準的な評価手順です。
詳しく学ぶ:モデル評価入門学習に使っていない未知のデータに対して、モデルがどれだけ正しく予測できるかを表す能力です。MIの目的は既知データの再現ではなく未知材料の予測なので、汎化性能こそが最も重要な指標になります。訓練誤差ではなく検証誤差で評価します。
詳しく学ぶ:モデル評価入門学習を始める前に人間が設定する、モデルの構造や学習の進め方を決める値です。木の深さや学習率などがこれにあたり、データから自動で決まるパラメータとは区別されます。適切に調整(チューニング)すると性能が大きく向上します。
詳しく学ぶ:ハイパーパラメータチューニング入門「この特徴量がある値より大きいか」という質問を繰り返して枝分かれし、最終的に予測へたどり着くモデルです。判断の流れを木構造で表すため、なぜその予測になったか解釈しやすいのが利点です。単体でも使えますが、集めてランダムフォレストなどを作る基礎にもなります。
詳しく学ぶ:アンサンブル学習入門多数の決定木を少しずつ異なる条件で作り、その予測を多数決や平均でまとめるアンサンブル手法です。単一の木より精度と安定性が高く、過学習にも比較的強いのが特徴です。少数データでも扱いやすく、MIの定番モデルとして広く使われます。
詳しく学ぶ:アンサンブル学習入門脳の神経回路を模した、多数の「ノード」を層状につないだモデルです。層を通じて入力を段階的に変換し、複雑な非線形の関係も表現できます。ディープラーニングやGNNなど、現代のMI手法の多くがこれを土台にしています。
詳しく学ぶ:ニューラルネットワーク入門多くの層を重ねたニューラルネットワークで、データから特徴を自動的に抽出しながら学習する手法です。画像・言語・分子構造など複雑なデータで高い性能を発揮します。十分なデータと計算資源があるとき、その真価を発揮します。
詳しく学ぶ:ディープラーニング基礎入門原子をノード、結合をエッジとするグラフとして材料を表し、その上で学習するニューラルネットワークです。結晶や分子の構造を自然に扱えるため、物性予測で高い精度を示します。特徴量を手作業で設計せずに構造から直接学べる点が強みです。
詳しく学ぶ:GNN入門「注意機構(Attention)」を使ってデータ内の重要な関係を捉える、大規模モデルの基盤となるアーキテクチャです。もとは自然言語処理で登場しましたが、分子や結晶の表現学習にも応用されています。大量データで事前学習した基盤モデルの中核技術です。
詳しく学ぶ:Transformer・基盤モデル入門モデルの予測が正解からどれだけ外れているかを数値で表す関数です。学習は、この損失をできるだけ小さくするようにパラメータを調整していく過程です。回帰では平均二乗誤差、分類では交差エントロピーなど、タスクに応じて選びます。
④最適化・探索
少ない試行回数で最適な条件を見つけるための効率的な最適化手法です。これまでの結果から代理モデルを作り、「次にどこを試すべきか」を賢く選びます。1回の実験や計算にコストがかかる材料探索と非常に相性が良い方法です。
詳しく学ぶ:ベイズ最適化入門ベイズ最適化で「次に試す点」を決めるための指標です。予測値の高さ(活用)と不確かさの大きさ(探索)を組み合わせて、最も価値のある候補を選びます。EIやUCBなど複数の種類があり、探索の性格を左右します。
詳しく学ぶ:ベイズ最適化入門本物の実験や重い計算の代わりに、その入出力関係を近似する軽量なモデルです。安価に多数の候補を評価できるため、最適化のループを高速に回せます。ベイズ最適化ではガウス過程などが代理モデルとしてよく使われます。
詳しく学ぶ:ベイズ最適化入門予測値だけでなく、その予測にどれだけ自信があるか(不確かさ)も同時に出せる回帰モデルです。データが少ない領域では不確かさが大きくなるため、探索すべき場所の判断に使えます。ベイズ最適化の代理モデルとして中心的な役割を果たします。
詳しく学ぶ:ベイズ最適化入門まだ試していない領域を調べる「探索」と、良さそうな領域を深掘りする「活用」のどちらを優先するかというジレンマです。探索に偏ると効率が悪く、活用に偏ると局所解に陥ります。両者のバランスをとることが効率的な最適化の鍵です。
詳しく学ぶ:ベイズ最適化入門モデル自身が「次にどのデータを取得すれば最も学習が進むか」を選び、実験や計算を提案する枠組みです。情報量の多いデータから優先的に集めることで、少ない試行で高精度なモデルを作れます。実験コストの高い材料開発で威力を発揮します。
詳しく学ぶ:Active Learning入門「強度も高く、かつ軽い」のように、互いに競合する複数の目標を同時に最適化する問題です。すべてを完璧に満たす解は通常なく、バランスのとれた解の集合を求めます。実材料の設計は多くの要求を両立させる多目的問題になりがちです。
詳しく学ぶ:機械学習のための最適化入門多目的最適化において、「どれか一つの目標を良くしようとすると別の目標が悪化してしまう」という限界にある解の集まりです。この境界上の解はいずれも甲乙つけがたい最良の妥協点で、設計者はこの中から目的に応じて選びます。トレードオフを可視化する重要な概念です。
エージェントが試行錯誤を通じて行動し、得られる報酬を最大化する方策を学ぶ枠組みです。合成経路の設計や実験条件の逐次決定など、連続した意思決定を要する材料探索に応用されています。明確な正解データがなくても学習できる点が特徴です。
詳しく学ぶ:強化学習入門AIが次の実験を提案し、ロボットが実行し、得られたデータでAIを更新する、という循環を自動で回す仕組みです。人間の介入を最小限にして材料探索を高速化します。自律実験(自動実験ラボ)の中核となる考え方です。
詳しく学ぶ:NIMO入門できるだけ少ない実験回数で、因子の効果を効率よく調べるための統計的な計画手法です。直交表や応答曲面法などを使い、やみくもに実験するより情報を効率的に得られます。ベイズ最適化以前から使われてきた、実験を賢く設計する古典的枠組みです。
⑤計算科学
電子の密度分布をもとに材料のエネルギーや電子状態を計算する、第一原理計算の代表的な手法です。実験をせずに物性を予測できるため、MI用のデータ生成に広く使われます。精度と計算コストのバランスが良く、材料計算の標準になっています。
詳しく学ぶ:量子化学入門経験的なパラメータに頼らず、量子力学の基本方程式だけから材料の性質を計算する方法です。未知の材料でも実験前に物性を予測でき、MIの重要なデータ源になります。計算コストは高いものの信頼性が高いのが特徴です。
詳しく学ぶ:計算材料科学基礎入門原子に働く力を計算しながらニュートンの運動方程式を数値的に解き、原子の動きを時間を追って再現する手法です。拡散・熱伝導・相転移など、温度や時間に依存する現象を調べられます。力の計算に機械学習ポテンシャルを使うと大幅に高速化できます。
詳しく学ぶ:計算材料科学基礎入門第一原理計算のデータを学習し、原子配置からエネルギーや力を高速に予測するモデルです。DFT並みの精度を古典力場並みの速さで実現し、大規模・長時間のシミュレーションを可能にします。近年の計算材料科学で急速に普及しています。
詳しく学ぶ:機械学習ポテンシャル入門原子の配置を変えたときにエネルギーがどう変化するかを表す、多次元の「地形」です。谷は安定な構造、峠は反応の障壁に対応し、材料の安定性や反応経路を理解する土台になります。機械学習ポテンシャルはこの面を近似する試みといえます。
詳しく学ぶ:機械学習ポテンシャル入門結晶中の原子の集団的な振動を量子として捉えたものです。熱容量・熱伝導・熱膨張といった熱的性質や、構造の安定性を理解するうえで欠かせません。第一原理計算からフォノンを求めることで、材料の熱物性を予測できます。
詳しく学ぶ:計算材料科学基礎入門結晶中で電子が取りうるエネルギーが、運動量に応じてどう分布するかを表した図です。バンドギャップの有無や大きさから、金属・半導体・絶縁体の区別や光学的性質がわかります。電子材料の設計で最も基本的な情報の一つです。
各エネルギーに、電子が入れる状態がどれだけ存在するかを表した分布です。バンド構造を運動量について集約したもので、電気伝導や磁性、触媒活性の議論に使われます。特定のエネルギー付近の状態の多さが物性を左右します。
構成元素の単体から化合物を作るときに出入りするエネルギーで、その材料が熱力学的に安定かどうかの目安になります。値が低いほど安定で、実際に合成できる可能性が高いと考えられます。新材料候補が現実に存在しうるかを判断する重要な指標です。
DFTで、電子どうしの複雑な相互作用(交換・相関)を近似的に表す部分です。LDA・GGA・ハイブリッドなど多くの種類があり、選び方で計算精度が変わります。DFTの精度と適用範囲を決める、いわば計算の「腕前」を左右する要素です。
詳しく学ぶ:量子化学入門⑥データ基盤・エコシステム
数十万件の無機材料についてDFT計算による物性データを無料公開している、代表的な材料データベースです。組成・結晶構造・形成エネルギー・バンドギャップなどをAPI経由で取得できます。MI研究の出発点として世界中で使われています。
詳しく学ぶ:材料データベース活用入門DFT計算に基づく無機材料の熱力学・構造データを大量に収録した、オープンなデータベースです。とくに形成エネルギーや相安定性のデータが充実しています。Materials Projectと並んで機械学習モデルの学習データ源としてよく使われます。
詳しく学ぶ:材料データベース活用入門高スループットな第一原理計算を自動化し、膨大な材料データを生成・公開しているフレームワーク兼データベースです。数百万件規模の計算結果を検索・利用できます。合金や新規化合物の探索に活用されています。
詳しく学ぶ:材料データベース活用入門世界中の計算材料データを、元の入力・出力ファイルごと保存・共有する欧州発のリポジトリです。異なるソフトのデータを統一的に扱え、再現性とデータ共有を重視しています。FAIR原則を実践するデータ基盤として知られます。
詳しく学ぶ:材料データベース活用入門複数の材料データベースを、共通のAPI仕様で横断的に検索できるようにする国際標準です。データベースごとに異なる問い合わせ方法を覚えなくても、同じ書き方で複数のデータ源にアクセスできます。データの相互運用性を高める取り組みです。
詳しく学ぶ:材料データベース活用入門日本の物質・材料研究機構(NIMS)が運営する、材料データベース群の総称です。高分子・無機・金属・拡散・電子構造など、実験データを含む多様なデータを提供しています。日本発のMI基盤として、国内研究で広く参照されています。
詳しく学ぶ:材料データベース活用入門結晶構造の操作、物性の解析、データベースへのアクセスなどを行うPython製の材料解析ライブラリです。Materials Projectと密接に連携し、構造データの読み書きや変換を容易にします。MIのデータ処理で事実上の標準ツールとなっています。
詳しく学ぶ:材料データベース活用入門材料データから機械学習用の特徴量を自動生成し、データの取得や可視化まで支援するPythonライブラリです。Magpieをはじめ多数の記述子を数行のコードで計算できます。組成・構造ベースMIの前処理を大幅に効率化します。
詳しく学ぶ:組成ベース特徴量入門原子構造の作成・操作や、各種計算ソフトの制御を統一的に行えるPythonツールキットです。DFTや分子動力学など多様な計算エンジンを共通の書き方で扱えます。計算ワークフローの自動化やハイスループット計算の土台として使われます。
詳しく学ぶ:ハイスループット計算入門グラフニューラルネットワークをPyTorch上で実装するためのライブラリです。分子や結晶をグラフとして扱い、GNNモデルを効率よく構築・学習できます。材料・分子のGNN研究で広く使われる標準的なツールです。
詳しく学ぶ:PyTorch Geometric入門データを見つけやすく(Findable)、アクセスでき(Accessible)、相互運用でき(Interoperable)、再利用できる(Reusable)ようにするための指針です。データを人にも機械にも活用しやすい形で共有することを目指します。MIのデータ基盤づくりで重視される考え方です。
ベイズ最適化などのアルゴリズムとロボット実験・計算をつなぎ、材料探索のクローズドループを回すためのオープンソースツールです。「次に何を試すか」の提案から結果の取り込みまでを自動化します。自律的な材料開発を手軽に始められる基盤として注目されています。
詳しく学ぶ:NIMO入門