データサイエンス

統計解析・AI・マテリアルズインフォマティクスの英語用語100選|略語・意味・例文一覧

「特徴量は英語で何という?」「目的変数と目的関数はどう訳し分ける?」「MIの論文に出てくる略語をまとめて確認したい」。統計解析・AI・マテリアルズインフォマティクスに取り組んでいると、手法の理解と同時に、英語の表現を調べる場面も多くあります。

この記事では、研究開発でよく使う英語100語を、日本語・英語と略語・意味の一覧表にまとめました。統計の基本から、機械学習、生成AI、材料探索まで10分野に分けています。各分野には、発表や打ち合わせに使える英語例文と日本語訳も付けました。

まず覚えたい組み合わせは、特徴量=feature、目的変数=target variable、記述子=descriptor、物性=material properties、ベイズ最適化=Bayesian optimizationです。論文を読むときは英語・略語から、発表資料を作るときは日本語から探してみてください。

分野別の目次

スマートフォンでは、ブラウザの「ページ内を検索」で「PCA」「目的変数」などを入力すると、目的の用語を探しやすくなります。以下の例文は、表現を練習するためのオリジナル例です。

1.統計解析の基本の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 平均 → mean
  • 中央値 → median
  • 分散 → variance
  • 標準偏差 → standard deviation(SD)
  • 平均の標準誤差 → standard error of the mean(SEM)
  • 信頼区間 → confidence interval(CI)
  • 外れ値 → outlier
  • 相関 → correlation
  • 残差 → residual
  • 効果量 → effect size

各用語の意味・使う場面

日本語英語・略語意味・使う場面
平均mean値の合計をデータ数で割った値。ここでは算術平均。
中央値median値を小さい順に並べたときの中央の値。
分散variance平均からのずれの二乗に基づく、ばらつきの指標。
標準偏差standard deviation(SD)分散の平方根。元の測定値と同じ単位でばらつきを表す。
平均の標準誤差standard error of the mean(SEM)標本平均の推定のばらつき。独立・同分布の標本では通常 SD/√n で推定。
信頼区間confidence interval(CI)母平均などの推定の不確かさを、一定の信頼水準に対応する区間で表す。
外れ値outlier他の観測値の傾向から大きく離れた値。測定条件も確認する。
相関correlation変数同士の関連の程度。代表例は線形な関係を見る Pearson 相関。
残差residual観測値とモデルの予測値との差。
効果量effect size差や関連の大きさを表す指標。

使い方の例
The error bars represent standard deviations.
日本語:エラーバーは標準偏差を表しています。

関連する解説:NIST:平均の信頼区間

2.仮説検定・実験計画法の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 帰無仮説 → null hypothesis(H₀)
  • p値 → p-value
  • 統計的有意性 → statistical significance
  • t検定 → t-test
  • 分散分析 → analysis of variance(ANOVA)
  • 実験計画法 → design of experiments(DOE / DoE)
  • 因子 → factor
  • 水準 → level
  • 交互作用 → interaction
  • 応答曲面法 → response surface methodology(RSM)

各用語の意味・使う場面

日本語英語・略語意味・使う場面
帰無仮説null hypothesis(H₀)検定の基準に置く仮説。例は「2群の母平均が等しい」。
p値p-value帰無仮説と検定の前提のもとで、観測結果以上に極端な検定統計量が得られる確率。
統計的有意性statistical significanceあらかじめ決めた有意水準に基づく検定上の判断。
t検定t-test平均についての仮説を検定する方法。対応の有無などで手法を選ぶ。
分散分析analysis of variance(ANOVA)変動を分解し、群の平均差や因子の効果などを検定する方法。
実験計画法design of experiments(DOE / DoE)目的に合わせて因子や実験順序、繰り返しを計画する方法。
因子factor実験で効果を調べる項目。温度、触媒種など。
水準level因子に設定する値や種類。温度の80℃、100℃など。
交互作用interactionある因子の効果が、別の因子の水準に応じて変わること。
応答曲面法response surface methodology(RSM)因子と応答の関係を近似し、条件の改善や最適化に使う方法。

使い方の例
We evaluated the interaction between temperature and catalyst concentration.
日本語:温度と触媒濃度の交互作用を評価しました。

関連する解説:NIST:実験計画の選択

3.データ整理・前処理の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • データセット → dataset
  • 特徴量 → feature
  • 説明変数 → explanatory variable / predictor
  • 目的変数 → target variable / response variable
  • 欠損値 → missing value
  • 欠損値補完 → imputation
  • 標準化 → standardization
  • 正規化 → normalization
  • ワンホット符号化 → one-hot encoding
  • 特徴量エンジニアリング → feature engineering

各用語の意味・使う場面

日本語英語・略語意味・使う場面
データセットdataset解析対象としてまとめたデータの集合。
特徴量featureモデルの入力に使う情報。温度、組成、分子量など。
説明変数explanatory variable / predictor結果を説明・予測するための変数。
目的変数target variable / response variable予測・説明したい値。引張強度や収率など。
欠損値missing value値が記録されていない、または利用できない箇所。
欠損値補完imputation欠損値を推定値などで補う処理。
標準化standardization代表例は平均を引き、標準偏差で割る変換。
正規化normalization値域やベクトルの長さなどを一定の基準にそろえる処理。方法を併記すると明確。
ワンホット符号化one-hot encodingカテゴリを、該当する項目が1となる複数の列で表す処理。
特徴量エンジニアリングfeature engineering予測に役立つ入力を作成・変換する作業。

使い方の例
We used composition and processing conditions as input features.
日本語:組成とプロセス条件を入力特徴量として使用しました。

関連する解説:scikit-learn:データ前処理

4.AI・機械学習の学習方法の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 人工知能 → artificial intelligence(AI)
  • 機械学習 → machine learning(ML)
  • 教師あり学習 → supervised learning
  • 教師なし学習 → unsupervised learning
  • 自己教師あり学習 → self-supervised learning
  • 強化学習 → reinforcement learning(RL)
  • 回帰 → regression
  • 分類 → classification
  • クラスタリング → clustering
  • 転移学習 → transfer learning

各用語の意味・使う場面

日本語英語・略語意味・使う場面
人工知能artificial intelligence(AI)推論や学習など、知的な処理を実現する技術の総称。
機械学習machine learning(ML)データから予測や判断に使う規則・表現を学ぶ方法。
教師あり学習supervised learning入力と正解の組を使って学習する方法。
教師なし学習unsupervised learning正解ラベルを使わず、データの構造やまとまりを見つける方法。
自己教師あり学習self-supervised learningデータ自体から学習用の課題や教師信号を作る方法。
強化学習reinforcement learning(RL)環境とのやり取りで得る報酬をもとに行動を学ぶ方法。
回帰regression強度や温度などの数値を予測する課題。
分類classification良品・不良品などのクラスを予測する課題。
クラスタリングclustering類似性などに基づきデータをグループに分ける方法。
転移学習transfer learningある課題で得た知識や表現を、別の課題に利用する方法。

使い方の例
This is a regression task because the target is tensile strength.
日本語:目的変数が引張強度なので、これは回帰の課題です。

関連する解説:scikit-learn:機械学習用語集

5.よく使うモデル・解析手法の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 線形回帰 → linear regression
  • 部分最小二乗回帰 → partial least squares regression(PLS regression)
  • 主成分分析 → principal component analysis(PCA)
  • ランダムフォレスト → random forest(RF)
  • 勾配ブースティング決定木 → gradient boosting decision trees(GBDT)
  • サポートベクターマシン → support vector machine(SVM)
  • ガウス過程回帰 → Gaussian process regression(GPR)
  • ニューラルネットワーク → neural network(NN)
  • 深層学習 → deep learning(DL)
  • グラフニューラルネットワーク → graph neural network(GNN)

各用語の意味・使う場面

日本語英語・略語意味・使う場面
線形回帰linear regression入力の線形結合で目的変数を表すモデル。
部分最小二乗回帰partial least squares regression(PLS regression)入力と目的変数の関係を捉える潜在成分を使う回帰。
主成分分析principal component analysis(PCA)分散の大きい方向を軸に、データを少数の成分で表す方法。
ランダムフォレストrandom forest(RF)複数の決定木の予測を組み合わせるモデル。
勾配ブースティング決定木gradient boosting decision trees(GBDT)損失を改善するように決定木を順次追加する方法。
サポートベクターマシンsupport vector machine(SVM)マージンを利用する学習手法。回帰版は SVR。
ガウス過程回帰Gaussian process regression(GPR)関数に確率的な仮定を置き、予測分布を求める回帰。
ニューラルネットワークneural network(NN)重みを持つ計算単位を層状につないだモデル。
深層学習deep learning(DL)多層のニューラルネットワークを用いる学習。
グラフニューラルネットワークgraph neural network(GNN)原子と結合など、グラフ構造の情報を扱うモデル。

使い方の例
We used Gaussian process regression to predict material properties.
日本語:材料物性の予測にガウス過程回帰を使用しました。

関連する解説:scikit-learn:モデルと学習の用語

6.モデル評価・学習の調整の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 訓練データ → training data / training set
  • 検証データ → validation data / validation set
  • テストデータ → test data / test set
  • 交差検証 → cross-validation(CV)
  • データ漏洩 → data leakage
  • 過学習 → overfitting
  • 正則化 → regularization
  • ハイパーパラメータ → hyperparameter
  • 平均絶対誤差 → mean absolute error(MAE)
  • 二乗平均平方根誤差 → root mean squared error(RMSE)

各用語の意味・使う場面

日本語英語・略語意味・使う場面
訓練データtraining data / training setモデルの学習に使うデータ。
検証データvalidation data / validation setモデルや設定を選ぶ際の評価に使うデータ。
テストデータtest data / test set選択したモデルの性能を最終評価するために確保するデータ。
交差検証cross-validation(CV)分割を変えて学習・評価を繰り返す手順。
データ漏洩data leakage予測時には使えない情報が、学習やモデル選択に入り込むこと。
過学習overfitting訓練データに合わせすぎ、未知データで性能が落ちる状態。
正則化regularizationモデルの複雑さなどを制約し、汎化を助ける工夫。
ハイパーパラメータhyperparameter木の深さや学習率など、学習方法を調整する設定。
平均絶対誤差mean absolute error(MAE)予測誤差の絶対値の平均。目的変数と同じ単位。
二乗平均平方根誤差root mean squared error(RMSE)誤差を二乗して平均し、平方根を取る指標。大きな誤差を重く評価。

使い方の例
We evaluated the model using five-fold cross-validation.
日本語:5分割交差検証でモデルを評価しました。

関連する解説:scikit-learn:評価指標

7.評価指標・解釈・予測範囲の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 決定係数 → coefficient of determination(R²)
  • 正解率 → accuracy
  • 適合率 → precision
  • 再現率 → recall
  • F1スコア → F1 score
  • 混同行列 → confusion matrix
  • 特徴量重要度 → feature importance
  • 不確かさの定量化 → uncertainty quantification(UQ)
  • 内挿 → interpolation
  • 外挿 → extrapolation

各用語の意味・使う場面

日本語英語・略語意味・使う場面
決定係数coefficient of determination(R²)平均値を予測する基準に対する改善度を表す代表的な回帰指標。負になる場合もある。
正解率accuracy分類した全件のうち、正しく分類できた割合。
適合率precision陽性と予測したもののうち、実際に陽性だった割合。
再現率recall実際の陽性のうち、陽性と検出できた割合。
F1スコアF1 score適合率と再現率の調和平均。
混同行列confusion matrix実際のクラスと予測クラスの組み合わせ別に件数を示す表。
特徴量重要度feature importanceモデルの予測に対する各入力の重要性を、特定の方法で評価した値。
不確かさの定量化uncertainty quantification(UQ)予測や推定の不確かさを数値・分布などで表すこと。
内挿interpolation既知データの範囲内にある条件で値を推定すること。
外挿extrapolation既知データの範囲外にある条件で値を推定すること。

使い方の例
We report both RMSE and R-squared on the test set.
日本語:テストデータに対するRMSEと決定係数の両方を報告します。

関連する解説:scikit-learn:回帰・分類の評価

8.生成AI・大規模言語モデルの英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • 生成AI → generative AI
  • 大規模言語モデル → large language model(LLM)
  • 基盤モデル → foundation model
  • トランスフォーマー → Transformer
  • トークン → token
  • 埋め込み → embedding
  • プロンプト → prompt
  • ファインチューニング → fine-tuning
  • 検索拡張生成 → retrieval-augmented generation(RAG)
  • ハルシネーション → hallucination

各用語の意味・使う場面

日本語英語・略語意味・使う場面
生成AIgenerative AI文章・画像・構造など、新しい内容を生成するAI。
大規模言語モデルlarge language model(LLM)大量の言語データなどから学習した、大規模な言語処理モデル。
基盤モデルfoundation model幅広い課題への応用を想定して事前学習されたモデル。
トランスフォーマーTransformer注意機構を主要な構成要素とするモデル構造。
トークンtokenモデルが扱う文字列などの単位。単語や単語の一部など。
埋め込みembedding単語・文章・材料などを数値ベクトルで表現したもの。
プロンプトprompt生成AIに与える指示や文脈などの入力。
ファインチューニングfine-tuning事前学習済みモデルを追加データで学習させること。
検索拡張生成retrieval-augmented generation(RAG)検索で取り出した情報を生成時の文脈に加える仕組み。
ハルシネーションhallucination事実や与えられた根拠と整合しない内容が生成される現象。

使い方の例
We used retrieval-augmented generation to answer questions about technical documents.
日本語:技術文書に関する質問への回答に、検索拡張生成を使用しました。

関連する解説:Google:機械学習・生成AI用語集

9.マテリアルズインフォマティクス・材料表現の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • マテリアルズインフォマティクス → materials informatics(MI)
  • 記述子 → descriptor
  • 分子フィンガープリント → molecular fingerprint
  • SMILES表記 → Simplified Molecular Input Line Entry System(SMILES)
  • 組成 → composition
  • 配合・処方 → formulation
  • プロセス条件 → processing conditions
  • 材料物性 → material properties
  • 構造物性相関 → structure–property relationship
  • 逆設計 → inverse design

各用語の意味・使う場面

日本語英語・略語意味・使う場面
マテリアルズインフォマティクスmaterials informatics(MI)データ科学などを用いて材料の理解・探索・設計を進める分野。
記述子descriptor材料や分子の特徴を表す数値など。モデルの特徴量として使える。
分子フィンガープリントmolecular fingerprint分子の部分構造などをビット列や数値列で表したもの。
SMILES表記Simplified Molecular Input Line Entry System(SMILES)分子構造を文字列で表す記法。
組成composition材料を構成する成分やその比率。
配合・処方formulation複数の原料を組み合わせた設計。配合比などを含む。
プロセス条件processing conditions温度・時間・圧力など、製造や加工時の条件。
材料物性material properties強度・導電率・粘度など、材料の性質。
構造物性相関structure–property relationship構造と物性の間の関係。
逆設計inverse design目標の物性・機能から、候補となる構造や組成などを求める考え方。

使い方の例
Our goal is to identify formulations with high thermal conductivity.
日本語:目標は、熱伝導率の高い配合を見つけることです。

関連する解説:RDKit:分子表現・フィンガープリント

10.材料探索・ベイズ最適化・実験自動化の英語一覧

用語の早見リスト(日本語 → 英語・略語)

  • ベイズ最適化 → Bayesian optimization(BO)
  • 代理モデル → surrogate model
  • 獲得関数 → acquisition function
  • 目的関数 → objective function
  • 探索空間 → search space / design space
  • 制約条件 → constraint
  • 多目的最適化 → multi-objective optimization
  • パレートフロント → Pareto front
  • 能動学習 → active learning(AL)
  • クローズドループ → closed loop

各用語の意味・使う場面

日本語英語・略語意味・使う場面
ベイズ最適化Bayesian optimization(BO)予測とその不確かさを利用して、評価する次の条件を選ぶ最適化。
代理モデルsurrogate model実験や高コストな計算の入出力関係を近似するモデル。
獲得関数acquisition function次に評価する候補を選ぶための指標。
目的関数objective function最適化で最大化または最小化したい値を返す関数。
探索空間search space / design space候補として検討する条件や設計の集合。
制約条件constraint配合比の合計、上限温度など、候補が満たす条件。
多目的最適化multi-objective optimization強度向上とコスト低減など、複数の目的を扱う最適化。
パレートフロントPareto frontある目的を改善すると他が悪化する、非劣な解の目的値の集合。
能動学習active learning(AL)学習に役立つ次のデータを選び、追加取得する方法。
クローズドループclosed loop提案・実験・評価・モデル更新をつなぎ、繰り返す仕組み。

使い方の例
Bayesian optimization was used to select the next experimental conditions.
日本語:次の実験条件を選ぶためにベイズ最適化を使用しました。

関連する解説:Frazier:ベイズ最適化の解説

実験とAIを接続するclosed loopの具体例として、NIMSの研究者らによる実験自動化ソフトウェアの報告があります。NIMS-OS:AIとロボット実験をつなぐソフトウェア

混同しやすい英語の使い分け|研究で迷いやすい6組

1.feature・descriptor・explanatory variable

featureはモデルへの入力、descriptorは材料や分子を表す情報、explanatory variableは結果を説明する変数、という視点で使い分けると整理できます。

例えば、分子量というdescriptorをモデルに入力すれば、それはfeatureでもあります。温度や保持時間もfeatureになります。材料の特徴を数値化する話ではdescriptor、入力データ全体を説明するときはinput featuresが使いやすい表現です。

例:Molecular descriptors were used as input features.
分子記述子を入力特徴量として使用しました。

2.target variableとobjective function

予測したい測定値がtarget variable、最適化で改善したい評価の関数がobjective functionです。

例えば「組成から引張強度を予測する」モデルなら、引張強度がtarget variableです。一方、「コストを考慮しながら高強度な配合を探す」最適化では、強度とコストを組み合わせた評価値を返す関数をobjective functionにすることがあります。

例:The target variable is tensile strength. The objective function also includes a cost penalty.
目的変数は引張強度です。目的関数にはコストに対するペナルティも含めています。

3.accuracy・precision・recall

分類の評価では、accuracyは全体の正解率、precisionは陽性と判断した結果の確かさ、recallは実際の陽性を拾えた割合です。

架空の不良品検出を例にします。100個のうち実際の不良品が10個あり、モデルは8個を不良品と予測。そのうち6個が本当の不良品だったとします。

指標計算結果
Accuracy(正しく検出した不良品6個+正しく判定した良品88個)÷100個94%
Precision正しく検出した不良品6個÷不良品と予測した8個75%
Recall正しく検出した不良品6個÷実際の不良品10個60%

「見逃しを減らしたい」ならrecall、「不良と判定して除外する判断の確かさを上げたい」ならprecisionに注目すると、評価を目的に結び付けられます。測定の文脈でprecisionが出てきた場合は、繰り返し測定の値のそろい方を指すため、分類の適合率と文脈を分けて読みましょう。

4.standard deviation・standard error・confidence interval

SDは個々の値のばらつき、平均のSEは平均の推定のばらつき、CIは推定の不確かさを示す区間です。グラフのエラーバーを説明するときは、どれを示したかを明記すると伝わります。

95% CIという表現は、同じ手順で標本抽出と区間推定を繰り返したとき、長期的に約95%の区間が真の値を含む性質に対応します。NISTの信頼区間の解説

5.statistically significantとpractically important

statistically significantは「統計的に有意」、practically importantは「実用上重要」です。材料開発では、差の有無と、製品性能として役立つ差の大きさを組み合わせて説明すると、研究の価値が伝わりやすくなります。

例:We evaluated both statistical significance and practical importance.
統計的有意性と実用上の重要性の両方を評価しました。

6.sample・specimen・batch

sampleは試料や標本など広い場面で使います。specimenは、引張試験片など試験に供する対象を具体的に指す際に便利です。batchは、一度の製造・調製で得たまとまりを表せます。

例:We tested five specimens from each batch.
各バッチから5本の試験片を試験しました。

機械学習のmini-batchは、学習の一度の更新に使うデータのまとまりです。同じbatchでも、製造工程と学習手順では対象が変わります。

材料研究の流れを英語で説明する例

用語を覚えたら、「データを集める→モデルを作る→次の実験を選ぶ」の流れでつなげてみましょう。以下は、高分子材料の配合探索を想定した説明例です。

We collected data on polymer composition, processing conditions, and tensile strength. We used composition and processing conditions as input features, with tensile strength as the target variable. We trained a Gaussian process regression model and evaluated it using cross-validation. We then used Bayesian optimization to select promising formulations for the next experiments. The new experimental results were added to the dataset to update the model.

日本語訳:高分子の組成、プロセス条件、引張強度のデータを収集しました。組成とプロセス条件を入力特徴量とし、引張強度を目的変数としました。ガウス過程回帰モデルを学習させ、交差検証で評価しました。その後、ベイズ最適化を使って、次の実験で検討する有望な配合を選びました。新たな実験結果はデータセットに追加し、モデルを更新しました。

ご自身のテーマに合わせるときは、tensile strengthをthermal conductivity(熱伝導率)やionic conductivity(イオン伝導率)に、polymer compositionをcatalyst composition(触媒組成)などに置き換えられます。手法名や評価方法は、実際に行った内容に合わせて調整してください。

打ち合わせで使いやすい質問

確認したいこと英語日本語訳
入力What features did you use?どの特徴量を使いましたか?
予測対象What is the target variable?目的変数は何ですか?
評価How did you split the data for evaluation?評価のためにデータをどのように分割しましたか?
不確かさHow did you quantify predictive uncertainty?予測の不確かさをどのように定量化しましたか?
次の実験How did you select the next experimental conditions?次の実験条件をどのように選びましたか?

統計・AI・MIの英語に関するよくある疑問

マテリアルズインフォマティクスは英語でどう書く?

materials informaticsと書き、MIと略します。materialsの末尾にsが付きます。初出でmaterials informatics (MI)と示すと、その後は略語で説明しやすくなります。

「統計解析」と「データ解析」は同じ英語?

統計解析はstatistical analysis、データ解析はdata analysisです。統計的な推定や検定を強調するなら前者、データ整理や可視化なども含めて広く説明するなら後者が使いやすい表現です。

「予測精度が高い」はどう言えばよい?

広くはThe model makes accurate predictions.(このモデルは精度の高い予測を行います)と表現できます。回帰の研究発表では、The model achieved a low RMSE on the test set.(テストデータで低いRMSEを達成しました)のように、指標と評価対象を具体化すると、より明確です。

略語はそのまま使ってよい?

初めて使う場所で正式名称を示すと、分野の異なる相手にも伝わります。例えばCVは、機械学習ではcross-validation、統計ではcoefficient of variation(変動係数)、電気化学ではcyclic voltammetry(サイクリックボルタンメトリー)を指すことがあります。

まずどの用語から覚えるとよい?

材料研究でモデルを説明するなら、feature、target variable、training data、cross-validation、RMSE、descriptor、composition、material properties、Bayesian optimization、acquisition functionの10語から始めると、入力・予測・評価・探索の流れを説明しやすくなります。

研究発表の英語も合わせて確認する

参考資料

用語の確認には、統計・機械学習の公式ドキュメント、分子情報処理ツールの公式資料、研究論文を参照しました。表の説明は研究開発での使い方を念頭に、短く整理しています。