個別授業

モデルプラン:【特別】110分×12回

機械学習の基礎(R,Python実習込)

公開日

2021年7月16日

更新日

2026年7月26日

機械学習の基礎|「訓練データで正解率100%」はよいモデルではない

手元のデータで完璧に当たるモデルができたとき、喜ぶ前に疑ったほうがよい理由があります。過去問を丸暗記した状態と同じで、本番では崩れるからです。この講座では汎化性能という考え方を軸に、機械学習の勘所をRやPythonの実習とともに学びます。

受講内容

この講座では、機械学習をライブラリの使い方としてではなく、「まだ見ていないデータで当てるにはどうすればよいか」という問いから組み立てます。

初学者がまず出会う壁が過学習です。データの点をすべて通るような複雑なモデルを作れば、手元の正解率は100%になります。しかしそのモデルは、データに含まれていた偶然のゆらぎまで覚え込んでいます。新しいデータを与えると、途端に外れる。逆に単純すぎるモデルは、手元のデータにすら合いません。ちょうどよい複雑さを選ぶこと、そしてそれを判断するために検証用データを分けておくこと――この二つが、機械学習の入口でいちばん大切な考え方です。

単純すぎるモデル・ちょうどよいモデル・過学習したモデルを並べて汎化性能を説明した図解

授業では、線形回帰とロジスティック回帰から始めて、決定木、ランダムフォレスト、サポートベクターマシン、ニューラルネットワークへと進みます。あわせて、学習データと検証データの分け方、交差検証、正則化、混同行列や適合率・再現率といった評価指標を扱います。教師なし学習としてクラスタリングや次元削減も取り上げます。RあるいはPythonで実際に手を動かしながら、数式の意味と出力の読み方を一つずつ結びつけていきます。

この講座が効いてくる場面

  • 需要予測・離反予測
    売上や来店数の予測、解約しそうな顧客の抽出といった業務に直結します。予測の当たり外れをどう評価するかまで含めて設計できるようになります。
  • AI導入の意思決定
    自分でモデルを作らない立場でも、外部の提案を評価する力が身につきます。「その正解率は何のデータで測ったものですか」と問い返せることの価値は小さくありません。
  • 研究・論文への応用
    分野を問わず、機械学習を分析手法として使う研究が増えています。手法の選択理由と評価方法を説明できる形で身につけられます。

ここで扱う回帰・分類・評価の考え方は、深層学習や生成AIを理解するための共通の土台であり、統計検定準1級やG検定の範囲とも重なります。

なお、受講に前提知識は必要ありません。プログラミング未経験の方でも、環境づくりの一歩目からご一緒します。


よくある質問

Q.プログラミングの経験がまったくありません。
A.大丈夫です。PythonもRも、機械学習の部分は数行で書けます。インストールから一緒におこない、コードは写して動かすところから始めます。文法の学習が目的ではありませんので、必要な範囲だけを扱います。

Q.数学がどの程度必要になりますか。
A.目的によります。手法を選んで使うだけなら、平均・分散と一次関数の感覚で進められます。仕組みまで理解したい場合は微分と線形代数が効いてきますので、その場合は必要な分だけ並行して補います。

Q.正解率が高ければよいモデルということでよいのでしょうか。
A.そうとは限りません。100人に1人しか該当しない事象なら、全員を「該当しない」と答えるだけで正解率99%になります。何を重視するかによって適合率、再現率、F値などを使い分ける必要があり、その判断を授業で扱います。

Q.手元に使えるデータがありません。
A.公開データセットを使って進められますので、ご心配は不要です。もちろん業務のデータをお持ちいただければ、それを題材にすることもできます。

※内容はお客様のご要望等によって変更することがあります。

受講対象

・機械学習をライブラリ任せでなく理解して使いたい方
・需要予測や離反予測を業務で扱いたい方
・AI導入の提案を評価できるようになりたい方
・RやPythonでモデルを動かせるようになりたい方
・統計検定準1級やG検定の受験を考えている方

必要な数学知識

特別

モデルプラン

【110分×12回】

1) 機械学習の枠組み
2) 検証法と混同行列・ROC解析
3) 重回帰モデル
4) 正則化(L1,L2,Elastic Net等)
5) K近傍法
6) SVMとSVR
7) ナイーブベイズ分類
8) ニューラルネットワークモデル
9) 部分空間法
10) クラスタリング
11) アンサンブル学習
12) Kaggleに向けた手法など

参考テキスト

担当講師

※日程により一部講師が変わる事があります。

同じカテゴリーの個別授業

確率分布から学ぶ数学的なマーケティング手法

購買回数や来店間隔を確率分布で捉える講座。ポアソンと負の二項分布を軸に、予測と効果検証を学びます。

オペレーションズリサーチ(OR)の基礎

待ち行列・在庫管理・輸送計画など、現場の意思決定を数式で比べて改善するORの基礎を、身近な例から学びます。

最適化理論の基礎(Excel, Pythonなどの実習込)

限られた材料と時間の中で利益を最大にする考え方を、線形計画法からExcelソルバーとPythonの実習まで学びます。

Stanによるベイズ統計学習

Stanで確率モデルを書き、MCMCで事後分布を求める実践講座。収束の判定から結果の読み方まで扱います。

仮説検定の理論と実践(Excel, Rなどの実習込)

その差は偶然で説明できるのか。コイン投げの例から仮説検定の骨組みをたどり、有意差の正しい読み方と実行までを学びます。

医療統計学の基礎(R, SPSSなどの実習込)

リスク比・オッズ比・生存分析といった医療統計の基本を、RやSPSSの実習を交えながら意味から学び直します。

ベイズ統計学の基礎

精度の高い検査で陽性でも、病気とは限りません。事前の情報と新しいデータで確率を更新するベイズの考え方を学びます。

多変量解析の基礎(R,Python実習込)

原因をひとつに絞ると説明できない点が残ります。重回帰・主成分・クラスター分析で複数の要因を同時に扱う力をつけます。

機械学習の基礎(R,Python実習込)

訓練データで満点でも、よいモデルとは限りません。過学習と汎化性能を軸に、機械学習の考え方と実装を基礎から学びます。

統計学・データ分析のための大学数学

積分は面積、行列はデータの束。統計の理論を読むために必要な大学数学を、使いどころとセットで学び直す講座です。

統計学・データ分析のための高校数学

統計に必要な高校数学は全部ではありません。分散の式を分解し、指数・対数・数列など本当に効く数か所だけを学び直す講座です。

データの分析(中学)

平均が同じでも中身は違う。度数分布・箱ひげ図・四分位範囲で、データの散らばりを読む力をつける講座。

データの分析(高校)

相関が高い=原因、ではありません。分散・標準偏差・相関係数を自分で計算し、その数字の意味まで読める力をつける講座です。

CONTACTお問い合わせ

遠方に在住の方や自宅で講義を受けたい方はオンライン講座をご用意しております。よくある質問はこちら