概要 データサイエンティスト面接では、統計的思考、実験、機械学習、プロダクト理解、不完全な証拠から妥当な判断を導く力が評価されます。
面接官が評価すること
—
統計:信号と偶然を区別し、不確実性を正しく説明できるか。
—
実験:A/Bテストを設計・分析・批判的に評価し、過剰な結論を避けられるか。
—
機械学習:問題に適した目的、特徴量、モデル、評価を選べるか。
—
プロダクト理解:モデルを利用者行動、成果、意思決定へ結び付けられるか。
—
SQLとPython:現実のデータを正確かつ効率的に処理できるか。
—
評価:偏り、リーク、過学習、校正不良、ドリフト、展開リスクを特定できるか。
—
説明力:技術的な結果をプロダクト、開発、経営陣へ明確に伝えられるか。
優れたデータサイエンティストは結論の強さを調整する
証拠が弱いときに確実であるかのように語りません。仮定を明示し、不確実性を定量化し、限界を説明し、利用可能な証拠に基づく最善の次の行動を提案します。
データサイエンティストの選考プロセス 一般的な選考には、統計、実験、SQLまたはPython、プロダクト分析、機械学習、モデリングケース、行動面接が含まれます。
一般的な選考段階
1
採用担当者面談:職種の方向性、職位、業界、報酬、使用ツールを確認します。
2
採用責任者面談:プロジェクト、成果、モデリング、説明力を深掘りします。
3
SQL・Python面接:データ操作、結合、集計、pandas、実務的な実装を評価します。
4
統計・実験:確率、推論、仮説、A/Bテスト、指標を扱います。
5
機械学習面接:特徴量、モデル選択、学習、評価、展開、失敗を扱います。
6
プロダクト・事業ケース:指標を診断し、実験またはデータサイエンス解決策を提案します。
7
行動面接:当事者意識、曖昧さ、関係者、協働、倫理判断を評価します。
プロダクト系データサイエンティスト
機械学習系データサイエンティスト
主な重点
指標、実験、利用者行動、意思決定、プロダクト戦略
予測モデル、特徴量設計、評価、展開、監視
一般的な面接
SQL、A/Bテスト、プロダクトセンス、指標診断、因果推論
ML基礎、モデリングケース、Python、システム制約、評価
良い評価材料
曖昧な問いを信頼できる分析と提案へ変える
現実の条件で正しい問題を解くモデルを構築する
よくある誤り
指標が意思決定へどう影響するか説明しない
目的、データ品質、ベースラインの前に複雑なモデルを選ぶ
職種の重点領域を理解する
プロダクト系と機械学習系では面接内容が大きく異なります。求人、チーム、実際の業務に合わせて準備しましょう。
統計と確率 不確実性、標本、仮定、因果的な主張を、過度な精密さなしに厳密に扱う力が評価されます。
重要な統計概念
信頼区間
同じ標本抽出手順を繰り返したとき、一定割合で真の母数を含むように計算される区間です。
p値
帰無仮説が正しいと仮定したとき、観測結果以上に極端な結果が得られる確率です。帰無仮説が正しい確率ではありません。
統計的検出力
実在する効果を検出できる確率です。効果量、分散、標本数、有意水準に左右されます。
交絡変数
原因と結果の両方に影響し、二者の関係を歪める可能性がある変数です。
初級 · 統計
相関と因果関係の違いを説明してください。
回答の組み立て — 関連があっても原因とは限らない
相関は二つの変数がともに変化すること、因果は一方を変えると他方が変化することです。相関は交絡、逆因果、選択バイアス、偶然から生じることがあります。
最も強い因果証拠は通常、適切な無作為化から得られます。不可能な場合は、差の差、操作変数、マッチング、回帰不連続などを仮定を明示して使えます。研究設計が許す以上の主張をしないことが重要です。
想定される追加質問
実験なしで因果関係をどう調べますか?
交絡変数とは何ですか?
逆因果の例を挙げてください。
初級 · 統計
第1種過誤と第2種過誤の違いは何ですか?
回答の組み立て — 偽陽性と偽陰性
第1種過誤は、正しい帰無仮説を棄却する偽陽性で、許容上限をαで定めます。第2種過誤は、実在する効果を検出できない偽陰性で、その確率がβ、検出力が1 − βです。
どちらを重視するかは用途次第です。不正検知では偽陽性が正当な顧客へ摩擦を生み、偽陰性が損失を生みます。閾値、標本数、指標はそれぞれの費用を反映すべきです。
想定される追加質問
標本数は二つの過誤へどう影響しますか?
検出力とは何ですか?
より厳しいαを選ぶのはどのような場合ですか?
中級 · 確率
硬貨を10回投げて表が8回出ました。偏りのある硬貨ですか?
回答の組み立て — 帰無仮説 → 二項確率 → 証拠と不確実性
公平な硬貨なら表の回数はn = 10、p = 0.5の二項分布に従います。表が8回以上出ることは十分起こり得て、この小さな標本だけでは強い証拠になりません。両側検定なら反対方向に同程度以上極端な結果も考えます。
したがって10回だけで偏りがあるとは結論しません。p値またはpの信頼区間を示し、追加観測を勧めます。各試行の独立性と条件の安定性も仮定です。
想定される追加質問
正確なp値をどう計算しますか?
何回程度の試行が妥当ですか?
pの信頼区間はどのようになりますか?
実験と因果推論 厳密な設計、慎重な解釈、誤った結論の防止、証拠とプロダクト判断の接続が評価されます。
中級 · 実験
新しいランキングアルゴリズムのA/Bテストをどう設計しますか?
回答の組み立て — 仮説 → 単位 → 指標 → ガードレール → 期間 → 決定
関連性の高い内容が、多様性、遅延、長期継続率を損なわず満足度を高める、という仮説を置きます。繰り返し利用では体験を一定にするため利用者単位で無作為化し、ネットワーク効果があればクラスターまたはホールドアウトを検討します。
主要指標は目的に応じて、満足したセッション、転換、継続、売上などとします。クリック、滞在時間、保存を推進指標、遅延、苦情、多様性、公平性、解約をガードレールにします。必要標本数と週次変動を覆う期間を確保し、新奇性、セグメント、実務的な効果量まで確認して展開を判断します。
想定される追加質問
クリックが増えて継続率が下がったらどうしますか?
利用者間の干渉をどう扱いますか?
展開前にどのセグメントを確認しますか?
上級 · 実験
A/Bテストは全体では良好ですが、新規利用者には悪影響です。何を提案しますか?
回答の組み立て — 検証 → セグメントの信頼性 → 影響 → 展開戦略
まず標本数、信頼区間、セグメントが事前定義されたか、多重検定、分類の正確さを確認します。証拠が弱い部分群の結果だけで全体効果を覆すべきではありません。
悪影響が頑健なら原因を調べます。新規利用者にはより単純な初期設定や説明が必要かもしれません。戦略上重要な層なら全体展開せず、既存利用者に限定する、別の版を作る、オンボーディングを変えて再検証します。影響の大きさ、持続性、異質性、事業背景を合わせて判断します。
想定される追加質問
セグメント分析の偽陽性をどう防ぎますか?
セグメントが小さい場合はどうしますか?
次の実験をどう設計しますか?
上級 · 因果推論
A/Bテストではなく差の差法を使うのはいつですか?
回答の組み立て — 無作為化できない介入と、比較可能な対照トレンド
地域別公開、制度、価格変更など無作為化できない場合に有効です。介入群の変化を、同時期の対照群の変化と比較します。
中心的な仮定は、介入がなければ両群が平行な傾向をたどったことです。そのため介入前の推移を確認し、比較可能な対照を選びます。カナダだけで機能を公開した場合、米国が季節性や外部要因を適切に表すなら、両国の継続率変化の差から効果を推定できます。無作為化より因果主張は慎重にします。
想定される追加質問
平行トレンドをどう確認しますか?
どのような要因で手法が無効になりますか?
対照群をどう選びますか?
機械学習の質問 問題設定、妥当なベースライン、特徴量設計、評価、本番での失敗原因が評価されます。
中級 · 機械学習
解約を予測するモデルをどう構築しますか?
回答の組み立て — ラベル定義 → 特徴量 → ベースライン → 評価 → 安全な展開
解約と予測時点を定義します。たとえば現在の利用者が今後30日以内に解約または更新しないことです。学習データは一貫した基準日で作ります。利用量、直近性、機能採用、問い合わせ、支払い、プラン、利用歴、傾向、ダウングレードを特徴量にでき、予測時点後の情報はリークです。
ロジスティック回帰または勾配ブースティング木から始め、AUC、適合率、再現率、校正、上位デシルのリフト、施策の事業価値を評価します。解約が少ない場合、正解率は有用ではありません。本番ではドリフト、セグメント、公平性と、対象者を実際に引き留められるかを監視します。
想定される追加質問
ラベルリークになる情報は何ですか?
適合率と再現率のどちらを最適化しますか?
事業価値をどう証明しますか?
初級 · 機械学習
過学習と、その防止方法を説明してください。
回答の組み立て — 学習データへの適合と、未知データへの一般化
過学習は、一般化できる規則ではなく学習データのノイズや固有性を覚え、学習時には良好でも未知データで悪化する状態です。
適切な学習・検証・テスト分割、交差検証、正則化、単純なモデル、枝刈り、早期終了、ドロップアウト、追加データ、統制されたハイパーパラメータ調整で防ぎます。リークも異常に良い性能に見え、本番で失敗します。時系列や行動データでは時間順を守って分割します。
想定される追加質問
過学習をどう検出しますか?
検証データとテストデータはどう違いますか?
一つのモデルが過少学習と過学習を同時に示すことはありますか?
中級 · 機械学習
ロジスティック回帰とRandom Forestをどう選びますか?
回答の組み立て — 解釈性、非線形性、データ、性能、展開条件
ロジスティック回帰は高速で解釈しやすく、校正もしやすい二値分類の強い基準です。データが少ない、関係が概ね線形、説明責任が重要な場合に適します。
Random Forestは手動指定を抑えて非線形性と相互作用を捉えますが、大きく解釈しにくく、学習分布外に弱い場合があります。同じ分割と指標で比較し、校正、推論費用、事業制約も含めます。複雑さが意味ある改善を生まなければ単純な方を選びます。
想定される追加質問
Random Forestの個別予測をどう説明しますか?
正解率より解釈性が重要なのはいつですか?
勾配ブースティングの方が優れる可能性があるのはなぜですか?
上級 · 評価と本番運用
オフラインでは良好なモデルが本番で悪化しました。何が起きた可能性がありますか?
回答の組み立て — データ差 → リーク → 不適切な指標 → ドリフト → 実装 → フィードバックループ
オフラインデータが本番を代表していない、学習・提供のずれ、時系列リーク、目的指標の不一致、利用者・季節・経路・価格・在庫のドリフトが考えられます。モデルの判断自体が将来データを変えることもあります。
特徴量欠損、異なる既定値、タイムアウト、古い特徴量、誤った閾値や版など実装不良も一般的です。オフラインとオンラインの分布、予測、校正、セグメント別性能、ログ、事業成果を比較し、ロールバック、閾値調整、処理修正、再学習、目的変更を判断します。
想定される追加質問
学習・提供のずれとは何ですか?
モデルドリフトをどう監視しますか?
推薦のフィードバックループはどう生まれますか?
モデル評価と指標 高い正解率も、指標が事業課題を表していなければ役に立ちません。評価には誤りの費用と利用状況を反映させます。
分類
ランキングと推薦
一般的な指標
適合率、再現率、F1、AUC、対数損失、校正
NDCG、MAP、MRR、ヒット率、網羅性、多様性、オンライン利用
主なリスク
クラス不均衡によって正解率が誤解を招く
オフラインの関連性が満足度と一致するとは限らない
事業との接続
閾値に偽陽性と偽陰性の費用を反映する
関連性、鮮度、多様性、公平性、遅延を均衡させる
中級 · モデル評価
適合率と再現率をどのように使い分けますか?
回答の組み立て — 偽陽性の費用と偽陰性の費用を比較する
偽陽性の費用が高い場合は適合率を重視します。たとえば不正検知が正当な顧客を止める場合です。陽性を見逃す害が大きい医療スクリーニングや重大な不正では再現率が重要です。
実際には両者のトレードオフがあります。事業費用、運用能力、利用者への害、後続処理に基づいて閾値を選び、クラス不均衡がある場合は単一点ではなく適合率・再現率曲線を確認します。
想定される追加質問
希少事象で正解率が誤解を招くのはなぜですか?
閾値をどう選びますか?
不正検知にはどの指標を使いますか?
中級 · モデル評価
モデルの校正とは何で、なぜ重要ですか?
回答の組み立て — 順位だけでなく確率の品質を評価する
校正されたモデルでは、0.8と予測された事例の約80%が実際に陽性になります。確率がリスク、価格、振り分け、審査待ち行列、期待値を決める場合に重要です。順位付けが良くても校正が悪いモデルはあります。
信頼度曲線とBrierスコアを確認し、Platt scaling、等張回帰、temperature scalingを使えます。検証には本番に近いデータを使います。純粋な順位付けでは、解釈されるリスクスコアほど完全な校正は重要でない場合があります。
想定される追加質問
AUCが高く校正が悪いモデルはありますか?
校正をどう改善しますか?
校正が事業判断へ影響するのはいつですか?
SQLとPythonの質問 優れたモデリングにも、正しい抽出、変換、検証、探索的分析が必要です。
中級 · SQLとコホート
登録コホート別の月次継続率を計算するSQLを書いてください。
回答の組み立て — コホート月 → 活動月 → 月差 → 集計
一つのCTEに各利用者と登録月、別のCTEに各利用者と有効な活動月を置きます。結合後に月差を求め、コホートと月差ごとの一意アクティブ利用者を数えます。分母は初期コホート人数で、LEFT JOINにより活動のない月も残します。
活動、試験利用者、タイムゾーン、月境界を定義します。同じ利用者の同月内の複数イベントは一度だけ数えます。結果は登録月と継続月の行列にします。
想定される追加質問
ローリング継続率をどう計算しますか?
コホートをどう可視化しますか?
遅れて到着する活動データをどう扱いますか?
初級 · PYTHONと探索的分析
Pythonでデータセットの欠損値をどう分析しますか?
回答の組み立て — 定量化 → 分類 → 原因特定 → 処理選択
df.isna().sum()やmean()などで列ごとの件数、割合、型を算出し、日付、情報源、端末、地域、目的変数で分けます。任意項目、計測不良、非対応端末、対象外など、欠損の原因を理解することが重要です。
原因に応じて、不明を一カテゴリとして残す、補完する、除外する、情報源を修正します。補完方法は学習データだけで学習し、検証・テストへ適用します。欠損自体が予測力を持つ場合もありますが、公平性や規制リスクを生むこともあります。
想定される追加質問
欠損自体が情報になるのはいつですか?
補完時のリークをどう防ぎますか?
目的ラベルが欠損している場合はどうしますか?
中級 · PYTHONと統計
外れ値をどう検出し、いつ除外しますか?
回答の組み立て — 検出 → 原因調査 → 事業上の意味で判断
分布、箱ひげ図、zスコア、IQR、百分位、モデル型手法で候補を見つけ、元レコード、情報源、時点、セグメントを調べます。負の年齢は誤りでしょうが、非常に大きな法人購入は正当で売上上重要かもしれません。
正当な外れ値には変換、winsorization、頑健なモデル、専用セグメントを使えます。不可能な値、重複、計測不良、試験アカウント、対象外データだけを明確な理由で除外します。正当な外れ値が結論を左右するなら、含む場合と除く場合の感度を示します。
想定される追加質問
winsorizationとは何ですか?
外れ値は線形回帰へどう影響しますか?
外れ値自体が主要な信号になるのはいつですか?
プロダクト分析と事業ケース 曖昧なプロダクト上の問いを、指標、分析、実験、意思決定へ変える力を確認します。
中級 · プロダクト分析
推薦機能でクリックが増え、購入が減りました。どうしますか?
回答の組み立て — 指標品質 → ファネル → セグメント → 原因 → 対応
クリックは弱い代理指標かもしれません。結果を検証し、表示、クリック、カート、購入手続き、購入、返金、再訪を確認します。好奇心を生む一方で購入を妨げている可能性があります。
利用者種別、経路、カテゴリ、端末、表示場所で分け、関連性、価格、在庫、配送、多様性、遅延、設計を調べます。クリック率だけで展開してはいけません。原因に応じて戻す、健全なセグメントへ限定する、目的を下流の購入品質へ変えます。
想定される追加質問
主要指標には何を選びますか?
推薦品質をどう測定しますか?
売上が増えて購入件数が減ったらどうしますか?
上級 · プロダクト分析
マーケットプレイスの健全性をどう測りますか?
回答の組み立て — 流動性 → 品質 → 均衡 → 継続 → ユニットエコノミクス
中心は流動性です。需要が適切な供給を速く見つけ、供給が十分な需要を得られるかを見ます。配車なら成立率、待ち時間、取消、稼働率、専門サービスなら適格提案、採用、完了、再利用などです。
地域、カテゴリ、時間、コホート、供給水準、需要意図で分けます。平均は局所的な不均衡を隠します。安全、不正、品質、返金、両側の解約、ユニットエコノミクスをガードレールにします。供給と需要のどちらが不足するかで施策は変わります。
想定される追加質問
立ち上げ時の鶏と卵の問題をどう解決しますか?
どちら側が制約か、どう見つけますか?
経営陣へ毎週どの指標を示しますか?
中級 · プロダクト指標
語学アプリのノーススター指標をどう定義しますか?
回答の組み立て — ユーザー価値 → 継続行動 → 学習成果 → ガードレール
空虚な利用量ではなく、持続的な学習を表す必要があります。十分な正答率で実質的なレッスンを終えた週次学習者数や、品質で重み付けした学習時間などが候補です。入力はレッスン、復習、発話練習、進度、結果は継続、有料転換、測定可能な習熟です。
疲労、急いだ完了、不正、通知停止、解約をガードレールにします。プロダクトと学習専門家とともに、指標が実際の進歩と長期継続を予測するか検証します。
想定される追加質問
DAUではなぜ不十分ですか?
指標の攻略をどう防ぎますか?
ライト利用者と熱心な利用者でどう変えますか?
モデリングケース 問題、ラベル、特徴量、ベースライン、評価、展開、監視、事業価値までの一連の判断が評価されます。
上級 · モデリングケース
オンライン決済の不正を検出するモデルを設計してください。
回答の組み立て — 目的 → ラベル → 特徴量 → 指標 → 介入 → 監視
不正と取る行動を定義します。遮断、審査、追加認証、リスク点数のどれかです。ラベルにはチャージバック、確認済み案件、通報を使えますが、遅れて到着し誤りも含みます。金額、加盟店、端末、地域、口座年齢、取引速度、支払履歴、失敗回数、過去の異議申立てを特徴量にできます。
ルールと単純な基準から始め、ロジスティック回帰、勾配ブースティング、ラベルが弱ければ異常検知を比較します。適合率・再現率、一定審査能力での再現率、偽陽性、不正検出額、校正を評価します。本番ではドリフト、攻撃者の適応、公平性、遅延、審査能力、フィードバックループ、ロールバックを監視します。
想定される追加質問
遅れて届くラベルをどう扱いますか?
偽陽性の費用は何ですか?
不正行為者はモデルへどう適応しますか?
上級 · モデリングケース
配達時間を予測するモデルを構築してください。
回答の組み立て — 目的定義 → 利用可能な特徴量 → 指標 → 校正 → 利用者への影響
注文確定から配達までの総時間、または調理、配達員割当、受取、移動、引渡しへ分けて定義します。注文時点で利用できる店舗、時刻、曜日、天候、距離、配達員数、滞留、過去の調理時間、交通、注文量、地域を特徴量にします。予測後にしか分からない情報はリークです。
MAEは理解しやすい一方、過小予測は過大予測より悪影響が大きい場合があります。約束する時間帯には校正が重要です。店舗、地域、時間、コホート別に監視し、特徴量の鮮度、新規店舗、休日、天候、表示ETAが行動を変える影響も考慮します。
想定される追加質問
総時間と構成要素のどちらをモデル化しますか?
新規店舗をどう扱いますか?
過大予測と過小予測のどちらが悪いですか?
計算例
モデリングケースの構成
無料試用から有料プランへの転換を予測するモデルを設計します。
目的を定式化
予測時点と、試用開始後14日または30日以内の転換などのラベルを定義します。
特徴量を選択
アクティベーション、利用量、機能採用、招待、経路、端末、企業情報、問い合わせなど予測前の情報だけを使います。
ベースラインを定義
単純なルールまたはロジスティック回帰から始め、非線形性に価値がある場合に木モデルと比較します。
実務価値を評価
オフラインAUCだけでなく、上位デシルのリフト、校正、施策による増分転換を最適化します。
結果
目的、データ、モデリング、評価、事業利用を一貫して判断できる回答になります。
行動・コミュニケーションの質問 曖昧さ、影響力、技術説明、成果、倫理判断、望ましくない結果への対応を扱います。
中級 · 行動面接
事業成果を生んだデータサイエンス案件について教えてください。
回答の組み立て — 課題 → 手法 → 意思決定 → 影響 → 学び
意思決定、製品、業務、指標を変えた案件を選びます。事業課題の後に、データ、手法、検証、トレードオフを相手に合う深さで説明します。
解約モデルで対応対象を優先した、実験結果で公開方法を変えた、など行動との接続が重要です。売上、解約、時間、費用、意思決定速度で成果を定量化し、限界とその後の改善も説明します。ツールより、正確性、信頼、採用、成果が重要です。
想定される追加質問
成果をどう測定しましたか?
最も難しい技術課題は何でしたか?
関係者の支持をどう得ましたか?
中級 · コミュニケーション
複雑なモデルを技術に詳しくない関係者へどう説明しますか?
回答の組み立て — 意思決定 → 直感 → 証拠 → 限界 → 行動
構成ではなく意思決定から始めます。何を予測し、どの信号を使い、どの程度機能し、どこで信頼すべきでないかを日常語で説明します。例、理由コード、校正、単純なトレードオフ図が役立ちます。
不確実性、データ品質、偏り、ドリフト、境界ケースを明示します。最後に点数を行動へ結び付けます。たとえばリスク上位10%へ継続施策を行い、その増分効果は別途実験します。
想定される追加質問
相手が正解率だけを気にする場合はどうしますか?
不確実性をどう伝えますか?
複雑なモデルを避けるのはいつですか?
上級 · 行動面接
分析結果が関係者の期待と反した経験を教えてください。
回答の組み立て — 期待 → 証拠 → 説明 → 意思決定 → 結果
相手の期待、確認したデータ、反対の結果を信頼できるものにした検証を説明します。伝える際は相手の目標を認め、証拠と不確実性を明示し、小規模テスト、別の対象、追加測定などの代案を示します。
目的は議論に勝つことではなく判断を改善することです。採用された対応と、提案が受け入れられなかった場合も含め、影響力、信頼、説明について学んだことを述べます。
想定される追加質問
関係をどう守りましたか?
経営陣が同意しない場合はどうしますか?
分析の信頼性をどう高めましたか?
データサイエンティスト面接の準備戦略 統計、実験、SQL、Python、機械学習、プロダクトケース、案件経験を組み合わせ、対象職種に応じて比重を変えます。
6週間の準備プラン
1
第1週:分布、標本、区間、検定、p値、検出力、偏り、分散、因果推論の落とし穴。
2
第2週:A/B設計、指標、ガードレール、標本数、セグメント、多重検定、結果説明。
3
第3週:SQLのコホートとファネル、pandas、欠損、結合、特徴量、探索的分析。
4
第4週:分類、回帰、正則化、木、ブースティング、校正、リーク、ドリフト。
5
第5週:解約、不正、推薦、価格、ランキング、予測、マーケットプレイス。
6
第6週:模擬面接と、成果・トレードオフを含む4〜6件の案件経験。
職種の重点別の準備
—
プロダクト系:SQL、実験、因果推論、指標、ファネル、継続率、提案。
—
応用ML:特徴量、モデル選択、オフライン・オンライン評価、展開、監視、目的設定。
—
マーケティング:アトリビューション、増分性、LTV、CAC、アップリフト、実験、経路。
—
リスク・不正:クラス不均衡、適合率・再現率、遅延ラベル、敵対的行動、説明可能性。
—
研究:統計の深さ、仮定、実験設計、論文議論、技術説明。
モデルの複雑さから始めない
正しい問題に対する単純なモデルは、誤った問題に対する複雑なモデルを上回ります。最初に意思決定、ラベル、ベースライン、指標、失敗例を定義します。
要点
優れた回答は、統計的厳密さ、モデリング判断、プロダクト理解、説明力を両立します。すべてのアルゴリズムを知ることではなく、不確実性の中でより良い意思決定にデータサイエンスを使うことが目的です。