面接質問
データサイエンティストの面接質問
統計、確率、実験、因果推論、機械学習、モデル評価、SQL、Python、プロダクトに関する質問を練習できます。 この質問リストと完全版ガイドを併せて活用してください: データサイエンティスト面接ガイド.
23問
8カテゴリー
データサイエンティスト
更新:2026年5月
統計と確率
不確実性、標本、仮定、因果的な主張を、過度な精密さなしに厳密に扱う力が評価されます。
回答の組み立て — 関連があっても原因とは限らない
相関は二つの変数がともに変化すること、因果は一方を変えると他方が変化することです。相関は交絡、逆因果、選択バイアス、偶然から生じることがあります。 最も強い因果証拠は通常、適切な無作為化から得られます。不可能な場合は、差の差、操作変数、マッチング、回帰不連続などを仮定を明示して使えます。研究設計が許す以上の主張をしないことが重要です。
想定される追加質問
実験なしで因果関係をどう調べますか?
交絡変数とは何ですか?
逆因果の例を挙げてください。
回答の組み立て — 偽陽性と偽陰性
第1種過誤は、正しい帰無仮説を棄却する偽陽性で、許容上限をαで定めます。第2種過誤は、実在する効果を検出できない偽陰性で、その確率がβ、検出力が1 − βです。 どちらを重視するかは用途次第です。不正検知では偽陽性が正当な顧客へ摩擦を生み、偽陰性が損失を生みます。閾値、標本数、指標はそれぞれの費用を反映すべきです。
想定される追加質問
標本数は二つの過誤へどう影響しますか?
検出力とは何ですか?
より厳しいαを選ぶのはどのような場合ですか?
回答の組み立て — 帰無仮説 → 二項確率 → 証拠と不確実性
公平な硬貨なら表の回数はn = 10、p = 0.5の二項分布に従います。表が8回以上出ることは十分起こり得て、この小さな標本だけでは強い証拠になりません。両側検定なら反対方向に同程度以上極端な結果も考えます。 したがって10回だけで偏りがあるとは結論しません。p値またはpの信頼区間を示し、追加観測を勧めます。各試行の独立性と条件の安定性も仮定です。
想定される追加質問
正確なp値をどう計算しますか?
何回程度の試行が妥当ですか?
pの信頼区間はどのようになりますか?
実験と因果推論
厳密な設計、慎重な解釈、誤った結論の防止、証拠とプロダクト判断の接続が評価されます。
回答の組み立て — 仮説 → 単位 → 指標 → ガードレール → 期間 → 決定
関連性の高い内容が、多様性、遅延、長期継続率を損なわず満足度を高める、という仮説を置きます。繰り返し利用では体験を一定にするため利用者単位で無作為化し、ネットワーク効果があればクラスターまたはホールドアウトを検討します。 主要指標は目的に応じて、満足したセッション、転換、継続、売上などとします。クリック、滞在時間、保存を推進指標、遅延、苦情、多様性、公平性、解約をガードレールにします。必要標本数と週次変動を覆う期間を確保し、新奇性、セグメント、実務的な効果量まで確認して展開を判断します。
想定される追加質問
クリックが増えて継続率が下がったらどうしますか?
利用者間の干渉をどう扱いますか?
展開前にどのセグメントを確認しますか?
回答の組み立て — 検証 → セグメントの信頼性 → 影響 → 展開戦略
まず標本数、信頼区間、セグメントが事前定義されたか、多重検定、分類の正確さを確認します。証拠が弱い部分群の結果だけで全体効果を覆すべきではありません。 悪影響が頑健なら原因を調べます。新規利用者にはより単純な初期設定や説明が必要かもしれません。戦略上重要な層なら全体展開せず、既存利用者に限定する、別の版を作る、オンボーディングを変えて再検証します。影響の大きさ、持続性、異質性、事業背景を合わせて判断します。
想定される追加質問
セグメント分析の偽陽性をどう防ぎますか?
セグメントが小さい場合はどうしますか?
次の実験をどう設計しますか?
回答の組み立て — 無作為化できない介入と、比較可能な対照トレンド
地域別公開、制度、価格変更など無作為化できない場合に有効です。介入群の変化を、同時期の対照群の変化と比較します。 中心的な仮定は、介入がなければ両群が平行な傾向をたどったことです。そのため介入前の推移を確認し、比較可能な対照を選びます。カナダだけで機能を公開した場合、米国が季節性や外部要因を適切に表すなら、両国の継続率変化の差から効果を推定できます。無作為化より因果主張は慎重にします。
想定される追加質問
平行トレンドをどう確認しますか?
どのような要因で手法が無効になりますか?
対照群をどう選びますか?
機械学習の質問
問題設定、妥当なベースライン、特徴量設計、評価、本番での失敗原因が評価されます。
回答の組み立て — ラベル定義 → 特徴量 → ベースライン → 評価 → 安全な展開
解約と予測時点を定義します。たとえば現在の利用者が今後30日以内に解約または更新しないことです。学習データは一貫した基準日で作ります。利用量、直近性、機能採用、問い合わせ、支払い、プラン、利用歴、傾向、ダウングレードを特徴量にでき、予測時点後の情報はリークです。 ロジスティック回帰または勾配ブースティング木から始め、AUC、適合率、再現率、校正、上位デシルのリフト、施策の事業価値を評価します。解約が少ない場合、正解率は有用ではありません。本番ではドリフト、セグメント、公平性と、対象者を実際に引き留められるかを監視します。
想定される追加質問
ラベルリークになる情報は何ですか?
適合率と再現率のどちらを最適化しますか?
事業価値をどう証明しますか?
回答の組み立て — 学習データへの適合と、未知データへの一般化
過学習は、一般化できる規則ではなく学習データのノイズや固有性を覚え、学習時には良好でも未知データで悪化する状態です。 適切な学習・検証・テスト分割、交差検証、正則化、単純なモデル、枝刈り、早期終了、ドロップアウト、追加データ、統制されたハイパーパラメータ調整で防ぎます。リークも異常に良い性能に見え、本番で失敗します。時系列や行動データでは時間順を守って分割します。
想定される追加質問
過学習をどう検出しますか?
検証データとテストデータはどう違いますか?
一つのモデルが過少学習と過学習を同時に示すことはありますか?
回答の組み立て — 解釈性、非線形性、データ、性能、展開条件
ロジスティック回帰は高速で解釈しやすく、校正もしやすい二値分類の強い基準です。データが少ない、関係が概ね線形、説明責任が重要な場合に適します。 Random Forestは手動指定を抑えて非線形性と相互作用を捉えますが、大きく解釈しにくく、学習分布外に弱い場合があります。同じ分割と指標で比較し、校正、推論費用、事業制約も含めます。複雑さが意味ある改善を生まなければ単純な方を選びます。
想定される追加質問
Random Forestの個別予測をどう説明しますか?
正解率より解釈性が重要なのはいつですか?
勾配ブースティングの方が優れる可能性があるのはなぜですか?
回答の組み立て — データ差 → リーク → 不適切な指標 → ドリフト → 実装 → フィードバックループ
オフラインデータが本番を代表していない、学習・提供のずれ、時系列リーク、目的指標の不一致、利用者・季節・経路・価格・在庫のドリフトが考えられます。モデルの判断自体が将来データを変えることもあります。 特徴量欠損、異なる既定値、タイムアウト、古い特徴量、誤った閾値や版など実装不良も一般的です。オフラインとオンラインの分布、予測、校正、セグメント別性能、ログ、事業成果を比較し、ロールバック、閾値調整、処理修正、再学習、目的変更を判断します。
想定される追加質問
学習・提供のずれとは何ですか?
モデルドリフトをどう監視しますか?
推薦のフィードバックループはどう生まれますか?
モデル評価と指標
高い正解率も、指標が事業課題を表していなければ役に立ちません。評価には誤りの費用と利用状況を反映させます。
回答の組み立て — 偽陽性の費用と偽陰性の費用を比較する
偽陽性の費用が高い場合は適合率を重視します。たとえば不正検知が正当な顧客を止める場合です。陽性を見逃す害が大きい医療スクリーニングや重大な不正では再現率が重要です。 実際には両者のトレードオフがあります。事業費用、運用能力、利用者への害、後続処理に基づいて閾値を選び、クラス不均衡がある場合は単一点ではなく適合率・再現率曲線を確認します。
想定される追加質問
希少事象で正解率が誤解を招くのはなぜですか?
閾値をどう選びますか?
不正検知にはどの指標を使いますか?
回答の組み立て — 順位だけでなく確率の品質を評価する
校正されたモデルでは、0.8と予測された事例の約80%が実際に陽性になります。確率がリスク、価格、振り分け、審査待ち行列、期待値を決める場合に重要です。順位付けが良くても校正が悪いモデルはあります。 信頼度曲線とBrierスコアを確認し、Platt scaling、等張回帰、temperature scalingを使えます。検証には本番に近いデータを使います。純粋な順位付けでは、解釈されるリスクスコアほど完全な校正は重要でない場合があります。
想定される追加質問
AUCが高く校正が悪いモデルはありますか?
校正をどう改善しますか?
校正が事業判断へ影響するのはいつですか?
SQLとPythonの質問
優れたモデリングにも、正しい抽出、変換、検証、探索的分析が必要です。
回答の組み立て — コホート月 → 活動月 → 月差 → 集計
一つのCTEに各利用者と登録月、別のCTEに各利用者と有効な活動月を置きます。結合後に月差を求め、コホートと月差ごとの一意アクティブ利用者を数えます。分母は初期コホート人数で、LEFT JOINにより活動のない月も残します。 活動、試験利用者、タイムゾーン、月境界を定義します。同じ利用者の同月内の複数イベントは一度だけ数えます。結果は登録月と継続月の行列にします。
想定される追加質問
ローリング継続率をどう計算しますか?
コホートをどう可視化しますか?
遅れて到着する活動データをどう扱いますか?
回答の組み立て — 定量化 → 分類 → 原因特定 → 処理選択
df.isna().sum()やmean()などで列ごとの件数、割合、型を算出し、日付、情報源、端末、地域、目的変数で分けます。任意項目、計測不良、非対応端末、対象外など、欠損の原因を理解することが重要です。 原因に応じて、不明を一カテゴリとして残す、補完する、除外する、情報源を修正します。補完方法は学習データだけで学習し、検証・テストへ適用します。欠損自体が予測力を持つ場合もありますが、公平性や規制リスクを生むこともあります。
想定される追加質問
欠損自体が情報になるのはいつですか?
補完時のリークをどう防ぎますか?
目的ラベルが欠損している場合はどうしますか?
回答の組み立て — 検出 → 原因調査 → 事業上の意味で判断
分布、箱ひげ図、zスコア、IQR、百分位、モデル型手法で候補を見つけ、元レコード、情報源、時点、セグメントを調べます。負の年齢は誤りでしょうが、非常に大きな法人購入は正当で売上上重要かもしれません。 正当な外れ値には変換、winsorization、頑健なモデル、専用セグメントを使えます。不可能な値、重複、計測不良、試験アカウント、対象外データだけを明確な理由で除外します。正当な外れ値が結論を左右するなら、含む場合と除く場合の感度を示します。
想定される追加質問
winsorizationとは何ですか?
外れ値は線形回帰へどう影響しますか?
外れ値自体が主要な信号になるのはいつですか?
プロダクト分析と事業ケース
曖昧なプロダクト上の問いを、指標、分析、実験、意思決定へ変える力を確認します。
回答の組み立て — 指標品質 → ファネル → セグメント → 原因 → 対応
クリックは弱い代理指標かもしれません。結果を検証し、表示、クリック、カート、購入手続き、購入、返金、再訪を確認します。好奇心を生む一方で購入を妨げている可能性があります。 利用者種別、経路、カテゴリ、端末、表示場所で分け、関連性、価格、在庫、配送、多様性、遅延、設計を調べます。クリック率だけで展開してはいけません。原因に応じて戻す、健全なセグメントへ限定する、目的を下流の購入品質へ変えます。
想定される追加質問
主要指標には何を選びますか?
推薦品質をどう測定しますか?
売上が増えて購入件数が減ったらどうしますか?
回答の組み立て — 流動性 → 品質 → 均衡 → 継続 → ユニットエコノミクス
中心は流動性です。需要が適切な供給を速く見つけ、供給が十分な需要を得られるかを見ます。配車なら成立率、待ち時間、取消、稼働率、専門サービスなら適格提案、採用、完了、再利用などです。 地域、カテゴリ、時間、コホート、供給水準、需要意図で分けます。平均は局所的な不均衡を隠します。安全、不正、品質、返金、両側の解約、ユニットエコノミクスをガードレールにします。供給と需要のどちらが不足するかで施策は変わります。
想定される追加質問
立ち上げ時の鶏と卵の問題をどう解決しますか?
どちら側が制約か、どう見つけますか?
経営陣へ毎週どの指標を示しますか?
回答の組み立て — ユーザー価値 → 継続行動 → 学習成果 → ガードレール
空虚な利用量ではなく、持続的な学習を表す必要があります。十分な正答率で実質的なレッスンを終えた週次学習者数や、品質で重み付けした学習時間などが候補です。入力はレッスン、復習、発話練習、進度、結果は継続、有料転換、測定可能な習熟です。 疲労、急いだ完了、不正、通知停止、解約をガードレールにします。プロダクトと学習専門家とともに、指標が実際の進歩と長期継続を予測するか検証します。
想定される追加質問
DAUではなぜ不十分ですか?
指標の攻略をどう防ぎますか?
ライト利用者と熱心な利用者でどう変えますか?
モデリングケース
問題、ラベル、特徴量、ベースライン、評価、展開、監視、事業価値までの一連の判断が評価されます。
回答の組み立て — 目的 → ラベル → 特徴量 → 指標 → 介入 → 監視
不正と取る行動を定義します。遮断、審査、追加認証、リスク点数のどれかです。ラベルにはチャージバック、確認済み案件、通報を使えますが、遅れて到着し誤りも含みます。金額、加盟店、端末、地域、口座年齢、取引速度、支払履歴、失敗回数、過去の異議申立てを特徴量にできます。 ルールと単純な基準から始め、ロジスティック回帰、勾配ブースティング、ラベルが弱ければ異常検知を比較します。適合率・再現率、一定審査能力での再現率、偽陽性、不正検出額、校正を評価します。本番ではドリフト、攻撃者の適応、公平性、遅延、審査能力、フィードバックループ、ロールバックを監視します。
想定される追加質問
遅れて届くラベルをどう扱いますか?
偽陽性の費用は何ですか?
不正行為者はモデルへどう適応しますか?
回答の組み立て — 目的定義 → 利用可能な特徴量 → 指標 → 校正 → 利用者への影響
注文確定から配達までの総時間、または調理、配達員割当、受取、移動、引渡しへ分けて定義します。注文時点で利用できる店舗、時刻、曜日、天候、距離、配達員数、滞留、過去の調理時間、交通、注文量、地域を特徴量にします。予測後にしか分からない情報はリークです。 MAEは理解しやすい一方、過小予測は過大予測より悪影響が大きい場合があります。約束する時間帯には校正が重要です。店舗、地域、時間、コホート別に監視し、特徴量の鮮度、新規店舗、休日、天候、表示ETAが行動を変える影響も考慮します。
想定される追加質問
総時間と構成要素のどちらをモデル化しますか?
新規店舗をどう扱いますか?
過大予測と過小予測のどちらが悪いですか?
行動・コミュニケーションの質問
曖昧さ、影響力、技術説明、成果、倫理判断、望ましくない結果への対応を扱います。
回答の組み立て — 課題 → 手法 → 意思決定 → 影響 → 学び
意思決定、製品、業務、指標を変えた案件を選びます。事業課題の後に、データ、手法、検証、トレードオフを相手に合う深さで説明します。 解約モデルで対応対象を優先した、実験結果で公開方法を変えた、など行動との接続が重要です。売上、解約、時間、費用、意思決定速度で成果を定量化し、限界とその後の改善も説明します。ツールより、正確性、信頼、採用、成果が重要です。
想定される追加質問
成果をどう測定しましたか?
最も難しい技術課題は何でしたか?
関係者の支持をどう得ましたか?
回答の組み立て — 意思決定 → 直感 → 証拠 → 限界 → 行動
構成ではなく意思決定から始めます。何を予測し、どの信号を使い、どの程度機能し、どこで信頼すべきでないかを日常語で説明します。例、理由コード、校正、単純なトレードオフ図が役立ちます。 不確実性、データ品質、偏り、ドリフト、境界ケースを明示します。最後に点数を行動へ結び付けます。たとえばリスク上位10%へ継続施策を行い、その増分効果は別途実験します。
想定される追加質問
相手が正解率だけを気にする場合はどうしますか?
不確実性をどう伝えますか?
複雑なモデルを避けるのはいつですか?
回答の組み立て — 期待 → 証拠 → 説明 → 意思決定 → 結果
相手の期待、確認したデータ、反対の結果を信頼できるものにした検証を説明します。伝える際は相手の目標を認め、証拠と不確実性を明示し、小規模テスト、別の対象、追加測定などの代案を示します。 目的は議論に勝つことではなく判断を改善することです。採用された対応と、提案が受け入れられなかった場合も含め、影響力、信頼、説明について学んだことを述べます。
想定される追加質問
関係をどう守りましたか?
経営陣が同意しない場合はどうしますか?
分析の信頼性をどう高めましたか?