데이터 사이언티스트 면접은 통계적 사고, 실험, 머신러닝, 제품 이해, 불완전한 근거에서 합리적인 판단을 도출하는 능력을 평가합니다.
4~6회
일반적인 면접 횟수
45~60분
기술 면접 1회 소요 시간
6개 이상
핵심 역량 영역
5~8주
권장 준비 기간
면접관이 평가하는 역량
—
통계: 신호와 우연을 구분하고 불확실성을 정확히 설명할 수 있는가.
—
실험: A/B 테스트를 설계·분석·비판적으로 평가하고 과도한 결론을 피할 수 있는가.
—
머신러닝: 문제에 적합한 목적, 특징량, 모델, 평가 방식을 선택할 수 있는가.
—
제품 이해: 모델을 사용자 행동, 성과, 의사결정에 연결할 수 있는가.
—
SQL 및 Python: 실제 데이터를 정확하고 효율적으로 처리할 수 있는가.
—
평가: 편향, 누수, 과적합, 잘못된 보정, 드리프트, 배포 위험을 찾을 수 있는가.
—
커뮤니케이션: 기술 결과를 제품, 개발, 경영진에게 명확히 전달할 수 있는가.
좋은 데이터 사이언티스트는 결론의 강도를 조절합니다
근거가 약할 때 확실한 것처럼 말하지 않습니다. 가정을 밝히고, 불확실성을 정량화하며, 한계를 설명하고, 현재 근거에 맞는 최선의 다음 행동을 제안합니다.
데이터 사이언티스트 채용 절차
일반적인 전형은 통계, 실험, SQL 또는 Python, 제품 분석, 머신러닝, 모델링 사례, 행동 면접으로 구성됩니다.
일반적인 전형 단계
1
채용 담당자 면담: 직무 방향, 직급, 업계, 보상, 사용 도구를 확인합니다.
2
채용 책임자 면담: 프로젝트, 성과, 모델링, 커뮤니케이션을 깊이 살펴봅니다.
3
SQL 및 Python 면접: 데이터 조작, 조인, 집계, pandas, 실무 구현을 평가합니다.
4
통계 및 실험: 확률, 추론, 가설, A/B 테스트, 지표를 다룹니다.
5
머신러닝 면접: 특징량, 모델 선택, 학습, 평가, 배포, 실패를 다룹니다.
6
제품 및 사업 사례: 지표를 진단하고 실험이나 데이터 사이언스 해결책을 제안합니다.
7
행동 면접: 주인의식, 모호함, 이해관계자, 협업, 윤리적 판단을 평가합니다.
제품 데이터 사이언티스트
머신러닝 데이터 사이언티스트
주요 초점
지표, 실험, 사용자 행동, 의사결정, 제품 전략
예측 모델, 특징량 설계, 평가, 배포, 모니터링
일반적인 면접
SQL, A/B 테스트, 제품 감각, 지표 진단, 인과 추론
ML 기초, 모델링 사례, Python, 시스템 제약, 평가
강한 평가 신호
모호한 질문을 신뢰할 수 있는 분석과 제안으로 전환
현실적인 조건에서 올바른 문제를 푸는 모델 구축
흔한 실수
지표가 의사결정에 어떤 영향을 주는지 설명하지 않기
목적, 데이터 품질, 기준 모델보다 복잡한 모델을 먼저 선택하기
직무의 초점을 이해하세요
제품 중심과 머신러닝 중심 직무는 면접 내용이 크게 다릅니다. 채용 공고, 팀, 실제 업무에 맞춰 준비하세요.
통계 및 확률
과도한 정밀함 없이 불확실성, 표본, 가정, 인과적 주장을 엄밀하게 다루는 능력을 평가합니다.
핵심 통계 개념
신뢰구간
같은 표본 추출 절차를 반복할 때 일정 비율로 실제 모수를 포함하도록 계산한 구간입니다.
p값
귀무가설이 참이라고 가정할 때 관측 결과만큼 또는 그보다 극단적인 결과가 나올 확률입니다. 귀무가설이 참일 확률은 아닙니다.
통계적 검정력
실제로 존재하는 효과를 탐지할 확률입니다. 효과 크기, 분산, 표본 크기, 유의수준에 따라 달라집니다.
교란 변수
원인과 결과 모두에 영향을 주어 둘 사이의 관계를 왜곡할 수 있는 변수입니다.
답변 구조 — 연관성이 있다고 원인인 것은 아님
상관관계는 두 변수가 함께 변하는 것이고 인과관계는 한 변수를 바꾸면 다른 변수가 변하는 것입니다. 상관관계는 교란, 역인과, 선택 편향, 우연에서 생길 수 있습니다.
가장 강한 인과 근거는 보통 적절한 무작위 배정에서 얻습니다. 불가능하다면 차이의 차이, 도구변수, 매칭, 회귀불연속 같은 방법을 가정을 명시해 사용할 수 있습니다. 연구 설계가 허용하는 수준을 넘어서 주장하지 않는 것이 중요합니다.
예상 추가 질문
실험 없이 인과관계를 어떻게 조사하겠습니까?
교란 변수란 무엇입니까?
역인과의 예를 들어 보세요.
답변 구조 — 거짓 양성과 거짓 음성
1종 오류는 참인 귀무가설을 기각하는 거짓 양성이며 허용 상한을 α로 정합니다. 2종 오류는 실제 효과를 탐지하지 못하는 거짓 음성이며 그 확률은 β, 검정력은 1 - β입니다.
어느 오류가 더 중요한지는 용도에 따라 다릅니다. 부정 거래 탐지에서 거짓 양성은 정상 고객에게 마찰을 만들고 거짓 음성은 손실을 만듭니다. 임계값, 표본 크기, 지표는 각각의 비용을 반영해야 합니다.
예상 추가 질문
표본 크기는 두 오류에 어떤 영향을 줍니까?
검정력이란 무엇입니까?
더 엄격한 α를 선택하는 경우는 언제입니까?
답변 구조 — 귀무가설 → 이항확률 → 근거와 불확실성
공정한 동전이라면 앞면 횟수는 n = 10, p = 0.5인 이항분포를 따릅니다. 앞면이 8번 이상 나오는 것은 충분히 가능하므로 이 작은 표본만으로는 강한 근거가 되지 않습니다. 양측 검정이라면 반대 방향으로 같은 수준 이상 극단적인 결과도 고려합니다.
따라서 10회만으로 편향됐다고 결론 내리지 않습니다. p값이나 p의 신뢰구간을 제시하고 추가 관측을 권합니다. 각 시행의 독립성과 조건의 안정성도 가정입니다.
예상 추가 질문
정확한 p값을 어떻게 계산하겠습니까?
어느 정도의 시행 횟수가 적절합니까?
p의 신뢰구간은 어떤 형태입니까?
실험 및 인과 추론
엄밀한 설계, 신중한 해석, 잘못된 결론 방지, 근거와 제품 판단의 연결을 평가합니다.
답변 구조 — 가설 → 단위 → 지표 → 가드레일 → 기간 → 결정
관련성이 높은 콘텐츠가 다양성, 지연 시간, 장기 유지율을 해치지 않으면서 만족도를 높인다는 가설을 둡니다. 반복 사용에서는 경험을 일관되게 유지하기 위해 사용자 단위로 무작위 배정하고 네트워크 효과가 있다면 클러스터나 홀드아웃을 검토합니다.
주요 지표는 목적에 따라 만족스러운 세션, 전환, 유지, 매출 등이 될 수 있습니다. 클릭, 체류 시간, 저장을 선행 지표로, 지연, 불만, 다양성, 공정성, 해지를 가드레일로 둡니다. 필요한 표본 크기와 주간 변동을 포함하는 기간을 확보하고 신규 효과, 세그먼트, 실무적 효과 크기까지 확인해 출시를 결정합니다.
예상 추가 질문
클릭은 늘고 유지율은 떨어지면 어떻게 하겠습니까?
사용자 간 간섭을 어떻게 처리하겠습니까?
출시 전에 어떤 세그먼트를 확인하겠습니까?
답변 구조 — 검증 → 세그먼트 신뢰성 → 영향 → 출시 전략
먼저 표본 크기, 신뢰구간, 세그먼트의 사전 정의 여부, 다중 검정, 분류 정확성을 확인합니다. 근거가 약한 하위 집단 결과 하나로 전체 효과를 뒤집어서는 안 됩니다.
부정적 영향이 견고하다면 원인을 조사합니다. 신규 사용자는 더 단순한 기본값이나 설명이 필요할 수 있습니다. 전략적으로 중요한 집단이라면 전체 출시 대신 기존 사용자에게만 제한하거나, 별도 버전을 만들거나, 온보딩을 바꿔 다시 검증합니다. 영향의 크기, 지속성, 이질성, 사업 맥락을 함께 판단합니다.
예상 추가 질문
세그먼트 분석의 거짓 양성을 어떻게 막겠습니까?
세그먼트가 작으면 어떻게 하겠습니까?
다음 실험을 어떻게 설계하겠습니까?
답변 구조 — 무작위화할 수 없는 개입과 비교 가능한 대조 추세
지역별 출시, 정책, 가격 변경처럼 무작위화할 수 없는 경우에 유용합니다. 처치군의 변화를 같은 기간 대조군의 변화와 비교합니다.
핵심 가정은 개입이 없었다면 두 집단이 평행한 추세를 따랐다는 것입니다. 따라서 개입 전 추세를 확인하고 비교 가능한 대조군을 선택합니다. 캐나다에만 기능을 출시했고 미국이 계절성과 외부 요인을 적절히 반영한다면 두 국가의 유지율 변화 차이로 효과를 추정할 수 있습니다. 무작위 실험보다 인과 주장은 신중해야 합니다.
예상 추가 질문
평행 추세를 어떻게 확인하겠습니까?
어떤 요인이 이 방법을 무효로 만들 수 있습니까?
대조군을 어떻게 선택하겠습니까?
머신러닝 질문
문제 설정, 합리적인 기준선, 특징량 설계, 평가, 프로덕션 실패 원인을 평가합니다.
답변 구조 — 레이블 정의 → 특징량 → 기준선 → 평가 → 안전한 배포
해지와 예측 시점을 정의합니다. 예를 들어 현재 사용자가 앞으로 30일 안에 해지하거나 갱신하지 않는 경우입니다. 학습 데이터는 일관된 기준일로 만듭니다. 사용량, 최근성, 기능 채택, 문의, 결제, 요금제, 사용 기간, 추세, 다운그레이드를 특징량으로 사용할 수 있으며 예측 시점 이후 정보는 누수입니다.
로지스틱 회귀나 그래디언트 부스팅 트리부터 시작하고 AUC, 정밀도, 재현율, 보정, 상위 데실 리프트, 개입의 사업 가치를 평가합니다. 해지가 드물다면 정확도는 유용하지 않습니다. 프로덕션에서는 드리프트, 세그먼트, 공정성과 실제로 대상 사용자를 유지할 수 있는지 모니터링합니다.
예상 추가 질문
레이블 누수가 되는 정보는 무엇입니까?
정밀도와 재현율 중 무엇을 최적화하겠습니까?
사업 가치를 어떻게 입증하겠습니까?
답변 구조 — 학습 데이터 적합과 미지 데이터 일반화
과적합은 일반화 가능한 규칙이 아니라 학습 데이터의 잡음이나 특수성을 학습해 학습 성능은 좋지만 새로운 데이터에서 성능이 나빠지는 상태입니다.
올바른 학습·검증·테스트 분할, 교차 검증, 정규화, 단순한 모델, 가지치기, 조기 종료, 드롭아웃, 추가 데이터, 통제된 하이퍼파라미터 조정으로 방지합니다. 누수도 비정상적으로 좋은 성능처럼 보이다가 프로덕션에서 실패하게 합니다. 시계열이나 행동 데이터는 시간 순서를 지켜 분할합니다.
예상 추가 질문
과적합을 어떻게 탐지하겠습니까?
검증 데이터와 테스트 데이터는 어떻게 다릅니까?
한 모델이 과소적합과 과적합을 동시에 보일 수 있습니까?
답변 구조 — 해석 가능성, 비선형성, 데이터, 성능, 배포 조건
로지스틱 회귀는 빠르고 해석하기 쉬우며 보정도 쉬운 이진 분류의 강한 기준선입니다. 데이터가 적거나 관계가 대체로 선형이거나 설명 책임이 중요할 때 적합합니다.
Random Forest는 수동 지정을 줄이면서 비선형성과 상호작용을 포착하지만 크고 해석하기 어려우며 학습 분포 밖에 약할 수 있습니다. 같은 분할과 지표로 비교하고 보정, 추론 비용, 사업 제약도 고려합니다. 복잡성이 의미 있는 개선을 만들지 않으면 단순한 모델을 선택합니다.
예상 추가 질문
Random Forest의 개별 예측을 어떻게 설명하겠습니까?
정확도보다 해석 가능성이 중요한 경우는 언제입니까?
그래디언트 부스팅이 더 나을 수 있는 이유는 무엇입니까?
답변 구조 — 데이터 차이 → 누수 → 부적절한 지표 → 드리프트 → 구현 → 피드백 루프
오프라인 데이터가 프로덕션을 대표하지 않거나, 학습과 서빙이 어긋났거나, 시계열 누수나 목적 지표 불일치가 있거나, 사용자·계절·채널·가격·재고가 드리프트했을 수 있습니다. 모델의 결정이 미래 데이터 자체를 바꿀 수도 있습니다.
특징량 누락, 다른 기본값, 시간 초과, 오래된 특징량, 잘못된 임계값이나 버전 같은 구현 오류도 흔합니다. 오프라인과 온라인의 분포, 예측, 보정, 세그먼트별 성능, 로그, 사업 성과를 비교해 롤백, 임계값 조정, 처리 수정, 재학습, 목적 변경을 결정합니다.
예상 추가 질문
학습과 서빙의 불일치란 무엇입니까?
모델 드리프트를 어떻게 모니터링하겠습니까?
추천의 피드백 루프는 어떻게 생깁니까?
모델 평가 및 지표
정확도가 높아도 지표가 사업 문제를 나타내지 않으면 유용하지 않습니다. 평가에는 오류 비용과 사용 맥락을 반영해야 합니다.
분류
랭킹 및 추천
일반적인 지표
정밀도, 재현율, F1, AUC, 로그 손실, 보정
NDCG, MAP, MRR, 적중률, 범위, 다양성, 온라인 사용
주요 위험
클래스 불균형 때문에 정확도가 오해를 일으킴
오프라인 관련성이 만족도와 일치하지 않을 수 있음
사업과의 연결
임계값에 거짓 양성과 거짓 음성의 비용 반영
관련성, 최신성, 다양성, 공정성, 지연 시간의 균형
답변 구조 — 거짓 양성 비용과 거짓 음성 비용 비교
거짓 양성 비용이 높으면 정밀도를 중시합니다. 예를 들어 부정 거래 탐지가 정상 고객의 거래를 막는 경우입니다. 양성을 놓칠 때 피해가 큰 의료 선별이나 중대한 부정 거래에서는 재현율이 중요합니다.
실제로는 둘 사이에 트레이드오프가 있습니다. 사업 비용, 운영 역량, 사용자 피해, 후속 처리에 따라 임계값을 선택하고 클래스 불균형이 있다면 한 점이 아니라 정밀도-재현율 곡선을 확인합니다.
예상 추가 질문
희소 사건에서 정확도가 오해를 일으키는 이유는 무엇입니까?
임계값을 어떻게 선택하겠습니까?
부정 거래 탐지에는 어떤 지표를 사용하겠습니까?
답변 구조 — 순위뿐 아니라 확률의 품질 평가
보정된 모델에서는 0.8로 예측한 사례의 약 80%가 실제 양성입니다. 확률이 위험, 가격, 라우팅, 검토 대기열, 기대값을 결정할 때 중요합니다. 순위화는 좋아도 보정이 나쁜 모델이 있을 수 있습니다.
신뢰도 곡선과 Brier 점수를 확인하고 Platt scaling, 등위 회귀, temperature scaling을 사용할 수 있습니다. 검증에는 프로덕션과 유사한 데이터를 씁니다. 순수한 순위화에서는 해석되는 위험 점수만큼 완벽한 보정이 중요하지 않을 수 있습니다.
예상 추가 질문
AUC는 높지만 보정이 나쁜 모델이 있을 수 있습니까?
보정을 어떻게 개선하겠습니까?
보정은 언제 사업 결정에 영향을 줍니까?
SQL 및 Python 질문
좋은 모델링에도 정확한 추출, 변환, 검증, 탐색적 분석이 필요합니다.
답변 구조 — 코호트 월 → 활동 월 → 월 차이 → 집계
한 CTE에는 각 사용자와 가입 월을, 다른 CTE에는 각 사용자와 유효 활동 월을 둡니다. 조인 후 월 차이를 구하고 코호트와 월 차이별 고유 활성 사용자를 셉니다. 분모는 초기 코호트 인원이며 LEFT JOIN으로 활동이 없는 월도 유지합니다.
활동, 테스트 사용자, 시간대, 월 경계를 정의합니다. 같은 사용자의 같은 달 여러 이벤트는 한 번만 셉니다. 결과는 가입 월과 유지 월의 행렬로 표시합니다.
예상 추가 질문
롤링 유지율을 어떻게 계산하겠습니까?
코호트를 어떻게 시각화하겠습니까?
늦게 도착하는 활동 데이터는 어떻게 처리하겠습니까?
답변 구조 — 정량화 → 세분화 → 원인 파악 → 처리 선택
df.isna().sum()이나 mean()으로 열별 건수, 비율, 데이터형을 계산하고 날짜, 정보원, 기기, 지역, 목표 변수별로 나눕니다. 선택 입력, 계측 오류, 미지원 기기, 대상 아님 등 결측 원인을 이해하는 것이 중요합니다.
원인에 따라 미상을 하나의 카테고리로 남기거나, 대치하거나, 제외하거나, 정보원을 수정합니다. 대치 방법은 학습 데이터에서만 학습해 검증 및 테스트 데이터에 적용합니다. 결측 자체가 예측력을 가질 수 있지만 공정성이나 규제 위험을 만들 수도 있습니다.
예상 추가 질문
결측 자체가 정보가 되는 경우는 언제입니까?
대치 과정의 누수를 어떻게 방지하겠습니까?
목표 레이블이 결측이면 어떻게 하겠습니까?
답변 구조 — 탐지 → 원인 조사 → 사업적 의미로 판단
분포, 상자 그림, z점수, IQR, 백분위수, 모델 기반 방법으로 후보를 찾고 원본 레코드, 정보원, 시점, 세그먼트를 조사합니다. 음수 나이는 오류일 가능성이 크지만 매우 큰 기업 구매는 정당하며 매출상 중요할 수 있습니다.
정당한 이상치에는 변환, 윈저화, 강건한 모델, 별도 세그먼트를 사용할 수 있습니다. 불가능한 값, 중복, 계측 오류, 테스트 계정, 대상 외 데이터만 명확한 이유로 제외합니다. 정당한 이상치가 결론을 좌우한다면 포함 및 제외했을 때의 민감도를 보여 줍니다.
예상 추가 질문
윈저화란 무엇입니까?
이상치는 선형 회귀에 어떤 영향을 줍니까?
이상치 자체가 핵심 신호가 되는 경우는 언제입니까?
제품 분석 및 사업 사례
모호한 제품 질문을 지표, 분석, 실험, 의사결정으로 전환하는 능력을 확인합니다.
답변 구조 — 지표 품질 → 퍼널 → 세그먼트 → 원인 → 대응
클릭은 약한 대리 지표일 수 있습니다. 결과를 검증하고 노출, 클릭, 장바구니, 결제, 구매, 환불, 재방문을 확인합니다. 호기심을 유도하면서 구매를 방해했을 수 있습니다.
사용자 유형, 채널, 카테고리, 기기, 노출 위치별로 나누고 관련성, 가격, 재고, 배송, 다양성, 지연, 디자인을 조사합니다. 클릭률만 보고 출시해서는 안 됩니다. 원인에 따라 롤백하거나 건전한 세그먼트로 제한하거나 목표를 하위 구매 품질로 바꿉니다.
예상 추가 질문
주요 지표로 무엇을 선택하겠습니까?
추천 품질을 어떻게 측정하겠습니까?
매출은 늘고 구매 건수는 줄면 어떻게 하겠습니까?
답변 구조 — 유동성 → 품질 → 균형 → 유지 → 단위경제성
핵심은 유동성입니다. 수요가 적절한 공급을 빠르게 찾고 공급이 충분한 수요를 얻는지 봅니다. 차량 호출이라면 매칭률, 대기 시간, 취소, 가동률을, 전문 서비스라면 적격 제안, 채택, 완료, 재사용을 봅니다.
지역, 카테고리, 시간, 코호트, 공급 수준, 수요 의도별로 나눕니다. 평균은 국지적인 불균형을 숨깁니다. 안전, 부정행위, 품질, 환불, 양측 해지, 단위경제성을 가드레일로 둡니다. 공급과 수요 중 어느 쪽이 부족한지에 따라 조치가 달라집니다.
예상 추가 질문
출시 초기의 닭과 달걀 문제를 어떻게 해결하겠습니까?
어느 쪽이 제약인지 어떻게 찾겠습니까?
경영진에게 매주 어떤 지표를 보여 주겠습니까?
답변 구조 — 사용자 가치 → 반복 행동 → 학습 성과 → 가드레일
허영 지표가 아니라 지속적인 학습을 나타내야 합니다. 충분한 정답률로 의미 있는 수업을 마친 주간 학습자 수나 품질 가중 학습 시간이 후보입니다. 입력 지표는 수업, 복습, 말하기 연습, 진도이며 결과는 유지, 유료 전환, 측정 가능한 숙련도입니다.
피로, 서두른 완료, 부정행위, 알림 비활성화, 해지를 가드레일로 둡니다. 제품팀 및 학습 전문가와 지표가 실제 진도와 장기 유지를 예측하는지 검증합니다.
예상 추가 질문
DAU만으로 부족한 이유는 무엇입니까?
지표 악용을 어떻게 방지하겠습니까?
가벼운 사용자와 적극적인 사용자에게 어떻게 다르게 적용하겠습니까?
모델링 사례
문제, 레이블, 특징량, 기준선, 평가, 배포, 모니터링, 사업 가치에 이르는 일련의 판단을 평가합니다.
답변 구조 — 목적 → 레이블 → 특징량 → 지표 → 개입 → 모니터링
부정 거래와 취할 행동을 정의합니다. 차단, 검토, 추가 인증, 위험 점수 중 무엇인지 정합니다. 레이블은 차지백, 확인된 사례, 신고를 사용할 수 있지만 늦게 도착하고 오류도 포함합니다. 금액, 가맹점, 기기, 지역, 계정 연령, 거래 속도, 결제 이력, 실패 횟수, 과거 분쟁을 특징량으로 사용할 수 있습니다.
규칙과 단순한 기준선부터 시작해 로지스틱 회귀, 그래디언트 부스팅, 레이블이 약하면 이상 탐지를 비교합니다. 정밀도와 재현율, 고정된 검토 역량에서의 재현율, 거짓 양성, 탐지한 부정 금액, 보정을 평가합니다. 프로덕션에서는 드리프트, 공격자의 적응, 공정성, 지연, 검토 역량, 피드백 루프, 롤백을 모니터링합니다.
예상 추가 질문
늦게 도착하는 레이블을 어떻게 처리하겠습니까?
거짓 양성의 비용은 무엇입니까?
부정행위자는 모델에 어떻게 적응합니까?
답변 구조 — 목적 정의 → 사용 가능한 특징량 → 지표 → 보정 → 사용자 영향
주문 확정부터 배송까지의 총시간으로 볼지 조리, 기사 배정, 픽업, 이동, 인계로 나눌지 정의합니다. 주문 시점에 이용 가능한 매장, 시각, 요일, 날씨, 거리, 기사 수, 적체, 과거 조리 시간, 교통, 주문량, 지역을 특징량으로 사용합니다. 예측 후에만 알 수 있는 정보는 누수입니다.
MAE는 이해하기 쉽지만 과소 예측이 과대 예측보다 더 나쁠 수 있습니다. 약속 시간 구간에는 보정이 중요합니다. 매장, 지역, 시간, 코호트별로 모니터링하고 특징량 최신성, 신규 매장, 휴일, 날씨, 표시된 ETA가 행동을 바꾸는 영향도 고려합니다.
예상 추가 질문
총시간과 구성 요소 중 무엇을 모델링하겠습니까?
신규 매장은 어떻게 처리하겠습니까?
과대 예측과 과소 예측 중 어느 쪽이 더 나쁩니까?
계산 예시
모델링 사례의 구조
무료 체험에서 유료 요금제로의 전환을 예측하는 모델을 설계합니다.
1
목적 정식화
예측 시점과 체험 시작 후 14일 또는 30일 내 전환 같은 레이블을 정의합니다.
2
특징량 선택
활성화, 사용량, 기능 채택, 초대, 채널, 기기, 기업 정보, 문의처럼 예측 전 정보만 사용합니다.
3
기준선 정의
단순한 규칙이나 로지스틱 회귀부터 시작하고 비선형성이 가치가 있을 때 트리 모델과 비교합니다.
4
실무 가치 평가
오프라인 AUC만이 아니라 상위 데실 리프트, 보정, 개입으로 인한 증분 전환을 최적화합니다.
결과
목적, 데이터, 모델링, 평가, 사업 활용을 일관되게 판단하는 답변이 됩니다.
행동 및 커뮤니케이션 질문
모호함, 영향력, 기술 설명, 성과, 윤리 판단, 원치 않은 결과에 대한 대응을 다룹니다.
답변 구조 — 문제 → 방법 → 의사결정 → 영향 → 학습
의사결정, 제품, 운영, 지표를 바꾼 프로젝트를 고릅니다. 사업 문제를 설명한 뒤 데이터, 방법, 검증, 트레이드오프를 상대에게 맞는 깊이로 설명합니다.
해지 모델로 개입 대상을 우선순위화했거나 실험 결과로 출시 방식을 바꾼 것처럼 행동과의 연결이 중요합니다. 매출, 해지, 시간, 비용, 의사결정 속도로 성과를 정량화하고 한계와 후속 개선도 설명합니다. 도구보다 정확성, 신뢰, 채택, 성과가 중요합니다.
예상 추가 질문
성과를 어떻게 측정했습니까?
가장 어려운 기술 문제는 무엇이었습니까?
이해관계자의 지지를 어떻게 얻었습니까?
답변 구조 — 의사결정 → 직관 → 근거 → 한계 → 행동
아키텍처가 아니라 의사결정에서 시작합니다. 무엇을 예측하고, 어떤 신호를 사용하며, 어느 정도 작동하고, 어디에서 신뢰하지 말아야 하는지 일상적인 언어로 설명합니다. 예시, 이유 코드, 보정, 단순한 트레이드오프 차트가 유용합니다.
불확실성, 데이터 품질, 편향, 드리프트, 경계 사례를 명시합니다. 마지막으로 점수를 행동에 연결합니다. 예를 들어 위험 상위 10%에게 유지 개입을 제공하고 증분 효과는 별도 실험으로 측정합니다.
예상 추가 질문
상대가 정확도만 중요하게 여기면 어떻게 하겠습니까?
불확실성을 어떻게 전달하겠습니까?
복잡한 모델을 피해야 할 때는 언제입니까?
답변 구조 — 기대 → 근거 → 커뮤니케이션 → 의사결정 → 결과
상대의 기대, 확인한 데이터, 반대 결과를 신뢰할 수 있게 만든 검증을 설명합니다. 전달할 때는 상대의 목표를 인정하고 근거와 불확실성을 명시하며 소규모 테스트, 다른 대상, 추가 측정 같은 대안을 제시합니다.
목적은 논쟁에서 이기는 것이 아니라 판단을 개선하는 것입니다. 채택된 대응과 제안이 받아들여지지 않은 경우까지 포함해 영향력, 신뢰, 커뮤니케이션에서 배운 점을 설명합니다.
예상 추가 질문
관계를 어떻게 지켰습니까?
경영진이 동의하지 않으면 어떻게 하겠습니까?
분석의 신뢰성을 어떻게 높였습니까?
데이터 사이언티스트 면접 준비 전략
통계, 실험, SQL, Python, 머신러닝, 제품 사례, 프로젝트 경험을 결합하고 대상 직무에 따라 비중을 조정합니다.
6주 준비 계획
1
1주 차: 분포, 표본, 구간, 검정, p값, 검정력, 편향, 분산, 인과 추론의 함정.
2
2주 차: A/B 설계, 지표, 가드레일, 표본 크기, 세그먼트, 다중 검정, 결과 설명.
3
3주 차: SQL 코호트 및 퍼널, pandas, 결측, 조인, 특징량, 탐색적 분석.
4
4주 차: 분류, 회귀, 정규화, 트리, 부스팅, 보정, 누수, 드리프트.
5
5주 차: 해지, 부정 거래, 추천, 가격, 랭킹, 예측, 마켓플레이스.
6
6주 차: 모의 면접과 성과 및 트레이드오프가 포함된 4~6개의 프로젝트 경험.
직무 초점별 준비
—
제품: SQL, 실험, 인과 추론, 지표, 퍼널, 유지율, 제안.
—
응용 ML: 특징량, 모델 선택, 오프라인 및 온라인 평가, 배포, 모니터링, 목적 정의.
—
마케팅: 기여도, 증분성, LTV, CAC, 업리프트, 실험, 채널.
—
위험 및 부정 거래: 클래스 불균형, 정밀도 및 재현율, 지연 레이블, 적대적 행동, 설명 가능성.
—
연구: 통계적 깊이, 가정, 실험 설계, 논문 토론, 기술 커뮤니케이션.
모델 복잡성부터 시작하지 마세요
올바른 문제에 대한 단순한 모델은 잘못된 문제에 대한 복잡한 모델보다 낫습니다. 먼저 의사결정, 레이블, 기준선, 지표, 실패 사례를 정의하세요.
핵심 요점
좋은 답변은 통계적 엄밀성, 모델링 판단, 제품 이해, 커뮤니케이션을 결합합니다. 모든 알고리즘을 아는 것이 아니라 불확실성 속에서 더 나은 의사결정을 위해 데이터 사이언스를 사용하는 것이 목적입니다.
실전처럼 질문을 연습하세요
Interview Pilot은 실제 면접 중 실시간으로 답변을 제안해 질문에 명확하게 답하도록 돕습니다.