Prepárate para entrevistas de Data Analyst con SQL, cuadros de mando, métricas, Excel, casos analíticos, experimentos, calidad de datos y comunicación con interesados.
Las entrevistas para Data Analysts evalúan si sabes convertir preguntas empresariales ambiguas en análisis fiables. Los mejores candidatos combinan dominio de SQL, buen criterio sobre métricas, calidad de datos y comunicación empresarial clara.
3–5
rondas de entrevista habituales
45–60 min
para la ronda de SQL o caso
5+
áreas de competencia esenciales
3–6 sem.
de preparación recomendada
Qué evalúan los entrevistadores
—
SQL: ¿sabes unir, filtrar, agregar, utilizar funciones de ventana y depurar datos correctamente?
—
Métricas: ¿defines medidas que reflejan el negocio en lugar de informar cifras sin criterio?
—
Comprensión empresarial: ¿relacionas los resultados con clientes, ingresos, riesgo u operaciones?
—
Calidad: ¿detectas valores ausentes, duplicados, atípicos, fallos de seguimiento y muestras sesgadas?
—
Cuadros de mando: ¿diseñas informes que facilitan decisiones y no solo resultan atractivos?
—
Comunicación: ¿explicas supuestos, confianza, limitaciones y recomendaciones con claridad?
Un buen analista no se limita a responder la consulta
Una respuesta sólida aclara la pregunta real, comprueba si los datos pueden responderla, expone supuestos y explica qué decisión debe facilitar. La precisión y el criterio importan por igual.
Proceso de entrevista para Data Analysts
Los procesos habituales incluyen selección, SQL, un caso analítico, cuadros de mando o visualización, comunicación con interesados y preguntas de comportamiento.
Fases habituales
1
Entrevista con selección: confirma encaje, herramientas, sector, rango salarial y motivación.
2
Entrevista con el responsable: profundiza en análisis anteriores, interesados, impacto y comunicación.
3
Ronda de SQL: evalúa joins, agregaciones, filtros, ventanas, fechas, nulos y depuración.
4
Caso analítico: investigas una variación, evalúas un cambio de producto o recomiendas una medida.
5
Ronda de cuadros o visualización: evalúa métricas, gráficos, filtros y frecuencia de informes.
6
Ronda de comportamiento: examina responsabilidad, ambigüedad, prioridades, interesados y datos defectuosos.
Ronda de SQL
Caso analítico
Pregunta central
¿Puedes recuperar y transformar correctamente los datos adecuados?
¿Puedes convertir datos en una decisión fundamentada?
Señal sólida
Joins y filtros correctos, granularidad adecuada y ventanas bien elegidas
Hipótesis claras, segmentación, definiciones, límites y recomendación
Error habitual
Unir niveles incompatibles y multiplicar filas
Concluir antes de revisar calidad y segmentos
Mejor preparación
Practicar esquemas reales, cohortes, retención, embudos y depuración
Practicar diagnósticos, experimentos, crítica de cuadros y resúmenes ejecutivos
La granularidad suele ser la trampa
Muchos errores nacen al unir niveles incompatibles, como usuario, pedido, línea, sesión o evento. Antes de escribir SQL, define la unidad de análisis y qué representa cada fila.
Fundamentos para entrevistas de SQL
Estas entrevistas dependen menos de sintaxis exótica que de pensar correctamente sobre granularidad, joins, filtros, agregación, fechas, nulos y validación.
Un proceso fiable para resolver SQL
1
Aclara la pregunta empresarial y las columnas de salida antes de escribir.
2
Define la granularidad: una fila por usuario, pedido, línea, sesión, evento, cuenta o día.
3
Identifica las tablas y comprueba la cardinalidad de cada join.
4
Define filtros con cuidado, sobre todo fechas, estados, pruebas, cancelaciones, reembolsos y cuentas internas.
5
Agrega solo después de fijar la granularidad; preagrega en CTE antes de unir cuando sea necesario.
6
Utiliza ventanas para rankings, acumulados, deduplicación y eventos anteriores o posteriores.
7
Valida con recuentos, valores únicos, totales, nulos, duplicados y lógica empresarial.
Conceptos importantes
Granularidad
Nivel que representa cada fila. Una granularidad incorrecta puede multiplicar ingresos, usuarios, pedidos o eventos.
LEFT JOIN
Conserva todas las filas de la tabla izquierda aunque no exista coincidencia, por ejemplo usuarios o días sin actividad.
Función de ventana
Calcula sobre filas relacionadas sin colapsarlas, para rankings, acumulados, LAG, LEAD o deduplicación.
Cohorte
Grupo con un inicio o atributo común, como mes de alta, primera compra, canal o plan.
✓ Recomendado
—
Definir la granularidad antes de unir
—
Organizar lógica compleja con CTE legibles
—
Comprobar si un filtro pertenece a WHERE o al JOIN
—
Utilizar DISTINCT solo con una razón
—
Validar la salida con recuentos y ejemplos
✗ Evita
—
Ocultar duplicados con SELECT DISTINCT
—
Unir ingresos por línea con usuarios sin preagregar
—
Eliminar sin querer nulos de un LEFT JOIN
—
Ignorar zonas horarias y límites de fecha
—
Entregar una métrica sin relacionarla con una decisión
Preguntas de entrevista sobre SQL
Practica preguntas empresariales realistas sobre usuarios, pedidos, eventos, suscripciones, retención, ingresos y embudos.
Primero aclaro si se cuentan pedidos cancelados o reembolsados; normalmente solo incluyo los completados. La consulta filtra orders por fecha y estado, agrupa por cliente, suma revenue, ordena de mayor a menor y limita a cinco.
Importan la fecha correcta y la granularidad. Los datos de líneas deben preagregarse para no multiplicar ingresos. Si deben incluirse empates en el quinto puesto, utilizo una función de ranking en lugar de LIMIT. Por último valido el total elegible, los recuentos y posibles duplicados.
Posibles preguntas de seguimiento
¿Cómo incluirías empates en el quinto puesto?
¿Qué cambia si los ingresos están a nivel de línea?
Primero defino retención: actividad exactamente en el séptimo día o en cualquier momento durante los siete primeros. Para Day 7, un CTE contiene las altas de enero con user_id y signup_date, y un LEFT JOIN conecta los eventos válidos del séptimo día.
El LEFT JOIN conserva a quienes no volvieron; un INNER JOIN inflaría la tasa. El denominador son usuarios únicos elegibles y el numerador quienes tienen el evento. Excluyo del denominador a usuarios sin siete días completos de observación. También puedo segmentar por canal, plataforma, región o semana.
Posibles preguntas de seguimiento
¿En qué se diferencian Day 7 y Rolling 7-Day?
¿Cómo tratas a usuarios con menos de siete días observables?
¿Qué eventos cuentan como actividad?
Enfoque — Numerar compras por usuario
Filtro primero compras válidas y completadas. Después las numero con row_number() over (partition by user_id order by purchase_at, order_id) y selecciono la fila de rango dos. order_id hace el resultado determinista cuando coinciden las marcas de tiempo.
Si deben aparecer todos los usuarios, uno el resultado con la tabla de usuarios mediante LEFT JOIN; quien no tenga segunda compra conserva un valor nulo. En tablas grandes, ayudan índices sobre user_id y fecha de compra.
Posibles preguntas de seguimiento
¿Cómo mostrarías usuarios sin segunda compra?
¿Qué ocurre con marcas de tiempo idénticas?
¿Cómo calcularías los días entre ambas compras?
Enfoque — Una fila por usuario con una marca de tiempo por paso
Creo una fila por usuario mediante agregación condicional y tomo la primera marca de cada paso, evitando contar eventos repetidos. Si el orden es obligatorio, verificación debe ocurrir después del registro, onboarding después de verificar y compra después del onboarding.
Calculo conversión entre pasos y total. Cada numerador cuenta usuarios únicos en el paso siguiente y cada denominador en el anterior. Segmentos por plataforma, canal, dispositivo, región y cohorte revelan dónde se concentra el abandono. Reviso duplicados, pasos omitidos, zonas horarias, cuentas de prueba y eventos tardíos.
Posibles preguntas de seguimiento
¿Cómo impondrías el orden de eventos?
¿Cómo investigarías una caída repentina en onboarding?
¿Cómo visualizarías el embudo?
Preguntas sobre métricas y casos de negocio
Estos casos evalúan si defines la métrica adecuada, segmentas cambios con sentido y recomiendas una acción con un nivel de confianza proporcionado.
Primero compruebo si la caída es real: cambios de instrumentación, retrasos de pipeline, zonas horarias, filtros de bots, versiones y comparación con datos sin procesar. Después segmento por plataforma, versión, región, canal, antigüedad, plan, dispositivo y fuente.
Reviso el recorrido: ¿cayeron aperturas, inicios de sesión, vistas o acciones principales? Aperturas estables con menos actividad apuntan al producto; menos aperturas pueden indicar notificaciones, adquisición, estacionalidad, una caída del servicio o un factor externo. La medida responde a la causa, como revertir una versión con más fallos. Si los datos llegan tarde, comunico la limitación en vez de crear falsa urgencia.
Posibles preguntas de seguimiento
¿Qué visualización revisarías primero?
¿Cómo distinguirías estacionalidad de una regresión?
Aclaro si el objetivo es descubrimiento, interacción, conversión, retención o cesta. La métrica principal debe reflejar valor, no solo clics; en comercio electrónico, por ejemplo, compras procedentes de recomendaciones por usuario activo.
Los impulsores pueden incluir impresiones, CTR, añadir a cesta, conversión, ingresos por sesión, cobertura y diversidad. Los controles incluyen devoluciones, reembolsos, clics irrelevantes, latencia, quejas y canibalización. Segmento por usuarios nuevos o recurrentes, categoría, dispositivo y superficie. Un A/B mide el corto plazo; retención y recompra muestran si el valor perdura.
Posibles preguntas de seguimiento
¿Qué ocurre si aumenta el CTR pero no las compras?
¿Cómo medirías la calidad de las recomendaciones?
¿Cómo detectarías canibalización?
Enfoque — Descomponer ingresos en tráfico, conversión, cesta, mezcla, precio y retención
Más tráfico puede compensar una conversión inferior. También puede subir la cesta por precios, paquetes, grandes clientes o productos más caros. Otra posibilidad es tener menos visitantes, pero de mayor valor, o una definición de seguimiento distinta.
Segmento por canal, producto, región, clientes nuevos y recurrentes, grupo y dispositivo. Después descompongo ingresos en sesiones, conversión, cesta, reembolsos y recompra, y verifico si la conversión se mide por sesión, usuario o visitante. La valoración depende de calidad y sostenibilidad, no solo del aumento de ingresos.
Posibles preguntas de seguimiento
¿Qué descomposición harías primero?
¿Qué ocurre si el aumento procede solo de una subida de precios?
¿Cómo comprobarías su sostenibilidad?
Cuadros de mando y visualización
Un buen cuadro de mando no es una colección de gráficos: es una herramienta de decisión para un público claramente definido.
Primero aclaro el público y las decisiones. La dirección necesita una visión resumida de crecimiento, retención, monetización y riesgo, no todo el detalle operativo.
Arriba mostraría MRR, retención neta y bruta, MRR nuevo, expandido, reducido y perdido, clientes activos, conversión de prueba a pago, ARPU, quizá recuperación de CAC y real frente a objetivo. Segmentar por tipo de cliente, canal, plan, región, tamaño y ventas frente a autoservicio permite diagnosticar.
Tendencias, cohortes, un puente de MRR, causas de baja y desviación del objetivo responden si crecemos, por qué, dónde hay riesgo y qué investigar. Deben verse definiciones, actualización, filtros, responsables y umbrales.
Posibles preguntas de seguimiento
¿Qué pondrías en el primer pantallazo?
¿Cómo cambiaría para un Product Manager?
¿Cómo evitarías interpretaciones erróneas?
Enfoque — Aclarar decisión → Explicar riesgo → Proponer una vista mejor
Primero aclaro qué decisión debe facilitar. Después explico el riesgo de forma objetiva: los ingresos acumulados pueden ocultar desaceleración, un gráfico circular con demasiadas categorías puede ocultar diferencias o no mostrar intervalos puede generar falsa precisión.
Propongo una visualización mejor de la misma pregunta: serie temporal, cohortes, embudo, distribución, barras segmentadas o descomposición. Si aún necesitan la vista original, puede incluirse con limitaciones claras; no la presentaría como mi recomendación. Ser útil y mantener la integridad analítica son compatibles.
Posibles preguntas de seguimiento
¿Cómo gestionas la presión de un directivo?
¿Qué gráficos suelen utilizarse mal?
¿Cómo representarías la incertidumbre?
Principios de buenos cuadros de mando
—
Empezar por la decisión y el público, no por el tipo de gráfico.
—
Definir cada métrica dentro del propio cuadro.
—
Mostrar tendencia, objetivo y segmento cuando sea posible.
—
Indicar actualización, fuente, responsable y limitaciones conocidas.
—
No comprimir necesidades ejecutivas, de producto, financieras y operativas en una sola vista.
—
Alertar solo sobre cambios que requieren una acción.
Preguntas sobre Excel y hojas de cálculo
Muchos puestos utilizan hojas intensivamente. Se evalúan fórmulas, tablas dinámicas, limpieza, conciliación y modelos auditables.
Primero perfilo filas, columnas, nulos, duplicados, tipos, valores imposibles, fechas y atípicos, y conservo una copia sin modificar. Después elimino espacios, normalizo nombres, interpreto fechas, convierto unidades y asigno categorías incoherentes a una lista controlada. Antes de deduplicar, defino la clave empresarial.
Luego concilio totales y recuentos con una fuente fiable y compruebo nulos, valores únicos y rangos. Documento las transformaciones, separo datos originales y limpios y evito cambios manuales ocultos.
Posibles preguntas de seguimiento
¿Cómo tratarías filas duplicadas?
¿Qué fórmulas utilizas con mayor frecuencia?
¿Cómo harías auditable el archivo?
Enfoque — Exploración frente a cálculo controlado
Las tablas dinámicas sirven para explorar, agrupar y resumir rápidamente por dimensiones. Las fórmulas son mejores para lógica personalizada, multietapa o auditable, como cohortes, puentes, puntuaciones ponderadas, excepciones o conciliaciones.
En la práctica utilizo tablas dinámicas para detectar patrones y después construyo un modelo controlado. Los informes recurrentes deberían migrar a una canalización reproducible de SQL o BI en lugar de depender de una hoja manual frágil.
Posibles preguntas de seguimiento
¿Qué riesgos tienen las tablas dinámicas?
¿Cómo compararías VLOOKUP con INDEX/MATCH o XLOOKUP?
¿Cuándo moverías un análisis de Excel a SQL o BI?
Competencias importantes
XLOOKUP / INDEX MATCH
Relaciona valores entre tablas. Hay que controlar claves, ausencias, duplicados y coincidencias exactas o aproximadas.
Tabla dinámica
Agrega y segmenta datos con rapidez. Deben validarse el rango de origen, la agregación y los filtros.
Conciliación
Confirma que los totales coinciden con una fuente fiable, como Finanzas, analítica de producto, CRM o facturación.
Experimentos y pruebas A/B
Se evalúa si sabes diseñar, analizar y cuestionar experimentos y qué conclusiones permiten realmente los datos.
La hipótesis es que el nuevo diseño reduce fricción y aumenta compras completadas sin causar daños posteriores. Compruebo unidad de aleatorización, muestra, duración, exposición, elegibilidad y asignación persistente; aleatorizar por sesión puede mezclar variantes para usuarios recurrentes.
La métrica principal es conversión desde inicio del checkout hasta compra. Secundarias: errores de pago, duración, cesta y ventas adicionales. Controles: reembolsos, chargebacks, soporte, latencia, errores y quejas. Además de significación estadística, importa la relevancia práctica. Solo recomendaría desplegar con una mejora útil, controles sanos, seguimiento fiable y efecto estable.
Posibles preguntas de seguimiento
¿Qué ocurre si suben conversión y reembolsos?
¿Cómo evitas mirar resultados demasiado pronto?
¿Qué harías si solo se benefician usuarios nuevos?
No significativo no significa necesariamente sin efecto. Compruebo si muestra y duración podían detectar una diferencia relevante. Después reviso tamaño del efecto e intervalo: uno amplio que incluye beneficio y daño es inconcluso; uno estrecho alrededor de cero sugiere poco impacto.
También considero mantenimiento, riesgo y estrategia. Una función cara sin beneficio medible no debería desplegarse. Si tiene valor estratégico o coste bajo, puede iterarse o medirse mejor. El resumen separa con claridad diseño, observación, confianza, límites y recomendación.
Posibles preguntas de seguimiento
¿En qué se diferencian «sin efecto» e «inconcluso»?
¿Cómo lo explicarías a personas no técnicas?
¿Cuándo repetirías la prueba?
Calidad de datos y criterio analítico
Un análisis solo es tan fiable como sus datos. Se evalúa si detectas errores antes de que impulsen una decisión equivocada.
Primero comparo definiciones: bruto o neto de reembolsos, descuentos, impuestos y chargebacks; fecha de pedido, pago, envío o factura. Después reviso fuentes, filtros y granularidad. Las diferencias pueden proceder de pruebas, cancelaciones, cuentas internas, regiones, joins de líneas, zonas horarias o actualización.
Partiendo de una fuente fiable, creo un puente: sumo o resto cada diferencia identificada hasta conciliar ambas cifras. El resultado no es solo declarar un cuadro incorrecto, sino fijar una definición, un responsable, una fuente oficial y una medida para evitar que se repita.
Posibles preguntas de seguimiento
¿Cómo eliges la fuente oficial?
¿Qué ocurre si Finanzas y Producto necesitan definiciones distintas?
Primero cuantifico ausencias por campo, proporción, segmento, tiempo, fuente y plataforma, porque rara vez son aleatorias. Después identifico la causa: campo opcional, error de seguimiento, retraso, integración, privacidad o valor no aplicable.
Según la causa, excluyo filas, imputo con justificación, creo una categoría desconocida, completo desde otra fuente o limito el análisis. Cero y desconocido no son equivalentes. Explico cómo afectan los datos ausentes a la confianza y si la conclusión se mantiene bajo supuestos razonables.
Posibles preguntas de seguimiento
¿Cuándo puedes excluir filas?
¿Qué riesgo tiene la imputación?
¿Cómo detectarías un fallo de seguimiento?
Ejemplo resuelto
Comprobación de calidad antes de presentar
Quieres demostrar que un nuevo onboarding ha mejorado la activación.
1
Revisar población
Confirma periodo de alta, plataformas, países y criterios de elegibilidad.
2
Revisar métrica
Confirma definición de activación, seguimiento, duplicados, bots, pruebas y eventos tardíos.
3
Revisar comparación
Asegura grupos comparables o controla estacionalidad y mezcla de adquisición en un antes y después.
4
Revisar conclusión
Prueba la afirmación en segmentos clave y controla movimientos negativos en métricas de protección.
Resultado
El análisis es más creíble porque explica tanto el resultado como su solidez.
Preguntas de comportamiento e interesados
Estas preguntas abordan ambigüedad, presión, comunicación, priorización y situaciones donde los datos no respaldaron la respuesta deseada.
Elijo una historia donde mi análisis influyera en un lanzamiento, precio, marketing, producto, operación o prioridad. Explico de forma accesible qué datos y métricas utilicé, qué segmentos importaban y qué hallazgo inesperado apareció, sin perderme en herramientas.
Después expongo recomendación e impacto: por ejemplo, reasignar presupuesto tras detectar un canal deficitario o revertir una función que elevaba clics pero dañaba retención. Incluyo límites, incertidumbre y cómo alineé a los interesados.
Aclaro primero la decisión, el plazo y el riesgo. Para una decisión reversible y de poco riesgo puede bastar una orientación preliminar; para ingresos, clientes, cumplimiento o estrategia, el estándar de calidad debe ser mayor.
Separo lo que puede responderse hoy de lo que no y, como máximo, doy una estimación preliminar etiquetada con su confianza. A la vez detallo limpieza, validación, conciliación y fecha de una respuesta fiable. Así el interesado puede actuar sin convertir una cifra rápida y errónea en una falsa verdad.
Priorizo por impacto, urgencia, esfuerzo, dependencias y reversibilidad de la decisión. Un análisis para un lanzamiento mañana suele superar una mejora opcional de un cuadro.
Para cada solicitud aclaro decisión y responsable. Los informes manuales recurrentes son candidatos a automatización. Cuando existe conflicto, explico qué puede entregarse y cuándo, qué decisión depende de ello y por qué recomiendo ese orden. El tiempo analítico debe utilizarse donde mejora decisiones, no solo para cerrar solicitudes.
Posibles preguntas de seguimiento
¿Cómo dices que no?
¿Qué trabajo automatizarías?
¿Cómo tratas una petición de dirección?
Estrategia de preparación para Data Analysts
Combina SQL, casos empresariales, crítica de cuadros, hojas de cálculo y comunicación. El objetivo es responder con precisión, claridad y orientación a decisiones.
Plan de preparación de cuatro semanas
1
Semana 1: fundamentos de SQL. Practica joins, GROUP BY, HAVING, fechas, nulos, CASE y agregación correcta.
Semana 3: casos analíticos. Practica caídas de métricas, experimentos, ingresos, cuadros y recomendaciones.
4
Semana 4: comunicación y simulaciones. Explica análisis con claridad, defiende supuestos y presenta proyectos.
Énfasis según el tipo de empresa
—
Analítica de producto: embudos, retención, experimentos, eventos, segmentación y recomendaciones.
—
Comercio electrónico: ingresos, conversión, cesta, repetición, inventario, marketing y devoluciones.
—
Fintech: conciliación, riesgo, fraude, cumplimiento, cohortes y precisión financiera.
—
B2B SaaS: MRR, ARR, retención neta y bruta, pipeline, activación, expansión y bajas.
—
Operaciones: SLA, capacidad, productividad, costes, colas, calidad y causas raíz.
No memorices solo consultas
Los entrevistadores cambian esquemas, definiciones y casos límite. Aprende a razonar sobre granularidad, cardinalidad, población y validación para poder adaptar SQL y análisis a datos nuevos.
Idea clave
Las mejores respuestas combinan SQL correcto, definiciones precisas, criterio empresarial, comprobaciones de calidad y comunicación clara. El objetivo no es producir más cifras, sino ayudar a tomar una decisión mejor con evidencia fiable.
Practica estas preguntas en directo
Interview Pilot te sugiere respuestas en tiempo real durante entrevistas reales para ayudarte a responder con claridad.