MINERIA DE DATOS
|
|
Título del Test:
![]() MINERIA DE DATOS Descripción: PRACTICA EXAMEN |



| Comentarios |
|---|
NO HAY REGISTROS |
|
Patrones de fallas industriales pertenecen a: a. Turismo. b. Política. c. Manufactura. d. Educación. La media del monto de compra es mayor que la mediana. ¿Qué indica esto?. a. Distribución simétrica. b. Distribución uniforme. c. Distribución asimétrica con sesgo a la derecha. d. Distribución normal. Una empresa de comercio electrónico analiza millones de registros históricos para identificar comportamientos repetitivos de compra. Cuando el sistema descubre asociaciones que no eran evidentes para los analistas humanos, se está aplicando principalmente _ _ _ _ _ _ _. Si posteriormente esa información se muestra mediante dashboards ejecutivos y reportes comparativos para apoyar reuniones gerenciales, la herramienta utilizada pertenece más al ámbito de _ _ _ _ _ _ _ _ _ _ _ _ _.Finalmente, cuando la empresa utiliza esos resultados para anticipar comportamientos futuros de consumo, se habla de _ _ _ _ _ _ _ _ _. a. minería de datos. inteligencia de negocios. análisis predictivo. b. inteligencia de negocios. análisis predictivo. minería de datos. c. análisis predictivo. minería de datos. inteligencia de negocios. ¿En cuál de las dos graficas el promedio podría no representar adecuadamente a la mayoría de los datos?. a. En ambos datasets por igual. Dataset B. Dataset A. En ninguno de los datasets. ¿Cuál es el objetivo principal de la minería de datos?. a. Almacenar grandes volúmenes de datos. b. Diseñar bases de datos relacionales. c. Generar reportes estáticos. d. Descubrir patrones y conocimiento útil en los datos. ¿por qué la minería de datos es especialmente útil en análisis exploratorios?. a. porque confirma hipótesis previas. b. Porque permite descubrir conocimiento sin supuestos iniciales. c. Porque genera reportes automáticos. d. Porque elimina la necesidad de expertos. ¿Qué muestra eI gráfico de dispersión entre edad y monto de compra?. a. Relación inversa clara. b. Ausencia de relación lineal clara. c. Relación causal. d. Relación lineal fuerte. Al comparar la media y la mediana de la edad, ¿qué se puede concluir?. a. La distribución de la edad es aproximadamente simétrica. b. La edad no es confiable. c. La edad tiene muchos valores extremos. d. La edad es asimétrica. Agrupar pacientes sin conocer grupos es: a. Regresivo. b. Supervisado. c. No supervisado. d. Predictivo. EI aprendizaje no supervisado se caracteriza porque: a. Usa resultados conocidos. b. Trabaja con datos sin etiquetas. c. Predice valores futuros. d. Clasifica registros. PCA se usa principalmente para: a. Clasificar. b. Detectar fraude. c. Predecir valores. Reducir dimensionalidad. ¿Cuál NO es objetivo de un modelo descriptivo?. a. Identificar patrones. b. Predecir valores futuros. c. Explorar datos. d. Resumir información. ¿Cómo complementa la visualización de datos a la minería de datos?. a. Sustituyendo los algoritmos. b. Reduciendo los datos automáticamente. c. Eliminando el análisis estadístico. d. Facilitando la interpretación de patrones complejos. ¿Cuáles de las siguientes afirmaciones son correctas sobre PCA? (Seleccione todas las correctas). a. Facilita la visualización de datos complejos. Reduce la dimensionalidad. Combina variables originales. b. Es una técnica supervisada. c. Se usa para predecir valores futuros. Seleccione las afirmaciones correctas sobre los loadings en PCA. Seleccione todas las opciones correctas. Seleccione una o más de una: a. Representan los registros eliminados del dataset. b. Permiten identificar qué variables pesan más en CPI o CP2. Ayudan a interpretar los componentes principales. Indican la influencia de las variables originales. c. Son métricas de precisión de un modelo supervisado. Empareje el problema con la consecuencia. Variables redundantes: Información repetida. Análisis más lento. Mayor complejidad. Ruido. Empareje el problema con la consecuencia. Muchas variables: Información repetida. Análisis más lento. Mayor complejidad. Ruido. Empareje el problema con la consecuencia. Alta dimensionalidad: Información repetida. Análisis más lento. Mayor complejidad. Ruido. Empareje el problema con la consecuencia. Variables irrelevantes: Información repetida. Análisis más lento. Mayor complejidad. Ruido. ¿Qué se entiende por dimensión en un conjunto de datos?. a. Un registro del dataset. b. Un modelo predictivo. c. Una variable o característica. d. Un algoritmo. Si no se hubiera aplicado StandardScaler antes de PCA, el efecto más probable sería: a. La varianza explicada sería cero. b. PCA no se ejecutaría. c. Las variables con mayor escala dominarían los componentes. d. CPI y CP2 serían idénticos. ¿Qué diferencias existen entre selección de características y PCA? Seleccione todas las respuestas correctas. Seleccione una o más de una: a. Selección conserva variables originales. Selección es más fácil de interpretar. PCA crea nuevas variables. PCA es más abstracto. b. PCA elimina únicamente registros duplicados. ¿Qué riesgos tienen las variables redundantes? Seleccione todas las respuestas correctas. Seleccione una o más de una. a. Mejoran automáticamente precisión. b. Información repetida. Mayor complejidad. Dificultan interpretación. c Eliminan ruido. ¿Cuál de los siguientes métodos es una técnica de extracción de características?. a. PCA. b. Discretización. c. Eliminación de columnas. d. Filtrado manual. En PCA, los componentes principales se ordenan según: a. La correlación entre filas. b. EI número de variables originales. c. EI orden del dataset. d. La varianza que explican. Empareje el color de la matriz con el significado. Color cercano a gris Valor negativo Rojo intenso Azul intenso. Correlación cercana a cero Cuando una variable aumenta, la otra disminuye Correlación positiva fuerte Correlación negativa fuerte. Cuando una variable aumenta, la otra disminuye Correlación positiva fuerte Correlación negativa fuerte Correlación cercana a cero. ¿Qué variables presentan correlaciones altas?. a. Promociones y Capacitaciones_anio. b. Experiencia_anios y Edad. c. Experiencia_anios y Antiguedad_empresa_anios. d. Satisfaccion_1a10 y Evaluacion_Desempeno. Seleccione los problemas asociados a un dataset de alta dimensionalidad. Seleccione todas las opciones correctas. Seleccione una o más de una: a. Dificultad para visualizar patrones. Mayor complejidad computacional. Mayor dificultad para interpretar resultados. b. Eliminación automática de variables irrelevantes. c. Garantía de obtener siempre mejores modelos. Empareje la correlación con el nivel de relación. 0.81 -0.72 0.68 0.07. Alta Negativa fuerte Moderada Muy débil. Negativa fuerte Moderada Muy débil Alta. Si NO se hubiera aplicado StandardScaler antes de PCA, el resultado más probable sería: a. PCA no funcionaría. b. Nose podría calcular la varianza. c. Las variables de mayor escala dominarían los componentes. d. CPI y CP2 serían iguales. Con el porcentaje de varianza obtenido, ¿para qué escenario NO seria suficiente usar solo dos componentes?. a. Detección de patrones generales. b. Modelado predictivo. c. Visualización exploratoria. d. Identificación de outliers. Considere la siguiente matriz de confusión: Asumiendo que: • O = NO tiene diabetes • 1 = Tiene diabetes ¿Cuántos pacientes fueron clasificados como sanos cuando en realidad tenían diabetes?. a. 285. b. 678. c. 145. d. 122. |




