Cuestionario de Minería de Datos
|
|
Título del Test:
![]() Cuestionario de Minería de Datos Descripción: SIMULADORES DE MINERIA DE DATOS |



| Comentarios |
|---|
NO HAY REGISTROS |
|
En la práctica, los dos primeros componentes explicaron ≈49% de la varianza total. ¿Qué se puede concluir correctamente?. La información es insuficiente para análisis exploratorio. No era necesario escalar. El dataset es complejo y requiere más componentes. PCA falló. Una plataforma de streaming usa historial y calificaciones previas para predecir si un usuario dará una calificación positiva a una nueva película. Este problema es de: Agrupamiento. No supervisado. Supervisado. Exploración. Decisiones paso a paso usan: PCA. Árboles de decisión. Clustering. Reglas de asociación. La selección de características consiste en: Eliminar variables irrelevantes o redundantes. Transformar datos en gráficos. Aplicar clustering. Crear nuevas variables combinadas. ¿Qué disciplina aporta técnicas como indexación y acceso eficiente a los datos?. Bases de datos. Estadística. Visualización. Inteligencia artificial. ¿Cuál de los siguientes métodos es una técnica de extracción de características?. Discretización. PCA. Filtrado manual. Eliminación de columnas. Patrones de fallas industriales pertenecen a: Turismo. Manufactura. Educación. Política. Detectar fraude en tarjetas corresponde a: Medicina. Finanzas y banca. Marketing. Educación. Identifique el tipo de problema predictivo descrito. Una empresa desea estimar el costo mensual de mantenimiento según el número de usuarios. Regresión logística. Regresión lineal. Clustering. Clasificación. Un falso positivo ocurre cuando: El modelo predice positivo y es realmente negativo. El modelo acierta positivo. El modelo acierta negativo. El modelo predice negativo y es positivo. ¿Cuáles son características del Análisis de Componentes Principales ?. PCA categorizar los datos. PCA puede usarse antes de clustering. PCA combina variables. PCA elimina filas. En el proceso de minería de datos, ¿cuál es el rol principal del ser humano?. Programar sensores. Almacenar los datos. Ejecutar manualmente los algoritmos. Definir objetivos, interpretar resultados y tomar decisiones. ¿Cuál es una aplicación actual típica de la minería de datos?. Contabilidad básica. Sistemas de recomendación. Procesamiento de texto simple sin análisis. Escritura manual. ¿Para qué fue útil PCA en esta práctica?. Reemplazar el dataset original. Identificar outliers. Detectar agrupamientos. Predecir precios de viviendas. Reducir la complejidad visual. Predecir demanda de energía es: Supervisado. Agrupamiento. No supervisado. Asociación. ¿Qué disciplina aporta conceptos como media, varianza y regresión?. Estadística. Bases de datos. Aprendizaje automático. Visualización de datos. Un sistema analiza correos con variables como presencia de palabras ("gratis", "oferta”), número de enlaces y remitente. ¿Qué algoritmo del tema se asocia clásicamente a este escenario por su enfoque probabilístico?. Regresión lineal. K-NN. Naive Bayes. Clustering k-means. La reducción de dimensionalidad se considera una técnica de: Visualización. Preprocesamiento. Validación de modelos. Postprocesamiento. ¿Qué se entiende por dimensión en un conjunto de datos?. Un modelo predictivo. Una variable o característica. Un registro del dataset. Un algoritmo. ¿Cuál de los siguientes problemas surge al analizar datasets con muchas variables?. Mayor facilidad de interpretación. Mayor consumo de recursos y complejidad. Resultados más claros automáticamente. Menor tiempo de procesamiento. ¿Por qué la minería de datos es especialmente útil en análisis exploratorios?. Porque permite descubrir conocimiento sin supuestos iniciales. Porque elimina la necesidad de expertos. Porque confirma hipótesis previas. Porque genera reportes automáticos. Un modelo con buen accuracy puede NO ser adecuado en salud si (seleccione todas las correctas): Tiene muchas variables predictoras. Se usa como única fuente de decisión. Presenta muchos falsos negativos. No considera impacto humano. Empareje tarea y resultado. Regresión. Predicción. Clasificación. Con base en los histogramas de los Dataset A y B, ¿Cuáles afirmaciones son correctas? (Seleccione todas las correctas). Ambos datasets presentan una distribución uniforme. El Dataset A presenta una distribución aproximadamente simétrica. En el Dataset B los valores altos aparecen con menor frecuencia. El Dataset B presenta una distribución sesgada a la derecha. ¿Cuál NO es objetivo de un modelo descriptivo?. Resumir información. Predecir valores futuros. Explorar datos. Identificar patrones. ¿Por qué la minería de datos se considera una disciplina multidisciplinaria?. Porque reemplaza a la estadística. Porque solo usa bases de datos. Porque integra técnicas de estadística, aprendizaje automático, bases de datos y visualización. Porque funciona únicamente con Big Data. El aprendizaje supervisado se caracteriza porque: Solo agrupa datos. Trabaja con datos etiquetados. No requiere variable objetivo. No usa datos históricos. ¿Por qué el gráfico de barras es más adecuado que un gráfico de líneas para comparar ventas por trimestre?. Porque muestra mejor los valores atípicos. Porque los trimestres son categorías discretas. Porque reduce el número de datos. Porque permite observar correlaciones. ¿Qué tipo de datos maneja principalmente la minería de datos?. Grandes volúmenes de datos. Datos no estructurados únicamente. Solo datos pequeños. Datos manuales. Reducir dimensionalidad siempre implica: Convertir variables categóricas. Mejor desempeño garantizado. No perder nunca información. Posible pérdida parcial de información. Un sistema de recomendación (p. ej., Netflix/Amazon) se apoya en técnicas de minería de datos para sugerir contenido. ¿Cuál opción describe mejor su lógica general?. Solo clustering, porque siempre agrupa usuarios. Combina clasificación y/o predicción sobre datos históricos para sugerir ítems. Solo reglas de asociación, porque no usa modelos supervisados. No usa datos históricos; recomienda aleatoriamente. Predecir inundaciones corresponde a: Ciencias y medio ambiente. Educación. Turismo. Marketing. Clasificar una transacción como fraude o no fraude es un ejemplo de: Clasificación. Regresión. PCA. Agrupamiento (clustering). ¿Cuál de los siguientes métodos es una técnica de extracción de características?. Discretización. Eliminación de columnas. PCA. Filtrado manual. Clasificar correos como spam/no spam es: No supervisado. Supervisado. Exploratorio. Descriptivo. Un modelo con alto accuracy pero clases desbalanceadas puede: Ser siempre excelente. No ser confiable. No tener errores. Ser no supervisado. En un contexto educativo, un falso negativo implica (seleccione todas las correctas): Mejora del rendimiento académico. Posible desmotivación injustificada. Eliminación del error humano. Un estudiante aprobado es clasificado como no aprobado. La línea de código df [num_cols].describe() en Pandas sirve para generar un resumen estadístico descriptivo de las columnas numéricas ( num_cols ) seleccionadas dentro de un DataFrame (df ). El valor count del resumen estadístico ¿Qué representa este valor?. El valor máximo. El promedio de compras. La cantidad de variables. El número de registros. ¿Qué gráfico permite analizar la relación entre dos variables numéricas?. Gráfico de barras. Histograma. Gráfico de dispersión. Gráfico de líneas. ¿Cuáles son beneficios de la visualización de datos?. Apoyar decisiones. Detectar valores atípicos. Reemplazar algoritmos. Comprender patrones. Selección de personal usa: Web. Educación. Recursos Humanos. Turismo. Completa: En el caso Edad → Estatura, el objetivo principal del modelo es. capturar la tendencia promedio. PCA se usa principalmente para: Detectar fraude. Predecir valores. Clasificar. Reducir dimensionalidad. ¿Cuál es el objetivo principal de la minería de datos?. Diseñar bases de datos relacionales. Generar reportes estáticos. Descubrir patrones y conocimiento útil en los datos. Almacenar grandes volúmenes de datos. En el proceso general de minería de datos (recolección → preparación → construcción → evaluación → uso), ¿en qué fase se aplica directamente un algoritmo de clasificación (p. ej., K-NN, Naive Bayes, árbol, regresión logística)?. Construcción del modelo. Recolección de datos. Preparación de datos. Uso del modelo en nuevos datos. Un modelo de regresión logística estima P(Riesgoso) para un cliente. Si la política del banco define umbral 0.70, ¿cuándo se clasifica como Riesgoso?. Cuando P(Riesgoso) ≥ 0.70. Cuando P(Riesgoso) ≤ 0.70. Cuando el cliente es similar a sus 3 vecinos más cercanos. Cuando el árbol llega a una hoja con mayoría Riesgoso. El proceso KDD incluye: Crear una base de datos. Solo aplicar un algoritmo. Hacer un gráfico final. Preparación, selección de técnica, aplicación e interpretación/validación. ¿Por qué es importante clasificar las variables en numéricas y categóricas antes del análisis?. Para reducir el tamaño del dataset. Porque cada tipo requiere análisis y gráficas distintas. Para usar el mismo gráfico en todas. Para eliminar columnas. ¿Qué librería se usa para gráficos interactivos en Python?. pandas. matplotlib. plotly. seaborn. En K-NN, un nuevo estudiante es comparado con los K estudiantes más similares. ¿Cómo se determina la clase final (p. ej., “Aprueba/No aprueba") en la forma más común de K-NN para clasificación?. Se construye una jerarquía de reglas desde una raíz. Se calcula una probabilidad con el teorema de Bayes. Se ajusta una recta y se predice un valor continuo. Se elige la clase más frecuente entre los K vecinos. Con el porcentaje de varianza obtenido, ¿para qué escenario NO sería suficiente usar solo dos componentes?. Modelado predictivo. Visualización exploratoria. Detección de patrones generales. Identificación de outliers. ¿Qué tipo de atributo es la variable "ciudad"?. Categórico. Numérico discreto. Date. Numérico continuo. Caso: Una empresa tiene información de clientes, pero no sabe quiénes son “buenos” o “malos”. Solo desea agrupar clientes según comportamiento de compra. ¿Qué enfoque es el más adecuado?. Predicción, porque estima valores futuros. Clustering, porque no hay etiquetas y se buscan grupos por similitud. Recomendación, porque sugiere productos de inmediato. Clasificación, porque asigna una clase conocida. Reducir el dataset a dos componentes principales significa que: Se eliminaron variables irrelevantes. Se conservaron solo dos columnas originales. Cada registro ahora se describe con dos combinaciones de variables. El dataset perdió la mayoría de los registros. Una institución tiene datos (horas de estudio, asistencia, participación) y además conoce si cada estudiante aprobó o reprobó. Se entrena un modelo para predecir si un nuevo estudiante aprobará. ¿Qué tipo de aprendizaje es?. Reforzado. No supervisado. Supervisado. Semi-supervisado. El PCA (Análisis de Componentes Principales) es una técnica: De clasificación. De regresión. No supervisada. Supervisada. En minería de datos, un modelo se define como: Un reporte visual. Un conjunto de tablas. Un software de análisis. Una representación matemática o estadística construida a partir de datos. Estimar el precio de una vivienda según su tamaño y ubicación corresponde a: Reglas de asociación. Regresión. Clustering. Resumen. ¿Cuál es una aplicación actual típica de la minería de datos?. Procesamiento de texto simple sin análisis. Contabilidad básica. Sistemas de recomendación. Escritura manual. ¿Por qué la minería de datos se considera una disciplina multidisciplinaria?. Porque integra técnicas de estadística, aprendizaje automático, bases de datos y visualización. Porque funciona únicamente con Big Data. Porque solo usa bases de datos. Porque reemplaza a la estadística. La reducción de dimensionalidad se considera una técnica de: Visualización. Preprocesamiento. Validación de modelos. Postprocesamiento. ¿Cuál de las siguientes NO es una estrategia de reducción de datos?. Compresión de datos. Normalización de bases de datos. Reducción de dimensionalidad. Reducción de numerosidad. Clasificar correos como spam/no spam es: No supervisado. Exploratorio. Descriptivo. Supervisado. Identifique el tipo de problema predictivo descrito. Una empresa desea estimar el costo mensual de mantenimiento según el número de usuarios. Clasificación. Regresión lineal. Regresión logística. Clustering. El PCA (Análisis de Componentes Principales) es una técnica: De clasificación. De regresión. No supervisada. Supervisada. En minería de datos, un modelo se define como: Un reporte visual. Un conjunto de tablas. Un software de análisis. Una representación matemática o estadística construida a partir de datos. Estimar el precio de una vivienda según su tamaño y ubicación corresponde a: Reglas de asociación. Regresión. Clustering. Resumen. ¿Cuál es una aplicación actual típica de la minería de datos?. Procesamiento de texto simple sin análisis. Contabilidad básica. Sistemas de recomendación. Escritura manual. ¿Por qué la minería de datos se considera una disciplina multidisciplinaria?. Porque integra técnicas de estadística, aprendizaje automático, bases de datos y visualización. Porque funciona únicamente con Big Data. Porque solo usa bases de datos. Porque reemplaza a la estadística. La reducción de dimensionalidad se considera una técnica de: Visualización. Preprocesamiento. Validación de modelos. Postprocesamiento. ¿Cuál de las siguientes NO es una estrategia de reducción de datos?. Compresión de datos. Normalización de bases de datos. Reducción de dimensionalidad. Reducción de numerosidad. Clasificar correos como spam/no spam es: No supervisado. Exploratorio. Descriptivo. Supervisado. ¿Cuál afirmación es correcta?. Supervisado es descriptivo. Ambos son iguales. Ninguno usa datos. Supervisado es predictivo y no supervisado descriptivo. La línea de código df [num_cols].describe() en Pandas sirve para generar un resumen estadístico descriptivo de las columnas numéricas ( num_cols ) seleccionadas dentro de un DataFrame (df ). La media del monto de compra es mayor que la mediana. ¿Qué indica esto?. Distribución simétrica. Distribución uniforme. Distribución asimétrica con sesgo a la derecha. Distribución normal. Un sistema de recomendación combina: Solo clasificación. Solo clustering. Técnicas de clasificación y predicción. Solo regresión. ¿Qué ventaja ofrece el proceso KDD frente a aplicar solo algoritmos de minería de datos?. Reduce el tamaño de los datos. Automatiza decisiones sin intervención. Elimina la necesidad de validación. Asegura un proceso completo desde datos crudos hasta conocimiento útil. ¿Qué caracteriza a un patrón “interesante” en minería de datos?. Que sea útil, válido y comprensible. Que sea complejo. Que sea matemático. Que use IA. ¿Qué categoría de producto presenta la mediana de monto de compra más alta?. Ropa. Alimentos. Otros. Electrónica. En minería de datos, un modelo se define como: Un reporte visual. Un conjunto de tablas. Un software de análisis. Una representación matemática o estadística construida a partir de datos. Si se quisiera conservar al menos el 80% de la información original, la acción más adecuada sería: Aumentar el número de componentes. Eliminar variables manualmente. Usar únicamente CP1. No aplicar PCA. Clasificar una transacción como fraude o no fraude es un ejemplo de: Clasificación. Regresión. PCA. Agrupamiento (clustering). Un modelo con alto accuracy pero clases desbalanceadas puede: Ser siempre excelente. No ser confiable. No tener errores. Ser no supervisado. Predecir demanda de energía es: Asociación. Supervisado. No supervisado. Agrupamiento. ¿Qué categoría de producto presenta la mediana de monto de compra más alta?. Ropa. Alimentos. Otros. Electrónica. En el proceso general de minería de datos (recolección → preparación → construcción → evaluación → uso), ¿en qué fase se aplica directamente un algoritmo de clasificación (p. ej., K-NN, Naive Bayes, árbol, regresión logística)?. Construcción del modelo. Recolección de datos. Preparación de datos. Uso del modelo en nuevos datos. Un modelo de regresión logística estima P(Riesgoso) para un cliente. Si la política del banco define umbral 0.70, ¿cuándo se clasifica como Riesgoso?. Cuando P(Riesgoso) ≥ 0.70. Cuando P(Riesgoso) ≤ 0.70. Cuando el cliente es similar a sus 3 vecinos más cercanos. Cuando el árbol llega a una hoja con mayoría Riesgoso. Los dos primeros componentes explicaron aproximadamente el 48.9% de la varianza total. Esto indica que el dataset: Perdió información irrelevante. Contiene información distribuida en varias dimensiones. No es adecuado para PCA. Es simple y fácil de resumir. Un sistema recibe correos etiquetados como “spam” o “no spam” y aprende a clasificar nuevos correos. Este es un ejemplo de: Supervisado. Exploratorio. No supervisado. Agrupamiento. La regresión logística se utiliza cuando la variable objetivo representa una. decisión binaria. Un modelo que estima la demanda futura de un producto es: Exploratorio. Predictivo. Descriptivo. No supervisado. ¿Cuál de los siguientes es un ejemplo de modelo predictivo?. Predecir si una transacción será fraudulenta. Resumir ventas mensuales. Agrupar usuarios por intereses. Identificar productos más vendidos. Naive Bayes se basa en: Árboles jerárquicos. Varianza máxima. Distancia euclidiana. Teorema de Bayes. ¿Cuál de las siguientes NO es una estrategia de reducción de datos?. Reducción de dimensionalidad. Normalización de bases de datos. Reducción de numerosidad. Compresión de datos. Ventaja del aprendizaje no supervisado: Usa etiquetas. Predice con exactitud. Requiere variable objetivo. Descubre patrones ocultos. ¿Cuál es una ventaja clave de las gráficas interactivas?. Reducen el tamaño del dataset. Reemplazan la minería de datos. Permiten explorar subconjuntos de datos. Eliminan valores atípicos. ¿Cuál afirmación es correcta?. Supervisado es descriptivo. Ambos son iguales. Ninguno usa datos. Supervisado es predictivo y no supervisado descriptivo. ¿Cuál de las siguientes afirmaciones sobre PCA es correcta?. Selecciona variables originales. Funciona solo con datos categóricos. Es una técnica supervisada. Combina variables para crear nuevas. Los dos primeros componentes explicaron aproximadamente el 48.9% de la varianza total. Esto indica que el dataset: Perdió información irrelevante. Contiene información distribuida en varias dimensiones. No es adecuado para PCA. Es simple y fácil de resumir. La imagen que enviaste solo muestra la pregunta y las opciones, pero no aparecen los histogramas de los Dataset A y B, que son indispensables para determinar cuáles afirmaciones son correctas. Gráfico de dispersión. Boxplot (Diagrama de caja). Gráfico de barras. Histograma. Empareje la librería de Python con su función. pandas. matplotlib. seaborn. plotly. Con base en los histogramas de los Dataset A y B, ¿Cuáles afirmaciones son correctas? (Seleccione todas las correctas). En el Dataset B los valores altos aparecen con menor frecuencia. El Dataset B presenta una distribución sesgada a la derecha. El Dataset A presenta una distribución aproximadamente simétrica. Ambos datasets presentan una distribución uniforme. ¿Cuáles son características del Análisis de Componentes Principales ? Seleccione una o más de una: a. PCA combina variables. b. PCA puede usarse antes de clustering. c. PCA elimina filas. d. PCA categorizar los datos. ¿Qué librerías se usan para visualización en Python? Seleccione una o más de una: a. seaborn. b. sklearn. c. plotly. d. matplotlib. |





