option
Cuestiones
ayuda
daypo
buscar.php

test business intelligence

COMENTARIOS ESTADÍSTICAS RÉCORDS
REALIZAR TEST
Título del Test:
test business intelligence

Descripción:
test business intelligence

Fecha de Creación: 2026/09/24

Categoría: Otros

Número Preguntas: 180

Valoración:(0)
COMPARTE EL TEST
Nuevo ComentarioNuevo Comentario
Comentarios
NO HAY REGISTROS
Temario:

1. ¿Qué descripción recoge mejor el alcance de Business Intelligence?. Registra operaciones diarias y confirma transacciones en los sistemas de origen. Integra datos, define indicadores y facilita análisis para apoyar decisiones. Entrena modelos predictivos como requisito de cualquier informe de gestión. Diseña gráficos sobre datos recibidos, dejando fuera su integración y calidad.

2. Un servicio estudia las incidencias recibidas y resueltas durante cada mes del último año. ¿Qué tipo de análisis realiza principalmente?. Prescriptivo. Predictivo. Descriptivo. Diagnóstico causal.

3. Se desea recomendar una distribución de turnos que minimice las esperas, respetando la cobertura mínima y las horas disponibles. ¿Qué análisis encaja mejor?. Diagnóstico. Prescriptivo. Descriptivo. Exploratorio de frecuencias.

4. Un informe encuentra que las incidencias aumentaron tras instalar una versión de una aplicación. ¿Qué conclusión está justificada con esa asociación temporal por sí sola?. La versión instalada queda demostrada como causa de todas las incidencias. La coincidencia temporal permite descartar cualquier factor adicional. El aumento demuestra que el sistema de recogida de datos es incorrecto. Existe una relación que debe investigarse antes de atribuir causalidad.

5. ¿Qué caracteriza a un DSS o sistema de apoyo a la decisión?. Exige que cualquier decisión se obtenga mediante aprendizaje automático. Sustituye los procesos de negocio por un registro de eventos técnicos. Se limita a almacenar copias de seguridad de bases operativas. Puede combinar datos, simulaciones, reglas y modelos para ayudar a decidir.

6. ¿Qué operación representa mejor una carga OLTP?. Comparar ventas de cinco años por región y familia de producto. Confirmar una reserva consultando y actualizando unas pocas filas. Explorar un cubo histórico mediante distintas jerarquías geográficas. Agregar millones de movimientos para obtener un resumen anual.

7. Una transferencia debe confirmar conjuntamente el cargo y el abono, o deshacer ambos. ¿Qué propiedad ACID expresa este requisito?. Atomicidad. Aislamiento. Durabilidad. Consistencia eventual.

8. ¿Qué garantiza la consistencia en el sentido de ACID?. Que cualquier consulta encuentre siempre una fila para cada entidad. Que las transacciones preserven las reglas e invariantes definidos. Que todas las réplicas respondan inmediatamente con el último valor. Que todo dato introducido coincida con la realidad del mundo exterior.

9. ¿Qué nivel de aislamiento pretende que el resultado sea equivalente a ejecutar las transacciones de una en una?. Serializable. Consistencia eventual. Read uncommitted. Read committed.

10. Una consulta extensa usa MVCC y no bloquea las filas leídas. ¿Puede aun así perjudicar al sistema operativo?. No, porque toda lectura multiversión se ejecuta fuera del motor principal. Sí, porque consume recursos como CPU, memoria, disco y ancho de banda. No, porque MVCC proporciona recursos independientes para cada consulta. Sí, pero únicamente si contiene una instrucción de modificación de datos.

11. Un usuario explora interactivamente datos cargados la noche anterior. ¿Por qué la actividad puede considerarse OLAP?. Porque la palabra online determina la frecuencia de las cargas del almacén. Porque cualquier consulta sobre una base relacional se clasifica como OLAP. Porque OLAP exige que la información permanezca sin actualizar durante un día. Porque la interacción analítica no exige que los datos se hayan generado en ese instante.

12. ¿Qué objetivo persigue HTAP?. Combinar cargas transaccionales y analíticas mediante una arquitectura adecuada. Convertir cualquier almacén analítico en una base sin actualizaciones. Reemplazar las transacciones por informes ejecutados al final del día. Impedir que las aplicaciones operativas conserven datos históricos.

13. ¿Qué conjunto corresponde a las propiedades clásicas de un data warehouse asociadas a Inmon?. Orientación a objetos, independencia, actualización inmediata y fragmentación. Orientación a temas, integración, variación temporal y no volatilidad. Procesamiento en memoria, replicación, consistencia eventual y acceso por clave. Normalización obligatoria, ausencia de historia, centralización física y volatilidad.

14. ¿Qué actuación es compatible con la no volatilidad de un data warehouse?. Modificar cada consulta el histórico sin conservar reglas de interpretación. Prohibir todas las cargas posteriores a la creación del almacén. Reemplazar continuamente las medidas históricas por valores aleatorios. Corregir datos erróneos mediante un procedimiento de carga controlado.

15. Un área crea un data mart directamente desde aplicaciones internas, sin alimentarse del DW corporativo. ¿Cómo se clasifica por su procedencia?. Híbrido necesariamente. Independiente. Corporativo normalizado. Dependiente.

16. ¿Cómo integra el enfoque de Kimball los modelos de distintos procesos de negocio?. Mediante data marts aislados con definiciones locales incompatibles. Mediante la eliminación del histórico de todas las dimensiones. Mediante dimensiones conformadas y una arquitectura de bus. Mediante una tabla única que mezcla cualquier nivel de detalle.

17. En Data Vault, ¿qué correspondencia es correcta?. Hubs para importes, links para índices físicos y satellites para copias completas. Hubs para consultas, links para servidores y satellites para reglas de particionado. Hubs para gráficos, links para informes y satellites para permisos de usuario. Hubs para claves de negocio, links para relaciones y satellites para atributos e historia.

18. ¿Qué implica que un almacén corporativo proporcione una visión central de la organización?. Que integra y gobierna la información, aunque pueda distribuirse físicamente. Que cada departamento debe emplear sus propias definiciones de indicadores. Que toda la información debe almacenarse en un único servidor. Que el cómputo y el almacenamiento deben residir en el mismo disco.

19. ¿Qué diferencia principal separa ELT de ETL?. En ETL, los datos se cargan antes de cualquier transformación de la canalización. En ELT, se prescinde de la extracción porque los datos se generan en el informe. En ETL, la transformación se realiza necesariamente dentro de la herramienta de BI. En ELT, la transformación considerada se realiza después de cargar en el destino.

20. ¿Cuál de estas operaciones pertenece a la transformación de datos?. Resolver claves de clientes y unificar las zonas horarias de las fechas. Publicar en el destino las filas que ya están transformadas y validadas. Leer de la fuente las filas seleccionadas sin modificar su contenido. Programar el orden de ejecución y los reintentos de los trabajos.

21. Una carga incremental selecciona filas cuya fecha de modificación supera la última marca guardada. ¿Qué riesgo debe tratar expresamente?. Perder borrados, empates o cambios cuya marca temporal no sea fiable. Obligar a sustituir cualquier clave natural por la hora de ejecución. Volver imposible la deduplicación de registros después de la extracción. Convertir automáticamente las filas seleccionadas en datos históricos completos.

22. ¿Qué objetivo tiene Change Data Capture o CDC?. Identificar inserciones, actualizaciones y eliminaciones relevantes en las fuentes. Calcular exclusivamente medias y porcentajes sobre las tablas del destino. Sustituir las dimensiones históricas por una copia de los informes finales. Distribuir los permisos de visualización entre los usuarios del dashboard.

23. Un lote de 200 ventas se ejecuta dos veces, pero el destino conserva una sola representación de cada venta. ¿Qué propiedad demuestra la carga?. Desnormalización. Volatilidad. Idempotencia. Aditividad.

24. ¿Qué estrategia reduce el riesgo de que los informes vean una carga incompleta?. Borrar los registros de ejecución antes de confirmar la publicación. Permitir que cada informe combine versiones arbitrarias de las tablas. Publicar cada fila inmediatamente y omitir controles al terminar el lote. Cargar en estructuras intermedias, validar y publicar de forma controlada.

25. Origen y destino contienen 10.000 filas, pero se quiere comprobar que la carga preservó los importes. ¿Qué control falta?. Reconciliar magnitudes como sumas de importes y claves distintas, además del conteo. Comprobar solo que ambos sistemas utilizan los mismos tipos de columna. Comparar únicamente el nombre de las tablas y su fecha de creación. Confirmar de nuevo el mismo número total de filas y dar por iguales los conjuntos.

26. ¿Qué responsabilidad corresponde principalmente a la orquestación de una canalización?. Coordinar dependencias, planificación, reintentos, alertas y recuperación. Garantizar que los datos de origen carecen de errores del mundo real. Determinar el significado de cada medida sustituyendo al responsable de negocio. Elegir por sí sola las claves naturales correctas de todas las fuentes.

27. ¿Qué función caracteriza a staging?. Servir como zona de trabajo para preparar, integrar y controlar cargas. Almacenar obligatoriamente todos los indicadores históricos del DW. Reemplazar el catálogo y los permisos de acceso de todo el sistema. Mantener exclusivamente los informes definitivos visibles para dirección.

28. ¿Qué necesidad encaja especialmente con un ODS?. Conservar exclusivamente imágenes sin estructura ni posibilidad de consulta. Consultar un estado operativo integrado y relativamente actual de varias fuentes. Publicar cualquier dato bruto sin establecer reglas de integración. Guardar solo resúmenes históricos cerrados que nunca reciban cambios.

29. ¿Qué afirmación describe adecuadamente un data lake?. Carece de estructura y, por definición, no utiliza catálogos ni permisos. Necesita que todos sus ficheros estén gestionados por un clúster Hadoop. Solo admite datos sin tratar y pierde esa condición si contiene tablas depuradas. Puede conservar datos heterogéneos en estados brutos, depurados y listos para consumo.

30. ¿Qué significa schema on read?. Aplicar todas las restricciones del destino antes de recibir cualquier fichero. Modificar el esquema físico de la base cada vez que se lee una fila. Almacenar datos que no pueden tener estructura ni significado acordado. Interpretar los datos mediante una estructura cuando se consultan.

31. ¿Qué situación describe mejor un data swamp?. Un almacén que utiliza columnas para comprimir atributos repetidos. Un lago difícil de utilizar por falta de catálogo, calidad o responsables claros. Una zona temporal que se valida antes de publicar las cargas del día. Un lago que conserva datos brutos junto a tablas depuradas y documentadas.

32. ¿Qué diferencia hay entre Parquet y un formato de tabla como Apache Iceberg?. Parquet organiza datos en ficheros; Iceberg añade gestión tabular mediante metadatos. Parquet es una herramienta de informes; Iceberg es un lenguaje de visualización. Parquet administra transacciones entre tablas; Iceberg solo codifica caracteres. Parquet y Iceberg son nombres equivalentes del mismo formato de fichero.

33. En una arquitectura medallón, ¿qué interpretación es habitual para bronze, silver y gold?. Recepción, depuración y preparación para consumo. Copia principal, réplica síncrona y copia de seguridad. Memoria de CPU, memoria RAM y almacenamiento magnético. Usuarios anónimos, autenticados y administradores.

34. ¿Qué define el grano de una tabla de hechos?. Cuántos índices secundarios tiene cada dimensión. Cuántos megabytes ocupa cada partición física del almacén. Qué algoritmo de compresión utiliza el motor de consultas. Qué acontecimiento o estado representa exactamente cada fila.

35. Una tabla tiene una fila por línea de factura. ¿Qué medida puede sumarse directamente por factura sin duplicar el total, si todas las líneas están presentes?. El importe correspondiente a cada línea. El número total de líneas de la factura repetido en cada fila. El importe completo de la factura repetido en cada línea. El saldo de la cuenta del cliente repetido en cada línea.

36. ¿Por qué un código postal numérico no debe tratarse automáticamente como una medida sumable?. Porque ningún campo de una dimensión puede contener números. Porque las medidas solo pueden existir en motores multidimensionales. Porque su papel analítico depende del significado, y puede ser un atributo descriptivo. Porque cualquier dato almacenado como entero debe convertirse en fecha.

37. Dos sistemas utilizan el código de cliente 25 para personas distintas. ¿Qué debe hacer la integración?. Descartar permanentemente ambos clientes para evitar cualquier conflicto. Unificar ambos registros porque la coincidencia numérica garantiza identidad. Distinguir las identidades mediante la procedencia u otra regla de correspondencia. Convertir los importes de sus ventas en claves sustitutas compartidas.

38. ¿Qué caracteriza a un esquema en estrella?. Cada atributo descriptivo exige una tabla independiente conectada en cadena. Una tabla de hechos enlaza directamente con dimensiones relativamente desnormalizadas. Varias tablas de hechos se unen directamente entre sí sin comprobar su grano. Todas las entidades del negocio se almacenan en una única tabla sin relaciones.

39. Producto enlaza con Subcategoría, y Subcategoría con Categoría, en tablas distintas. ¿Qué diseño dimensional representa?. Tabla de hechos sin medidas. Instantánea acumulativa. Dimensión degenerada. Copo de nieve.

40. Ventas e inventario comparten dimensiones Producto, Tienda y Fecha, pero conservan hechos de distinto grano. ¿Qué estructura forman?. Una constelación de hechos. Una única transacción OLTP. Una dimensión de rol. Un fichero de columnas sin esquema.

41. ¿Qué tabla encaja con una instantánea periódica?. Una fila por cada cambio de estado registrado en una incidencia. Una fila por pedido que se actualiza al alcanzar sus hitos. Existencias de cada producto en cada almacén al cierre de cada día. Una fila por cada línea de venta emitida durante una operación.

42. Una fila por pedido contiene las fechas de recepción, preparación, envío y entrega, y se actualiza al avanzar el proceso. ¿Qué tipo de tabla es?. Tabla transaccional de eventos inmutables. Instantánea acumulativa. Instantánea periódica diaria. Dimensión conformada de productos.

43. Una tabla registra qué personas asistieron a qué cursos mediante claves, sin columnas de medidas numéricas. ¿Cómo puede analizarse?. Como una tabla inutilizable, porque toda tabla de hechos exige un importe. Como una dimensión de fechas, aunque no contenga atributos de calendario. Como un índice físico que no participa en ninguna consulta de negocio. Como una tabla de hechos sin medidas, contando ocurrencias al grano definido.

44. El saldo puede sumarse entre cuentas en una fecha, pero no entre cierres de días diferentes. ¿Cómo se clasifica respecto de esas dimensiones?. Aditivo exclusivamente a lo largo del tiempo. Aditivo en todas ellas. No aditivo en ninguna de ellas. Semiaditivo.

45. Un grupo resuelve 10 incidencias con una media de 2 horas y otro 90 con una media de 10 horas. ¿Cuál es la media conjunta?. 6 horas. 10,8 horas. 9,2 horas. 8 horas.

46. Una unidad cumple el plazo en 8 de 10 casos y otra en 45 de 90. ¿Cuál es el cumplimiento conjunto?. 65 %. 80 %. 50 %. 53 %.

47. Madrid atiende a 100 usuarios distintos y Sevilla a 80. Veinte usuarios aparecen en ambos conjuntos. ¿Cuántos usuarios distintos hay en total?. 160. 140. 180. 200.

48. Una venta de 100 euros se une con sus dos etiquetas y luego se suma su importe. El resultado es 200 euros. ¿Dónde está el problema?. En que SUM no admite valores monetarios en una tabla de hechos. En una pérdida de durabilidad de la transacción original. En la multiplicidad de la relación introducida por el JOIN. En que el importe de la venta debería almacenarse como texto.

49. ¿Para qué sirve una dimensión conformada compartida por ventas y devoluciones?. Para comparar ambos procesos con identificadores y definiciones compatibles. Para eliminar cualquier diferencia entre ventas y devoluciones. Para obligar a que todas las filas de ambos hechos tengan el mismo grano. Para convertir sus medidas en atributos que no puedan agregarse.

50. Una misma dimensión Fecha se usa para apertura, asignación y cierre de incidencias. ¿Qué técnica representa?. Particionado por hash. Dimensiones de rol. Tablas de hechos sin medidas. Dimensiones degeneradas.

51. El número de factura permanece en la tabla de hechos y no se crea una dimensión propia porque no hay más atributos descriptivos. ¿Cómo se denomina?. Dimensión de rol. Tabla puente ponderada. Instantánea periódica. Dimensión degenerada.

52. Se corrige la categoría de un producto sobrescribiendo el valor anterior, sin conservarlo en ese atributo. ¿Qué tratamiento se está aplicando?. SCD tipo 3. SCD tipo 1. SCD tipo 2. SCD tipo 0.

53. Un cliente cambia de zona el 1 de abril. Se crean dos versiones con claves sustitutas diferentes para mantener su historia. ¿A qué versión debe apuntar una venta de marzo?. A una versión elegida según la fecha de ejecución del informe. A la última versión conocida, con independencia de la fecha de venta. A la versión cuya vigencia incluye la fecha de la venta de marzo. A ambas versiones, para repartir el importe entre las dos zonas.

54. ¿Qué ventaja tienen los intervalos de vigencia con inicio incluido y final excluido en una SCD tipo 2?. Permiten enlazar versiones consecutivas sin atribuir el instante de cambio a las dos. Convierten todas las versiones en una única fila que se sobrescribe. Garantizan que nunca llegarán correcciones históricas desde las fuentes. Evitan que sea necesario conservar la clave de negocio de la entidad.

55. Llega una venta antes que la ficha completa del cliente. ¿Qué solución conserva el hecho y permite completar su contexto después?. Eliminar la venta definitivamente porque no puede cargarse sin descripción completa. Duplicarla en todas las versiones de cliente para asegurar su localización. Asociarla a cualquier cliente existente para evitar claves pendientes. Usar un miembro desconocido o inferido y resolverlo según una política trazable.

56. ¿Qué representa conceptualmente un cubo OLAP?. Una tabla operativa que contiene exclusivamente transacciones pendientes de confirmar. Un conjunto de gráficos sin relaciones con medidas ni atributos del modelo. Medidas organizadas por combinaciones de dimensiones, que pueden ser más de tres. Una estructura limitada a tres dimensiones y almacenada siempre como matriz completa.

57. En un análisis por mes, provincia y familia de producto, se fija únicamente el mes de enero. ¿Qué operación describe habitualmente ese corte?. Slice. Drill across. Roll up. Pivot.

58. Se seleccionan las ventas de Madrid y de la familia Portátiles durante enero y febrero. ¿Qué operación OLAP describe esta selección conjunta?. Dice. Pivot. Roll up. Drill through.

59. Una tabla intercambia los meses de las filas con las provincias de las columnas, manteniendo filtros y agregaciones. ¿Qué debe ocurrir con los totales?. Deben excluir el detalle porque se ha realizado un drill through. Deben mantenerse porque solo se ha realizado una rotación o pivot. Deben convertirse en medias porque se ha cambiado la orientación. Deben duplicarse porque cada dimensión aparece en un eje nuevo.

60. Un informe pasa de presentar ventas por mes a mostrarlas por trimestre. ¿Qué operación realiza?. Drill down. Slice. Roll up. Drill through.

61. Solo se conservan totales anuales de ventas. ¿Puede un drill down reconstruir exactamente los importes reales de cada mes?. No, porque drill down solo sirve para acceder a documentos de texto. No, porque el detalle mensual necesario no está disponible. Sí, porque todo total anual conserva implícitamente sus doce componentes. Sí, dividiendo cada total anual entre doce se recupera el detalle real.

62. Se agregan por separado ventas y presupuesto a producto y mes, y después se comparan mediante dimensiones conformadas. ¿Qué operación representa?. Drill across. Drill through. Pivot. Slice.

63. ¿Qué afirmación sobre ROLAP es correcta?. Debe resolver toda consulta leyendo el detalle sin utilizar agregaciones. Impide consultar los datos mediante un motor de base de datos relacional. Puede utilizar tablas resumen, vistas materializadas, índices y particiones. Almacena obligatoriamente todos los datos en matrices multidimensionales.

64. ¿Qué consideración es especialmente relevante al utilizar MOLAP?. La imposibilidad de comprimir celdas o representar espacios dispersos. El coste de procesamiento y almacenamiento de estructuras multidimensionales. La obligación de conservar el detalle exclusivamente en tablas operativas externas. La ausencia de cualquier trabajo previo a la primera consulta del usuario.

65. Una solución conserva detalle relacional y determinados agregados multidimensionales. ¿Con qué modalidad se asocia habitualmente?. DOLAP. SOLAP. HOLAP. WOLAP.

66. ¿Qué distingue a una vista materializada de una vista lógica ordinaria?. Elimina la necesidad de comprobar cambios en los datos que la alimentan. Guarda físicamente el resultado de una consulta y necesita una política de actualización. Modifica automáticamente el significado de las dimensiones utilizadas. Almacena solo la definición de la consulta y nunca guarda su resultado.

67. Un modelo combina 365 días, 1.000 productos y 100 tiendas. ¿Cuántas combinaciones teóricas contiene ese espacio dimensional?. 365.000. 3.650.000. 365.000.000. 36.500.000.

68. Tras agrupar ventas por provincia, se quieren conservar solo los grupos con SUM(importe) superior a 100.000. ¿Qué cláusula expresa ese filtro sobre el agregado?. GROUP BY SUM(importe) > 100000. ORDER BY SUM(importe) > 100000. HAVING SUM(importe) > 100000. WHERE SUM(importe) > 100000.

69. ¿Qué conjuntos de agrupación produce ROLLUP(anio, mes)?. Año; mes; sin total general. Año y mes; mes; total general. Año y mes; año; total general. Año y mes; año; mes; total general.

70. CUBE utiliza tres expresiones distintas de agrupación. ¿Cuántos conjuntos de agrupación contempla, con independencia del número final de filas?. 9. 8. 3. 6.

71. Se desean únicamente los grupos por año y provincia y el total general, sin todos los subtotales intermedios. ¿Qué construcción resulta apropiada?. LAG sobre las filas individuales de venta. GROUPING SETS con las agrupaciones requeridas. COUNT DISTINCT aplicado al nombre de la provincia. ORDER BY con las columnas en orden inverso.

72. ¿Qué diferencia básica existe entre una función de ventana y una agregación ordinaria con GROUP BY?. La ventana convierte cada fila de entrada en una tabla física independiente. GROUP BY conserva obligatoriamente todas las filas de detalle sin resumirlas. La ventana calcula sobre filas relacionadas sin colapsarlas en una única fila por grupo. La ventana solo puede ejecutarse si no hay ninguna cláusula ORDER BY.

73. Una serie mensual contiene enero y marzo, pero no febrero. ¿Qué devuelve LAG(total) en la fila de marzo si se ordena por mes?. Cero, porque LAG crea automáticamente el mes de febrero. El total de marzo, porque no puede saltar un periodo natural. El total de enero, por ser el de la fila anterior disponible. El total de febrero, calculado a partir de los meses contiguos.

74. Una tabla contiene cinco filas y dos tienen NULL en el campo importe. ¿Qué devuelven COUNT(*) y COUNT(importe), respectivamente?. 3 y 5. 3 y 3. 5 y 3. 5 y 5.

75. ¿Para qué se utiliza NULLIF(SUM(casos_evaluables), 0) en el denominador de un porcentaje?. Para devolver un cumplimiento del cien por cien si no hay casos evaluables. Para convertir un denominador cero en NULL y evitar la división por cero. Para excluir del numerador todos los casos que cumplen el plazo. Para sustituir cualquier denominador positivo por el valor cero.

76. Una consulta agrupa ventas por provincia y no incluye ORDER BY. ¿Qué puede asumirse sobre el orden de las filas devueltas?. Siempre estarán ordenadas por importe descendente. Siempre estarán ordenadas alfabéticamente por provincia. Reproducirán necesariamente el orden de inserción de las ventas. No hay un orden estable garantizado por la consulta.

77. Una fecha tiene formato y dominio admitidos, pero no coincide con el día real de la operación. ¿Qué distinción ilustra?. Puede ser válida y, aun así, inexacta. La exactitud depende únicamente del número de filas disponibles. Puede ser exacta y, por ello, necesariamente inválida. La validez garantiza la coincidencia con cualquier hecho real.

78. Los mismos datos se actualizan una vez al día y sirven para un informe mensual, pero no para asignar operadores durante una avería. ¿Qué muestra este caso?. Que la actualidad exigida depende del uso y de la demora admisible. Que un dato con un responsable asignado ya no necesita actualización. Que la exactitud aumenta automáticamente al cambiar el tipo de gráfico. Que los datos diarios nunca pueden considerarse de calidad.

79. ¿Qué compromiso corresponde a un contrato de datos verificable?. Los datos serán excelentes y resolverán cualquier necesidad futura de análisis. Cada consumidor interpretará libremente el significado de todos los campos. El productor podrá cambiar nombres y tipos sin avisar a quienes consumen. La prioridad será obligatoria y los cambios se publicarán en menos de quince minutos.

80. ¿Qué problema aborda principalmente Master Data Management o MDM?. La gestión coherente de entidades compartidas y su identidad entre sistemas. La ejecución de consultas sin conservar ninguna definición de negocio. La elección del color de los gráficos según la categoría del usuario. La compresión física de todas las copias de seguridad del centro de datos.

81. Cambia el significado de fecha_cierre y se necesita localizar los informes afectados. ¿Qué capacidad resulta especialmente útil?. El número de réplicas del servidor de almacenamiento. El orden visual de las columnas del informe. El linaje de datos y sus dependencias. La compresión de los ficheros temporales de consulta.

82. Cada responsable debe ver únicamente las incidencias de su unidad, incluso al consultar el modelo. ¿Qué mecanismo encaja con esta restricción?. Ocultar el nombre de la unidad en el gráfico. Cambiar la tabla de hechos por un gráfico de barras. Ordenar las incidencias por responsable. Seguridad a nivel de fila o RLS.

83. ¿Por qué una réplica no sustituye por sí sola a una copia de seguridad recuperable?. Porque puede reproducir también un borrado o una corrupción lógica. Porque la replicación impide comprobar el estado de los datos copiados. Porque una réplica nunca puede mejorar la disponibilidad del servicio. Porque las copias de seguridad solo protegen frente a fallos de red.

84. Una consulta utiliza tres atributos de una tabla que tiene cincuenta columnas. ¿Qué ventaja puede ofrecer el almacenamiento columnar?. Leer principalmente las columnas necesarias y aprovechar su compresión. Recuperar siempre todos los campos de cada fila antes de aplicar filtros. Garantizar que las inserciones individuales sean más rápidas en cualquier motor. Evitar cualquier uso de memoria durante la ejecución de la consulta.

85. ¿Por qué no deben equipararse automáticamente Parquet y las familias de columnas de HBase?. Porque describen organizaciones y patrones de acceso diferentes, aunque compartan la palabra columna. Porque Parquet solo admite claves de fila y HBase solo admite agregaciones de columnas completas. Porque HBase es un formato de fichero y Parquet un servicio de consultas por clave. Porque ambos nombres designan exactamente la misma estructura con licencias distintas.

86. Una tabla está particionada por mes. ¿Qué situación favorece la poda de particiones?. La creación de más particiones sin adaptar los filtros de las consultas. Un filtro por el periodo que el motor pueda utilizar para descartar meses ajenos a la consulta. La eliminación de la clave de partición de todos los metadatos de la tabla. Una consulta sin filtros que solicite expresamente todos los meses disponibles.

87. ¿Para qué utiliza el optimizador las estadísticas de las tablas?. Para confirmar que toda correlación de negocio es causal. Para reemplazar las restricciones de integridad de los datos. Para fijar el significado de las medidas del cuadro de mando. Para estimar cardinalidades y elegir planes de ejecución.

88. Una distribución por hash concentra gran parte de los registros en un nodo, que termina mucho después que los demás. ¿Cómo se denomina ese desequilibrio?. Drill through. Query folding. Skew. Aislamiento serializable.

89. ¿Qué pretende el pushdown de filtros hacia una fuente de datos?. Copiar las credenciales de la fuente dentro de cada fila de resultado. Sustituir las claves de negocio por identificadores del informe consumidor. Descargar siempre todas las tablas antes de evaluar cualquier condición. Ejecutar filtros cerca de los datos para reducir el movimiento y el trabajo posterior.

90. ¿Qué conjunto de factores debe considerarse al estimar el almacenamiento de una plataforma analítica?. Solo el número de usuarios que leerán los informes, sin volumen ni retención. Datos, crecimiento, compresión, réplicas, índices, versiones y espacio temporal. Únicamente el número de columnas, sin atender a filas ni tipos de datos. Solo el tamaño de los ficheros originales el día de la primera carga.

91. ¿Cuándo una métrica se utiliza como KPI?. Cuando su valor aumenta todos los meses sin excepción. Cuando se presenta en un gráfico circular en lugar de una tabla. Cuando se selecciona por su relación con un objetivo y una decisión. Cuando procede de una única fuente y no necesita contexto.

92. Un indicador se define como porcentaje de incidencias cerradas evaluables del mes que cumplieron el plazo. ¿Cuál debe ser su denominador?. Las incidencias cerradas evaluables de ese mes. Todas las incidencias pendientes al finalizar el mes. Todas las incidencias abiertas durante el mes, cualquiera que sea su estado. Solo las incidencias cerradas que incumplieron el plazo.

93. Se quiere comparar el número de incidencias entre varias aplicaciones. ¿Qué visualización es habitualmente adecuada?. Un mapa geográfico que no incluya ninguna variable territorial. Un diagrama de dispersión entre dos variables continuas no relacionadas. Un gráfico de barras con escala y categorías claras. Una línea que trate aplicaciones sin orden natural como instantes consecutivos.

94. El tiempo medio de resolución oculta que unas pocas incidencias tardan muchísimo. ¿Qué visualización ayuda a explorar la distribución?. Un gráfico circular de los nombres de los técnicos. Un histograma o un diagrama de caja. Una única tarjeta con el mismo valor medio. Un contador acumulado sin información de duraciones.

95. Distintos informes deben calcular del mismo modo el tiempo medio de resolución. ¿Qué aporta una capa semántica común?. Definiciones compartidas de entidades, relaciones y medidas de negocio. Una copia local independiente del cálculo en cada gráfico sin coordinación. La eliminación de los filtros y permisos aplicados a las consultas. Definiciones diferentes por departamento sin reconciliar sus fórmulas.

96. ¿Qué medida favorece un BI de autoservicio coherente?. Proporcionar modelos certificados, formación y reglas de publicación. Sustituir todos los modelos compartidos por exportaciones locales permanentes. Permitir que cada usuario redefina cualquier indicador sin comunicarlo. Eliminar los responsables de datos para acelerar la creación de gráficos.

97. ¿Qué asociación entre tecnología y lenguaje es correcta?. Power Query utiliza MDX como único lenguaje de transformación de ficheros. Power Query utiliza M para expresar operaciones de preparación de datos. M es el nombre del motor físico de almacenamiento de Elasticsearch. DAX es el lenguaje empleado para definir los pasos de todas las consultas de Power Query.

98. ¿Qué ocurre cuando una transformación de Power Query permite query folding?. La fuente deja de necesitar permisos porque el informe asume su identidad. Los datos se convierten automáticamente en una dimensión lentamente cambiante. Todas las filas se descargan antes de evaluar cualquier filtro local. La operación puede traducirse a una consulta que ejecuta la fuente.

99. ¿Qué caracteriza a una medida DAX frente a una columna calculada?. La columna calculada solo puede existir si el modelo carece de relaciones. La medida se evalúa según el contexto de la consulta, incluidos filtros y relaciones. La medida sustituye las tareas de extracción y transformación de Power Query. La medida almacena siempre un valor fijo por fila, independiente del informe.

100. ¿Qué expresión representa un precio medio por unidad a partir de importes y unidades en el contexto actual de DAX?. DIVIDE(SUM(FactVenta[importe]), SUM(FactVenta[unidades])). SUM(FactVenta[importe]) + SUM(FactVenta[unidades]). SUM(FactVenta[importe]) * SUM(FactVenta[unidades]). DIVIDE(SUM(FactVenta[unidades]), SUM(FactVenta[importe])).

101. ¿Qué característica corresponde al modo Import?. Envía necesariamente cada consulta al origen sin conservar datos del modelo. Impide que los usuarios apliquen filtros durante la lectura del informe. Mantiene una copia de los datos en el modelo que necesita actualizarse. Exige almacenar las tablas en estructuras multidimensionales de Mondrian.

102. ¿Por qué DirectQuery no garantiza por sí solo que un informe muestre datos instantáneos?. Porque DirectQuery conserva obligatoriamente una copia fija que nunca puede consultarse de nuevo. Porque DirectQuery prohíbe enviar consultas al sistema que conserva los datos. Porque influyen la actualización del origen, las cachés y la actualización de las visualizaciones. Porque DirectQuery solo admite datos cargados mediante ficheros anuales cerrados.

103. ¿Qué es VertiPaq?. Un motor de almacenamiento columnar comprimido utilizado en modelos tabulares en memoria. Un protocolo de mensajería que reemplaza las relaciones del modelo semántico. El servicio que conserva metadatos de tablas en el ecosistema Hive. El cliente gráfico de Pentaho para diseñar transformaciones y trabajos.

104. ¿Cuál puede ser la función de un gateway al conectar el servicio de Power BI con una fuente local?. Traducir todas las medidas DAX a dimensiones históricas de tipo 2. Convertir automáticamente la base local en un data warehouse corporativo. Facilitar la conectividad con la fuente bajo la configuración de identidad y red establecida. Reemplazar la necesidad de credenciales y permisos sobre los datos.

105. ¿Qué relación existe entre PDI y Kettle?. PDI y Kettle son servicios de visualización ajenos a la integración. PDI es un lenguaje de consultas de Kettle basado en MDX. Kettle es el nombre históricamente asociado a Pentaho Data Integration. Kettle es una base de datos columnar que sustituye a PDI.

106. ¿Para qué se utiliza Spoon en el entorno clásico de PDI?. Para reemplazar los sistemas de origen mediante una base transaccional propia. Para diseñar gráficamente transformaciones y trabajos. Para ejecutar únicamente modelos de clasificación de Weka. Para almacenar físicamente las filas de todos los cubos OLAP.

107. ¿Qué diferencia principal existe entre una transformación y un job de PDI?. La transformación contiene informes; el job calcula únicamente medidas DAX. La transformación procesa flujos de registros; el job coordina tareas y dependencias. La transformación define permisos; el job almacena exclusivamente datos históricos. La transformación solo se ejecuta manualmente; el job carece de control de ejecución.

108. ¿Qué descripción corresponde a Mondrian?. Un sistema distribuido de ficheros que conserva los bloques de Hadoop. Un motor OLAP que permite consultas MDX sobre datos relacionales. Un agente de recogida de métricas del conjunto Elastic Stack. Un lenguaje de transformación utilizado exclusivamente por Power Query.

109. Un job termina sin errores técnicos después de cargar ventas. ¿Qué comprobación sigue siendo necesaria?. Eliminar los registros de ejecución para evitar cualquier reproceso. Sobrescribir todas las claves dimensionales con el identificador del job. Dar por garantizada la igualdad de los datos sin realizar más controles. Reconciliar conteos e importes para verificar la corrección del resultado.

110. ¿Qué afirmación sitúa correctamente a Weka y Azure Machine Learning respecto de las herramientas de BI?. Son componentes obligatorios que deben ejecutarse antes de publicar cualquier informe de BI. Son herramientas o plataformas de aprendizaje automático cuya integración no las convierte en etapas obligatorias de todo BI. Son motores de almacenamiento obligatorios de Pentaho y Power BI, respectivamente. Son nombres alternativos de MDX y DAX que pueden intercambiarse sin adaptación.

111. Un modelo decide si una incidencia incumplirá o no el plazo. ¿Qué tarea realiza?. Regresión de una duración continua. Particionado físico de tablas. Agrupación sin etiquetas. Clasificación.

112. ¿Qué objetivo corresponde a una tarea de regresión?. Formar grupos de usuarios sin categorías conocidas previamente. Estimar cuántas horas se necesitarán para resolver una solicitud. Asignar una incidencia a una de tres categorías de prioridad. Identificar conjuntos de aplicaciones que suelen fallar juntas.

113. Se buscan perfiles de uso de aplicaciones sin disponer de etiquetas previas de usuario. ¿Qué técnica encaja mejor?. Regresión del tiempo de cierre usando una variable objetivo etiquetada. Aprendizaje por refuerzo basado en recompensas de una política de turnos. Agrupación no supervisada. Clasificación supervisada con categorías de perfil ya conocidas.

114. ¿Qué secuencia resume las fases de CRISP-DM?. Preparación, despliegue, comprensión del negocio, evaluación y eliminación de los datos. Extracción, diseño del gráfico, publicación y cierre sin evaluación del modelo. Modelado, compra de infraestructura, captura de etiquetas y sustitución del negocio. Comprensión del negocio, comprensión de datos, preparación, modelado, evaluación y despliegue.

115. Un modelo que debe predecir el incumplimiento al abrir un ticket utiliza la fecha de cierre real como variable de entrada. ¿Qué problema presenta?. Una reducción de cardinalidad que mejora legítimamente cualquier predicción. Fuga de información, porque utiliza un dato no disponible en el momento de predecir. Un caso obligatorio de normalización dimensional de tipo 2. Un problema exclusivo de compresión física, sin efecto en la evaluación.

116. ¿Qué partición es adecuada para evaluar un pronóstico temporal sin utilizar información futura?. Entrenar con periodos anteriores y evaluar sobre periodos posteriores. Ajustar el modelo sobre todas las fechas y reutilizarlas como prueba final. Entrenar con el futuro y evaluar únicamente sobre el pasado. Elegir la partición que dé mayor exactitud después de consultar todos los resultados.

117. Un modelo acierta casi todos los ejemplos de entrenamiento y falla con frecuencia en datos nuevos. ¿Qué problema sugiere?. Conformidad de las dimensiones. Sobreajuste. Durabilidad insuficiente de las transacciones. Aditividad de las medidas.

118. Un clasificador detecta 30 positivos verdaderos, genera 10 falsos positivos y omite 20 positivos reales. ¿Cuáles son su precisión y su sensibilidad?. Precisión del 75 % y sensibilidad del 50 %. Precisión del 60 % y sensibilidad del 75 %. Precisión del 75 % y sensibilidad del 60 %. Precisión del 50 % y sensibilidad del 60 %.

119. Tras desplegar un modelo, cambian los perfiles de usuario y la relación entre las variables y el objetivo. ¿Qué debe vigilarse?. Únicamente la latencia de las predicciones, descartando sus resultados posteriores. La coincidencia del número de variables, que garantiza por sí sola la validez del modelo. Solo el error de entrenamiento obtenido antes del despliegue, sin evaluar datos nuevos. La deriva y su efecto sobre el rendimiento del modelo.

120. ¿Por qué no basta el tamaño en terabytes para decidir si una solución requiere una arquitectura diferente?. Porque también importan velocidad, variedad, consultas, concurrencia y garantías exigidas. Porque todo conjunto menor de un petabyte puede procesarse con la misma latencia. Porque el volumen deja de afectar al rendimiento en cuanto se utiliza SQL. Porque cualquier fichero grande exige por definición un clúster Hadoop completo.

121. ¿Qué actuación constituye escalado horizontal?. Cambiar el disco local por otro más rápido sin ampliar el conjunto de nodos. Añadir nodos y distribuir entre ellos carga o datos. Sustituir el procesador del servidor por otro más potente. Aumentar la RAM de un único servidor manteniendo un solo nodo.

122. ¿Qué distingue sharding de replicación?. Son términos equivalentes para añadir memoria a un servidor único. Sharding conserva copias completas; la replicación elimina las filas repetidas. Sharding reparte subconjuntos; la replicación mantiene copias de los datos. Sharding ordena resultados; la replicación agrupa medidas de un cubo.

123. ¿Qué afirmación sobre NoSQL y las transacciones es adecuada?. Ningún motor NoSQL puede confirmar una transacción de forma atómica. Algunos motores ofrecen garantías ACID cuyo alcance depende del producto y la configuración. Usar documentos impide establecer cualquier validación de estructura o contenido. Todo motor NoSQL garantiza automáticamente transacciones distribuidas sin restricciones.

124. ¿Qué conflicto describe CAP cuando se produce una partición de red?. El de mantener disponibilidad y consistencia linealizable bajo esa partición. El de elegir obligatoriamente dos propiedades cualesquiera en toda situación. El de preservar claves foráneas mientras se ordenan resultados por fecha. El de utilizar compresión y cifrado en el mismo fichero.

125. ¿Qué expresa la consistencia eventual?. Visibilidad inmediata y linealizable de cada escritura en todas las réplicas. Garantía automática de todas las reglas de negocio aunque no se hayan definido. Aceptación necesaria de errores permanentes que nunca podrán corregirse. Convergencia bajo ciertas condiciones cuando dejan de producirse actualizaciones.

126. Un almacén distribuye datos y consultas entre muchos nodos y ofrece SQL. ¿Es una combinación coherente?. No, SQL exige que todos los datos residan en un único servidor. Sí, SQL puede utilizarse en motores distribuidos y almacenes MPP. No, distribuir tablas obliga a eliminar sus relaciones lógicas. Sí, pero únicamente si las consultas carecen de agregaciones y JOIN.

127. ¿Qué correspondencia describe correctamente los componentes de HDFS?. El NameNode transmite obligatoriamente todo el contenido y los clientes nunca acceden a los DataNodes. El NameNode almacena todos los bloques y los DataNodes conservan únicamente sus nombres. El NameNode mantiene metadatos y los DataNodes almacenan bloques de los ficheros. El NameNode asigna los recursos YARN y los DataNodes coordinan aplicaciones mediante ApplicationMasters.

128. ¿Qué función desempeña un Secondary NameNode clásico?. Sustituir automáticamente al NameNode como reserva de alta disponibilidad. Almacenar todas las réplicas de cada bloque de datos del clúster. Ejecutar exclusivamente las fases reduce de los trabajos MapReduce. Realizar tareas de checkpoint de metadatos.

129. ¿Por qué una gran cantidad de ficheros muy pequeños puede resultar problemática en HDFS?. Porque los ficheros pequeños carecen de nombre y no pueden localizarse. Porque HDFS solo permite un fichero por cada DataNode instalado. Porque aumenta el coste de metadatos y de apertura respecto del contenido útil. Porque su presencia obliga a desactivar toda replicación del clúster.

130. ¿Qué distribución de responsabilidades corresponde a YARN?. ResourceManager arbitra recursos, NodeManager gestiona cada nodo y ApplicationMaster coordina una aplicación. ResourceManager gestiona cada nodo, NodeManager coordina una aplicación y ApplicationMaster arbitra todo el clúster. ResourceManager arbitra recursos, NodeManager coordina cada aplicación y ApplicationMaster administra cada nodo. ResourceManager coordina una aplicación, NodeManager arbitra todo el clúster y ApplicationMaster gestiona cada nodo.

131. ¿Qué representa un contenedor YARN?. Una tabla del metastore que almacena todas las filas de negocio. Una partición OLAP que contiene únicamente totales anuales. Una asignación de recursos para ejecutar trabajo, sin implicar necesariamente Docker. Una imagen Docker obligatoria que incluye todo el clúster Hadoop.

132. En una suma de ventas por provincia con MapReduce, ¿qué hace principalmente el shuffle?. Publica directamente el cuadro de mando sin ejecutar ninguna agregación. Garantiza que cada tarea map reciba todas las ventas del conjunto completo. Sustituye los importes por las claves sustitutas de una dimensión. Redistribuye los pares para reunir los valores asociados a la misma clave.

133. ¿Qué condición debe respetar el uso de un combiner en MapReduce?. Que la combinación local sea compatible con el significado final de la agregación. Que calcule siempre una media simple de las medias, cualquiera que sea el tamaño de los grupos. Que su ejecución sea obligatoria y ocurra exactamente una vez para cada clave. Que sustituya a la fase map y reciba solo el resultado definitivo.

134. ¿Qué capacidad proporciona Apache Hive?. Almacenamiento obligatorio de todas las filas dentro del servicio de catálogo. Consulta SQL sobre conjuntos de datos en almacenamiento distribuido mediante tablas y metadatos. Sustitución de cualquier transformación por la creación automática de gráficos. Acceso exclusivo a ficheros que se hayan cargado previamente en HBase.

135. ¿Qué conserva principalmente Hive Metastore?. Definiciones de tablas, columnas, particiones, ubicaciones y otros metadatos. Todas las filas analíticas dentro de su base de catálogo. Los bloques físicos de todos los ficheros, sustituyendo a los DataNodes. Exclusivamente los resultados completos de todas las consultas para reutilizarlos como caché.

136. ¿Qué papel cumple HiveServer2?. Atender clientes y sesiones de consulta, incluidas conexiones JDBC u ODBC. Distribuir físicamente los bloques de los ficheros entre los DataNodes del clúster. Conservar las definiciones de tablas y sus ubicaciones como función principal de catálogo. Arbitrar los recursos de todas las aplicaciones como gestor general de YARN.

137. ¿Qué patrón de acceso encaja especialmente con HBase?. Agregación sobre cubos precalculados como único mecanismo para recuperar cualquier dato. Recorridos de relaciones entre nodos como modelo nativo de una base de grafos. Lecturas y escrituras por clave de fila y rangos en tablas grandes y dispersas. Acceso exclusivamente secuencial a ficheros, sin lectura ni escritura de registros por clave.

138. Una clave de fila concentra todas las escrituras recientes de HBase en una misma zona. ¿Qué riesgo plantea?. Convertir las escrituras en agregaciones OLAP sin coste adicional. Garantizar automáticamente una distribución uniforme entre todos los nodos. Eliminar la necesidad de diseñar las consultas que accederán a la tabla. Crear un punto caliente que desequilibre la carga.

139. ¿Cuál es una función característica de ZooKeeper?. Administrar obligatoriamente todos los componentes de cualquier instalación Hadoop. Ejecutar las consultas SQL de Hive como único motor de cálculo posible. Proporcionar primitivas de coordinación, como configuración y elección de líderes. Sustituir a HDFS como almacén general de todos los ficheros de negocio.

140. ¿Qué asociación de funciones históricas del ecosistema Hadoop es correcta?. Sqoop para ejecutar consultas SQL y Oozie para elegir líderes distribuidos. Sqoop para mantener el catálogo y Oozie para almacenar bloques. Sqoop para coordinar trabajos y Oozie para transferencias masivas. Sqoop para transferencias masivas y Oozie para coordinar trabajos.

141. ¿Qué correspondencia entre herramientas y funciones es adecuada?. Pig con flujos en Pig Latin, Ambari con administración y Mahout con aprendizaje automático escalable. Pig con administración de clústeres, Ambari con aprendizaje automático y Mahout con Pig Latin. Pig con flujos en Pig Latin, Ambari con aprendizaje automático y Mahout con administración de clústeres. Pig con aprendizaje automático, Ambari con Pig Latin y Mahout con administración de clústeres.

142. ¿Qué afirmación sobre las dependencias de Spark es correcta?. Impide utilizar almacenamiento de objetos porque solo procesa ficheros locales. Puede ejecutarse con standalone, YARN o Kubernetes y utilizar fuentes compatibles distintas de HDFS. Necesita siempre desplegar previamente Hive, HBase y un clúster Hadoop completo. Solo admite datos conservados dentro de la base relacional del Hive Metastore.

143. ¿Qué reparto de funciones corresponde a una aplicación Spark?. El driver solo distribuye credenciales y cada executor planifica toda la aplicación de forma independiente. El driver coordina la aplicación y los executors realizan tareas y gestionan datos de trabajo. Los executors coordinan toda la aplicación y el driver ejecuta todas sus tareas en un único nodo. El driver almacena los bloques HDFS y los executors conservan únicamente el catálogo de tablas.

144. ¿Qué significa que muchas transformaciones de Spark se evalúen de forma diferida?. Que se planifican y su ejecución suele activarse cuando una acción necesita resultados. Que se ejecutan completamente en cuanto se escribe cada transformación. Que solo pueden ejecutarse cuando finaliza el año al que pertenecen los datos. Que el resultado se obtiene sin leer ni procesar ningún dato de entrada.

145. ¿Qué afirmación sobre Spark y el uso de memoria es correcta?. Utilizar memoria garantiza una mejora fija de cien veces para cualquier consulta. Mantener datos en caché elimina todas las comunicaciones entre nodos del clúster. Todas sus operaciones se realizan siempre en RAM y cualquier acceso a disco está prohibido. Puede utilizar memoria, leer y escribir almacenamiento y volcar datos a disco cuando sea necesario.

146. ¿Qué distinción entre Flink y Storm es correcta?. Flink y Storm son nombres intercambiables del gestor de recursos YARN. Flink procesa exclusivamente lotes sin estado; Storm utiliza spouts y bolts solo para definir esquemas. Flink trabaja con cálculos con estado y tiempo de evento; Storm organiza topologías con spouts y bolts. Flink sustituye los logs de las bases; Storm solo sirve para cargar HDFS sin procesar eventos.

147. Un dispositivo genera un evento a las 10:00 y el sistema lo procesa a las 11:00 tras recuperar la conexión. ¿Cuál es su tiempo de evento?. El promedio entre la hora de generación y la de procesamiento. La hora de la siguiente copia de seguridad del sistema. Las 10:00, cuando ocurrió el hecho. Las 11:00, cuando comenzó su procesamiento.

148. ¿Qué representa una watermark en el procesamiento por tiempo de evento?. Una prueba de que nunca llegará ningún evento con una marca temporal anterior. Una orden de borrar todos los datos históricos cuando termina cualquier ventana. Una estimación de su progreso que ayuda a decidir cuándo finalizar cálculos de ventanas. Un índice que convierte automáticamente todos los eventos tardíos en duplicados.

149. ¿Qué orden puede asumirse en un tema Kafka con varias particiones?. El mismo orden alfabético de los valores en todas las particiones, sin configuración adicional. Un orden de registros dentro de cada partición, sin un orden global automático entre todas. Un orden global estricto entre todas las particiones por el momento real de cada evento. Ningún orden dentro de las particiones, aunque los registros tengan posiciones de lectura.

150. Un motor recupera su estado mediante checkpoints. ¿Eso basta para garantizar que un pago externo se ejecute exactamente una vez?. No; deben coordinarse también el destino y los efectos externos, con las garantías adecuadas. No; exactamente una vez exige que todos los mensajes se descarten al primer intento. Sí; basta con aplicar reintentos indefinidos sin identificar las operaciones. Sí; cualquier checkpoint del motor garantiza automáticamente todos los efectos externos.

151. ¿Qué componentes forman la denominación ELK?. Elasticsearch, Lakehouse y Kafka. Elasticsearch, Livy y Kubernetes. Elasticsearch, Logstash y Kibana. Elastic Agent, Logstash y Kettle.

152. ¿Qué papel desempeñan Beats y Elastic Agent?. Mantener el estado de todas las transacciones de las aplicaciones de origen. Sustituir el catálogo de dimensiones del almacén corporativo. Ejecutar exclusivamente consultas MDX sobre cubos relacionales. Recoger y enviar datos o telemetría desde las fuentes.

153. ¿Qué secuencia describe la organización de una canalización Logstash?. Inputs para recibir, filters para enviar y outputs para transformar. Inputs para transformar, filters para enviar y outputs para recibir. Inputs para enviar, filters para recibir y outputs para transformar. Inputs para recibir, filters para transformar y outputs para enviar.

154. ¿Qué relación mantiene un índice invertido utilizado en búsqueda textual?. Valores de una columna con su posición física mediante una estructura ordenada de claves. Cada documento exclusivamente con una copia íntegra de su texto original, sin referencias por término. Claves de partición con los nodos que almacenan cada fragmento distribuido del índice. Términos con los documentos en los que aparecen.

155. Se necesita agrupar eventos por el nombre completo de una aplicación mediante coincidencias exactas. ¿Qué tipo de campo de Elasticsearch suele ser adecuado?. Keyword. Text analizado como única representación del nombre. Un campo numérico de duración que omita el nombre. Date con el nombre convertido en fecha.

156. Elasticsearch ha aceptado una escritura, pero todavía no aparece en una búsqueda. ¿Qué explicación es compatible con su funcionamiento?. Toda escritura aceptada debe ser visible de forma instantánea en cualquier búsqueda. La aceptación de una escritura significa que se ha descartado su contenido. Elasticsearch solo puede consultar los datos al reiniciar todos los nodos. La visibilidad para búsqueda puede depender del refresh y no ser inmediata.

157. ¿Qué diseño combina razonablemente observabilidad y BI en un servicio de soporte?. Impedir que cualquier evento técnico pueda contribuir a indicadores de gestión. Descartar el histórico de negocio en cuanto exista un panel de errores técnicos. Convertir necesariamente cada línea de log en una incidencia nueva del sistema de tickets. Explorar eventos recientes en un buscador y alimentar el DW con datos seleccionados para tendencias integradas.

158. ¿Qué describe mejor a Trino?. El formato de fichero columnar utilizado obligatoriamente por cualquier lago. Un agente especializado en recoger exclusivamente métricas del sistema operativo. Una base que debe almacenar por sí misma todas las filas de cualquier fuente consultada. Un motor distribuido de consulta SQL que accede a fuentes mediante conectores.

159. ¿Qué relación histórica entre Trino y Presto es correcta?. Trino y Presto son dos nombres del formato de tabla Apache Iceberg. Trino procede de PrestoSQL, mientras PrestoDB continúa como un proyecto diferente. PrestoSQL es el lenguaje de Power Query y Trino su motor de compresión. Trino es el nombre actual de cualquier versión de PrestoDB sin distinción.

160. ¿Qué afirmación sitúa correctamente Oracle Exadata y Teradata?. Exadata solo puede ejecutar consultas analíticas y prohíbe cualquier carga transaccional. Teradata es el formato de fichero interno de todas las instalaciones Exadata. Exadata es una plataforma para Oracle Database y Teradata es independiente de Oracle. Oracle Teradata es el nombre completo de un único producto de Oracle.

161. ¿Qué descripción corresponde a ClickHouse?. Un cliente gráfico para diseñar transformaciones de PDI. Un servicio de catálogo de tablas exclusivo de Hive. Una base de datos analítica columnar. Una herramienta de elección de líderes para sistemas distribuidos.

162. ¿Qué conjunto está formado por plataformas o servicios con capacidades de almacén y analítica de datos?. Parquet, ORC y Avro. Spoon, Beats y ZooKeeper. M, DAX y MDX. BigQuery, Amazon Redshift y Snowflake.

163. ¿Qué caracteriza al patrón Lambda?. Requiere que todas las consultas de negocio se ejecuten dentro de un agente de recogida. Conserva solo los gráficos y descarta toda fuente o estructura analítica. Combina una ruta de lotes, otra rápida para datos recientes y una capa de consulta de resultados. Utiliza una única ruta de eventos y elimina cualquier posibilidad de reproceso.

164. ¿Qué idea central describe Kappa?. Tratar los datos mediante una ruta de procesamiento de eventos y reprocesar el flujo cuando sea necesario. Exigir conservar todos los eventos para siempre, cualquiera que sea la necesidad del sistema. Mantener dos implementaciones independientes, una por lotes y otra rápida, como requisito definitorio. Impedir almacenar eventos porque el procesamiento continuo nunca admite reproceso.

165. ¿Qué reparto de funciones constituye una arquitectura analítica coherente?. Catálogo para todas las filas, objetos solo para metadatos, Spark para transformar y Trino para consultar. Objetos para ficheros, catálogo para metadatos, Spark para transformar, Trino para consultar y Power BI para presentar. Trino como almacén obligatorio de todas las fuentes, catálogo para ficheros y Spark solo para metadatos. Objetos para ficheros, catálogo para metadatos, Spark para presentar y Power BI como sistema de ficheros distribuido.

166. La dirección revisa indicadores mensuales y admite que los datos estén disponibles al día siguiente. ¿Qué enfoque puede ser suficiente?. Eliminación del histórico para reducir cualquier demora de carga. Streaming de milisegundos como requisito inevitable de cualquier indicador. Cargas periódicas por lotes con controles y puntos de corte claros. Consulta directa de todas las fuentes sin definir las medidas ni reconciliar los datos.

167. ¿Qué aspecto suele afectar tanto al análisis corporativo como a la supervisión de eventos?. Catálogo, identidad, calidad, linaje y permisos. La obligación de conservar exactamente las mismas filas durante idéntico plazo. La prohibición de que un dato alimente más de una ruta de tratamiento. La necesidad de ejecutar todas las consultas con el mismo motor físico.

168. Una incidencia genera seis cambios de estado. En una tabla con una fila por cambio, ¿qué representa contar sus seis filas?. Seis eventos de una misma incidencia. Seis incidencias diferentes necesariamente. Seis días completos de incumplimiento. Seis usuarios afectados distintos necesariamente.

169. Una unidad cambia de dirección general y se quiere conservar la clasificación histórica de sus incidencias. ¿Qué tratamiento dimensional encaja?. Eliminar la dimensión Unidad y conservar solo un total sin clasificación. Duplicar cada incidencia en todas las direcciones generales existentes. SCD tipo 1 que sobrescriba sin más la dependencia de todas las incidencias antiguas. SCD tipo 2 con una versión de la unidad por periodo de vigencia.

170. Se cierran 1.000 incidencias; 950 son evaluables para plazo y 855 cumplen. ¿Cuál es el porcentaje de cumplimiento entre las evaluables?. 95 %. 85,5 %. 80,5 %. 90 %.

171. Una unidad resuelve 20 incidencias con media de 2 horas y otra 80 con media de 5 horas. ¿Cuál es la media conjunta?. 3,5 horas. 4,4 horas. 2,6 horas. 5,4 horas.

172. Hay 40, 45 y 35 incidencias pendientes al cierre de tres días consecutivos. ¿Cuántas pendientes hay al cierre del tercer día?. 40. 45. 120. 35.

173. Un pedido tiene varias líneas y varias entregas. Se necesita analizar importes vendidos y puntualidad de cada entrega. ¿Qué diseño evita perder detalle y duplicar ventas?. Repetir el importe total del pedido en cada entrega y sumar todas esas filas. Sustituir todas las fechas de entrega por la fecha de apertura del pedido. Separar los hechos de venta y entrega con granos explícitos y dimensiones compatibles. Conservar solo una fila por pedido y eliminar los datos de líneas y expediciones.

174. Se reciben 20 GB decimales al día durante 365 días. La compresión deja el tamaño en el 40 % y se guardan tres copias en total. Sin otros componentes, ¿cuánto ocupan?. 13.140 GB, equivalentes a 13,14 TB decimales. 2.920 GB, equivalentes a 2,92 TB decimales. 21.900 GB, equivalentes a 21,9 TB decimales. 8.760 GB, equivalentes a 8,76 TB decimales.

175. Un producto tiene dos ventas de 100 y 200 euros y tres movimientos de inventario. Al unir ambos hechos solo por producto, ¿cuántas filas y qué suma de ventas se obtienen?. Dos filas y 300 euros. Seis filas y 900 euros. Seis filas y 600 euros. Cinco filas y 300 euros.

176. Dos ventas distintas tienen el mismo importe de 100 euros. ¿Por qué SUM(DISTINCT importe) no es una solución general a las duplicaciones producidas por un JOIN?. Porque SUM(DISTINCT importe) cuenta siempre el número de filas sin sumar valores. Porque DISTINCT obliga a duplicar cualquier venta cuyo importe sea positivo. Porque las ventas legítimas nunca pueden tener el mismo importe en un modelo dimensional. Porque suma valores diferentes y eliminaría también la repetición legítima de esos dos importes iguales.

177. Un evento tarda 20 segundos en llegar, 5 en transformarse, 0,2 en consultarse y 10 en mostrarse. Si las fases son consecutivas y no hay otros tiempos, ¿cuál es la demora total?. 25,2 segundos. 30,2 segundos. 35,2 segundos. 0,2 segundos.

178. Una carga inserta 800 de 1.000 registros y falla. El reintento vuelve a enviar los 1.000. ¿Qué diseño evita acabar con 1.800 registros del mismo lote?. Cambiar la clave de cada registro en cada reintento para evitar coincidencias. Desactivar el registro de errores para que la carga no se interrumpa de nuevo. Una publicación atómica o escrituras idempotentes con identificación estable de los registros. Aumentar el número de reintentos sin cambiar la lógica de inserción.

179. Un día comienza con 40 incidencias pendientes. Entran 30 nuevas, se cierran 25 y se reabren 5 previamente cerradas. Sin otros movimientos, ¿cuántas quedan pendientes?. 100. 50. 40. 45.

180. Solo el 2 % de los tickets incumple el plazo. Un clasificador siempre predice que se cumplirá. ¿Qué resultado obtiene respecto del incumplimiento?. Exactitud global del 2 % y sensibilidad del 100 % para detectar incumplimientos. Exactitud global del 98 % y sensibilidad del 0 % para detectar incumplimientos. Exactitud global del 100 % y sensibilidad del 2 % para detectar incumplimientos. Exactitud global del 98 % y sensibilidad del 98 % para detectar incumplimientos.

Denunciar Test