Test del módulo · Semana 9

Test: Datos, analítica y machine learning: ingesta, transformación y servicios de IA

Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.

32 preguntasComprobadas: 0/32

1. Una empresa de logística recibe lecturas de 10.000 sensores de temperatura cada segundo. Tres aplicaciones distintas (alertas, facturación y un modelo de ML) deben leer las mismas lecturas de forma independiente, y el equipo quiere poder reprocesar los datos de los últimos 3 días si una aplicación falla. ¿Qué servicio debe recibir los datos?

2. Una aplicación web envía eventos de clic en JSON. El equipo de analítica quiere tenerlos en Amazon S3 en formato Apache Parquet para consultarlos con Athena, con un retraso de pocos minutos y con el LEAST operational overhead. ¿Qué solución cumple los requisitos?

3. Un stream de Kinesis Data Streams en modo provisioned tiene 10 shards. El caudal total es de 3 MB/s, pero los productores reciben errores ProvisionedThroughputExceededException de forma continua. Los registros usan como partition key el código de país y el 90 % del tráfico procede de España. ¿Qué debe hacer el arquitecto?

4. Una app de venta de entradas enviará a Kinesis Data Streams en modo provisioned 4.500 registros por segundo de 0,5 KB cada uno en el pico previsto. ¿Cuál es el número mínimo de shards que necesita el stream para la escritura?

5. Una startup lanza una app cuyo tráfico de eventos es imposible de prever: puede pasar de casi nada a varios MB/s en minutos. Quiere usar Kinesis Data Streams sin tener que calcular ni ajustar la capacidad. ¿Qué configuración debe elegir?

6. Ocho aplicaciones leen el mismo Kinesis Data Stream con GetRecords y sufren latencias de lectura altas y errores de throttling de lectura, aunque la escritura va bien. ¿Qué cambio resuelve el problema con el menor impacto en el diseño?

7. Una empresa ejecuta un clúster de Apache Kafka en su centro de datos con decenas de productores y consumidores que usan las APIs de Kafka y Kafka Connect. Quiere llevarlo a AWS sin modificar el código de las aplicaciones y sin gestionar brokers ni su recuperación ante fallos. ¿Qué servicio debe usar?

8. Una tienda online genera pedidos que una flota de workers en Auto Scaling debe procesar. Cada pedido debe procesarse una sola vez, el orden no importa y se quiere desacoplar la web de los workers para absorber picos. ¿Qué servicio es el más adecuado?

9. Una cadena de supermercados quiere enviar el vídeo en directo de 2.000 cámaras de seguridad a AWS, guardarlo 7 días y analizarlo con modelos de visión artificial. ¿Qué servicio debe recibir el vídeo?

10. Los analistas consultan con Amazon Athena 20 TB de logs en JSON sin comprimir almacenados en S3 en un único prefijo. Casi todas las consultas filtran por fecha y leen 3 de 40 columnas. La factura de Athena es muy alta. ¿Qué DOS acciones reducirán más el coste? (Elige dos)

11. Un banco tiene su data lake en S3 catalogado en AWS Glue. El equipo de marketing debe consultar la tabla de clientes con Athena sin ver las columnas de DNI e IBAN, y solo las filas de clientes de España. Se busca una gestión centralizada de estos permisos. ¿Qué solución cumple los requisitos?

12. Cada día llegan a un bucket de S3 nuevos ficheros CSV de proveedores cuyo esquema cambia de vez en cuando (se añaden columnas). Los analistas quieren consultarlos con Athena y que las tablas y particiones se actualicen solas. ¿Qué debe configurar el arquitecto?

13. Un equipo de analistas de negocio sin conocimientos de programación necesita limpiar y normalizar ficheros de ventas en S3 (quitar duplicados, unificar formatos de fecha, rellenar valores vacíos) antes de analizarlos. ¿Qué servicio es el más adecuado?

14. Una empresa procesa cada noche 30 TB con Apache Spark en Amazon EMR sobre EC2. Quiere reducir el coste sin arriesgarse a perder datos si AWS reclama capacidad. ¿Qué DOS medidas son adecuadas? (Elige dos)

15. Un equipo de datos ejecuta trabajos de Apache Spark unas pocas veces por semana, con volúmenes variables. No quiere dimensionar, parchear ni apagar clústeres, pero necesita seguir usando su código Spark y las versiones de EMR. ¿Qué opción elegir?

16. Una empresa tiene un data warehouse en Amazon Redshift con los datos de los últimos 12 meses. Los analistas necesitan, a veces, cruzar esas tablas con 5 años de histórico en Parquet en S3, sin cargar el histórico en el clúster. ¿Qué solución es la más adecuada?

17. El departamento financiero necesita paneles con consultas complejas (joins de varias tablas de hechos de varios TB) que usan 300 empleados a la vez durante toda la jornada, con tiempos de respuesta de segundos. ¿Dónde deberían residir los datos para el análisis?

18. Un marketplace quiere ofrecer búsqueda por palabras clave con relevancia y autocompletado sobre 50 millones de productos, y además analizar sus logs de aplicación con paneles interactivos casi en tiempo real. ¿Qué servicio cubre ambas necesidades?

19. La dirección quiere paneles interactivos de ventas, accesibles desde el navegador y con actualización diaria, a partir de datos que ya están en Amazon Athena y Amazon Redshift. No se quiere desplegar ni mantener servidores de BI. ¿Qué servicio debe usarse?

20. Una aseguradora quiere incorporar a su data lake datos meteorológicos históricos y actualizados de un proveedor externo, con suscripción y facturación gestionadas y entrega directa en su cuenta, sin montar un proceso de intercambio de ficheros por SFTP. ¿Qué servicio encaja?

21. Una plataforma educativa sube vídeos de clases a un bucket de S3 y necesita convertir automáticamente cada vídeo a varios formatos y resoluciones para móviles y navegadores, con un servicio gestionado. Según la lista de servicios del examen, ¿qué servicio encaja con esta tarea?

22. Cada noche llegan a S3 unos 400 GB de CSV nuevos. Hay que convertirlos a Parquet particionado para Athena, procesando solo los ficheros nuevos y sin gestionar servidores. ¿Qué solución es la más adecuada?

23. Unas aplicaciones en subredes privadas sin acceso a Internet deben enviar registros a Kinesis Data Streams. La política de seguridad prohíbe que el tráfico salga de la red de AWS y se quiere evitar el coste de un NAT Gateway. ¿Qué debe configurar el arquitecto?

24. Un centro de atención al cliente graba todas las llamadas en S3. La dirección quiere obtener automáticamente el texto de cada llamada y medir el sentimiento del cliente, sin entrenar modelos propios. ¿Qué DOS servicios debe combinar? (Elige dos)

25. Una aseguradora recibe miles de formularios de siniestros escaneados en PDF. Necesita extraer automáticamente los campos (número de póliza, fecha, importe) conservando la relación entre cada etiqueta y su valor, y las tablas del documento. ¿Qué servicio debe usar?

26. Una operadora de telecomunicaciones quiere predecir qué clientes darán de baja el próximo mes a partir de su histórico propio de uso, pagos y reclamaciones. Tiene un equipo de científicos de datos que quiere controlar el algoritmo y desplegar el modelo como endpoint. ¿Qué servicio es el adecuado?

27. Una red social necesita detectar automáticamente imágenes con contenido inapropiado en las fotos que suben los usuarios, con el mínimo esfuerzo de desarrollo y sin entrenar modelos. ¿Qué servicio debe usar?

28. Una empresa está creando un data lake en Amazon S3 con datos de clientes. ¿Qué TRES medidas contribuyen a protegerlo de acuerdo con las buenas prácticas de AWS? (Elige tres)

29. Unos dispositivos envían registros en CSV a Amazon Data Firehose y el equipo quiere que lleguen a S3 en Apache Parquet. ¿Qué DOS elementos son necesarios en la configuración de Firehose? (Elige dos)

30. Una fintech quiere calcular sobre un Kinesis Data Stream el importe total de operaciones por tarjeta en ventanas deslizantes de 5 minutos y detectar anomalías en tiempo real con una aplicación con estado gestionada. Una guía antigua recomienda Kinesis Data Analytics for SQL. ¿Qué servicio debe usar hoy?

31. Una productora genera cada noche unos 2 TB de ficheros en un NAS local (NFS) que deben copiarse a S3 para procesarlos por la mañana. Se necesita una transferencia programada, cifrada y con verificación de integridad, usando el enlace de Internet de la empresa. ¿Qué servicio es el más adecuado?

32. Una pyme quiere un data warehouse para informes mensuales que se ejecutan unas pocas horas al mes. Quiere almacenamiento columnar y el menor coste posible, sin gestionar ni pausar clústeres manualmente. ¿Qué opción es la MOST cost-effective?