○ unseen · kind tool · level 0 · 0h

Ecosistema open source de almacenamiento y cómputo para clusters de datos: HDFS (bloques replicados) + YARN + MapReduce.

Mecanismo. HDFS parte cada archivo en bloques y los replica en varios nodos; YARN asigna contenedores de recursos y MapReduce procesa cerca de los datos (data locality), moviendo el cómputo hacia el bloque en vez del bloque hacia el cómputo.

Límite. Está pensado para lotes sobre disco, no para baja latencia ni iteración. Hoy convive con Spark y con el warehouse cloud más que ser el motor por defecto; su valor perdurable es HDFS y el modelo de replicación.

Enlaces

Fuentes