Posted by : Unknown martes, marzo 25, 2014

¡Hola! :D

En esta ocasión hablaré acerca del artículo titulado "MapReduce: Simplified Data Processing on Large Clusters" escrito por Jeffrey Dean y Sanjay Ghemawat, y publicado en el Communications of the ACM en enero del 2008.

Como ya bien sabemos, la cantidad de información contenida en bases de datos se ha incrementado exponencialmente, por lo que las bases de datos relacionales han ido perdiendo efectividad al momento de realizar búsquedas de información. Por eso mismo los modelos relacionales han pasado a segundo plano, dejando lugar a conceptos nuevos como NoSQL y Big Data. Una de las técnicas para buscar información en Big Data es, justamente, MapReduce.

Esta técnica consiste en dos operaciones: map y reduce. Map consiste en tomar una entrada y devolver un conjunto con pares “intermedios” de llaves-valores.  A su vez, este conjunto será pasado como parámetro a la función reduce (que además recibe una llave adicional) para juntar la información realizada por el map. Tanto la función map como la función reduce son definidas por el usuario. Estas dos funciones pueden verse como aquellas que están definidas en lenguajes funcionales como Lisp o Clojure.

La importancia del MapReduce llega cuando hablamos de realizarlo de manera distribuida (es distribuido debido a que tenemos una red de procesadores y no hay una memoria compartida para todos los equipos). De esta manera, se tienen a los “trabajadores” de map realizando esta función, almacenar los resultados temporales en un búfer y posteriormente los “trabajadores” de reduce realizando esta función en un almacenamiento común (por obvias razones, debe haber un maestro que se encargue de coordinar estas operaciones y obtener el resultado final).

Una de las ventajas del MapReduce distribuido, es que si uno de los trabajadores falla, el cálculo se puede volver a hacer bajo ciertas condiciones. El cálculo se debe repetir debido a que solo el equipo que falló tiene acceso a la información que era resultado de la(s) funciones que realizaba, por lo que la información es inalcanzable. Ahora bien, si lo que se estaba realizando era una función map, todo sucede como se describió anteriormente; sin embargo, si se tiene un reduce, se debe revisar si el trabajo ya fue revisado. Si se revisó, entonces se deberá repetir; de lo contrario no hace falta repetir el trabajo. Finalmente cabe mencionar que si la falla se ha presentado en el maestro, simplemente se puede avisar de un error y el usuario puede hacer una nueva petición.

Finalmente, podemos hacer énfasis en que los usuarios de MapReduce pueden encontrarse con pocas problemáticas de sección crítica, ya que si el reduce definido por el usuario no está definido correctamente, existirá una condición de carrera o deadlocks.

Espero que esta entrada haya sido de su agrado :)

Leave a Reply

Subscribe to Posts | Subscribe to Comments

- Copyright © Programación Multinúcleo - Hatsune Miku - Powered by Blogger - Designed by Johanes Djogan -