
Este trabajo presenta un analisis comparativo dela implementacion de una representacion de Bolsa de Palabras (Bag of Words- $BoW$) para el procesamiento distribuido de una coleccion de documentos de texto en la plataforma de proce-samiento distribuido Apache $\mathrm {S}\mathrm {p}\mathrm {a}\mathrm {r}\mathrm {k}^{\mathrm {T}\mathrm {M}}$ La implementacion $\mathrm {B}\mathrm {o}\mathrm {W}$, integro tecnologias para el almacenamiento y proce-samiento distribuido como Apache $\mathrm {H}\mathrm {a}\mathrm {d}\mathrm {o}\mathrm {o}\mathrm {p}^{\mathrm {T}\mathrm {M}}$, exactamente Hadoop Distributed File System (HDFS); y Apache $\mathrm {S}\mathrm {p}\mathrm {a}\mathrm {r}\mathrm {k}^{\mathrm {T}\mathrm {M}}$, respectivamente. El cluster de computacion se configuro con 17 equipos conectados entre si, en los cuales se almaceno un conjunto de datos de 500 archivos de texto plano. Las eta-pas del algoritmo $\mathrm {B}\mathrm {o}\mathrm {W}$ fueron implementadas modularmente en Apache $\mathrm {S}\mathrm {p}\mathrm {a}\mathrm {r}\mathrm {k}^{\mathrm {T}\mathrm {M}}$ Los resultados obtenidos demostraron comportamientos positivos en terminos de SpeedUp llegando a tener hasta un aumento proporcional de 4x al usar los 16 nodos del cluster, siendo la cantidad limite de nodos esclavos en los diferentes escenarios de experimentacion permitiendo comparar un comportamiento con el SpeedUp teorico senalando un grado de paralelizacion maximo del 80% en dicho punto sugeriendo la ventaja de la computacion distribuida para el procesamiento masivo de datos (Big Data). Igualmente, la experimentacion permitio identificar puntos a mejorar para profundizar en posibles causas, mejoras y trabajo futuro para su aplicacion en analisis de datos (Data Analytics) como apoyo a la investigacion, formacion y la industria.
| selected citations These citations are derived from selected sources. This is an alternative to the "Influence" indicator, which also reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | 0 | |
| popularity This indicator reflects the "current" impact/attention (the "hype") of an article in the research community at large, based on the underlying citation network. | Average | |
| influence This indicator reflects the overall/total impact of an article in the research community at large, based on the underlying citation network (diachronically). | Average | |
| impulse This indicator reflects the initial momentum of an article directly after its publication, based on the underlying citation network. | Average |
