top of page

DATE LAKE VS DATA WAREHOUSE

LAGO DE DATOS CONTRA ALMACEN DE DATOS

El Data Lake es un repositorio compartido que le permite adquirir y almacenar grandes cantidades de datos procedentes de sistemas heterogéneos en formato nativo, es decir, datos en bruto estructurados, semiestructurados y no estructurados. La adquisición puede provenir de sistemas heredados, como CRM y ERP, o de fuentes externas, como feeds, Internet de las Cosas y datos de redes sociales.

El propósito de un Data Lake es, por lo tanto, proporcionar una visión no necesariamente refinada de los datos para apoyar las actividades de Data Discovery, lo que lo convierte en un sistema adecuado para usuarios expertos.

Una de las principales fortalezas de los Data Lakes es la capacidad de almacenar cualquier tipo de datos. Esta característica es aún más evidente cuando los datos se adquieren con una frecuencia horaria o diaria, a través de estructuras en árbol (pensemos en una estructura de sistema de archivos en «carpetas» y «subcarpetas» organizadas por año, mes, día y, si es necesario, hora). En un Data Lake, la historización y posterior recuperación de los datos se puede llevar a cabo sin pérdida alguna del rendimiento, a diferencia de lo que podría ocurrir con los Data Warehouses para una enorme cantidad de datos.
 

El Data Lake y el Data Warehouse son similares a primera vista: ambos sistemas están diseñados para permitir el almacenamiento de una gran cantidad de datos.

Para entender mejor las diferencias entre un Data Lake y un Data Warehouse, necesitamos examinar más de cerca sus utilidades principales.

Por el contrario, el Data Warehouse está destinado a lograr una visión única de la empresa a través de herramientas de análisis empresarial y de análisis de Big Data. Una visión controlada y certificada a través de procesos especiales de ingesta, destinados a almacenar únicamente los datos procesados para un propósito o proceso de negocio específico.

Principales diferencias entre Data Lake y Data Warehouse

Las características específicas que distinguen a un Data Lake de un sistema tradicional de Data Warehouse son muchas, dependiendo del tipo de datos adquiridos y de la estructura de los mismos. A continuación, resumiremos las principales diferencias y analizaremos las más importantes.

 

47f7709c-7550-416b-910b-b6d7d3f22e4b.jpg

Es indudable que la ciencia de datos o el data science es un universo que hoy en día está en completo auge; las empresas necesitan incorporar en sus plantillas diferentes perfiles relacionados con el universo de lo datos. Pero, ¿cuáles son los perfiles más demandados? ¿A qué se dedica cada uno de ello? Salimos de dudas con las siguientes infografías.

El manager o consultor

Tiene una actitud directiva y de gestión. Es el responsable de un proyecto, de su gestión, equipo y resultados finales. Además, hacer de intermediario entre los diferentes equipos, incluso con el cliente, es una de sus tareas principales. Conoce el entorno big data, su tecnología y programación, pero no la utiliza.

El analista de datos o data analyst

Se encarga de recopilar todo de tipo de datos, sobretodo los ya existentes para realizar una consultoría previa a un proyecto. Con los datos recopilados, realiza informes para definir un proyecto o para corroborar que lo que se está haciendo va por buen camino.

El científico de datos o data scientist

Se encuentra a un nivel superior del analista de datos o data analyst. Tiene un conocimiento más avanzado del ámbito y de las tecnologías, de manera que puede crear algoritmos para acotar, definir o perfeccionar toda la recopilación de datos, con el objetivo de mejorar el proyecto. Desarrolla sus propios modelos de programación.

 

El arquitecto o ingeniero de datos

Su función es velar por el buen funcionamiento de las plataformas en donde se hallan los datos. Por ello, su formación en programación y hardware es muy precisa. Velar por la seguridad también se encuentra dentro de sus funciones.

 

El arquitecto o ingeniero de Big Data

Se encarga de big data. Se diferencia del analista de datos o data analyst porque los datos con los que trabaja son mucho mayores. Cuenta con una formación en programación muy detallada y amplia con el objetivo de trabajar un volumen de datos elevado.

Profesiones relacionadas al análisis y ciencia de datos

© 2020 por YEYO        Morales Lopez Sergio Geovani Grupo A

  • w-facebook
bottom of page