IA GENERATIVA APLICADA AL ANÁLISIS DE DATOS: USOS Y POSIBILIDADES

9 de septiembre del 2026

Introducción

Guía Data Science - Inteligencia Artificial: La inteligencia artificial generativa ha introducido un cambio significativo en la relación entre humanos y sistemas de información. La interacción con modelos capaces de comprender lenguaje natural permite formular preguntas, solicitar transformaciones de datos, generar código, interpretar resultados o construir representaciones visuales sin necesidad de expresar cada operación mediante una sintaxis técnica convencional. En el ámbito del análisis de datos, esta transformación resulta especialmente relevante, dado que acerca tareas estadísticas y computacionales a perfiles profesionales que anteriormente necesitaban dominar herramientas especializadas.

Sin embargo, IA generativa y análisis de datos (que siendo rigurosos y según la frontera lingüística establecida desde Bruselas, se conoce como IA, concepto en el que se incluye no solo los modelos estadísticos, los de minería de datos, los de machine learning y deep learning, sino también las herramientas como R, Python, Databrick, etc…) no son equivalentes. El modelo de lenguaje puede generar una consulta SQL, proponer X transformación en Python o explicar una distribución estadística, pero la validez del resultado depende de los datos, del contexto, formulación del problema y de la verificación humana. La investigación reciente sobre análisis automatizado mediante grandes modelos de lenguaje muestra precisamente este doble fenómeno, una creciente capacidad para automatizar etapas del proceso analítico y, simultáneamente, problemas relacionados con alucinaciones, adaptación al dominio e integración fiable de los sistemas.

La cuestión aquí fundamental, por tanto, no es si la IA generativa puede analizar datos, sino cómo debe integrarse en una metodología rigurosa de Data Science.

 

 

¿Qué aporta la IA generativa al análisis de datos?

La principal novedad consiste en introducir una interfaz lingüística sobre ciertas operaciones que tradicionalmente requerían programación o herramientas específicas. Un analista puede, por ejemplo, formular preguntas sobre algún conjunto de datos, pedir la consulta SQL, solicitar explicación sobre una anomalía o generar código para realizar una transformación.

La investigación académica reciente identifica cuatro grandes niveles de análisis susceptibles de automatización mediante modelos de lenguaje: descriptivo, diagnóstico, predictivo y prescriptivo. Los LLM pueden actuar como interfaces de consulta, generadores de código y coordinadores de diferentes etapas del workflow analítico.

Flujo de análisis de datos mediante inteligencia artificial generativa

Esta evolución también está llegando a plataformas profesionales. Microsoft Power BI, por ejemplo, permite formular preguntas en lenguaje natural sobre un modelo semántico y obtener respuestas y visualizaciones generadas a partir de los datos disponibles. La propia documentación de Microsoft advierte, no obstante, que las respuestas de Copilot son no deterministas y necesitan ser evaluadas y validadas por el usuario.

Google BigQuery ha avanzado en una dirección más o menos semejante. Gemini puede ayudar a explorar datos, explicar y generar SQL, preparar información y construir modelos de aprendizaje automático; añadidamente, las capacidades más recientes permiten incorporar funciones de IA generativa directamente en consultas SQL para tareas como clasificación y puntuación.

Preparación y limpieza de datos mediante IA generativa

Una de las aplicaciones potencialmente más relevantes se encuentra en la etapa que suele consumir una cantidad considerable de tiempo: la ineludible preparación de los datos.

La limpieza incluye detectar valores ausentes, inconsistencias, duplicidades, formatos incompatibles, variables mal codificadas o registros potencialmente anómalos. Los sistemas generativos pueden contribuir proponiendo transformaciones, identificando patrones de calidad o generando automáticamente código para ejecutar diversos procedimientos.

Google, por ejemplo, ha incorporado capacidades de preparación asistida por IA generativa que analizan esquemas y datos para sugerir operaciones de limpieza, transformación y enriquecimiento.

IA generativa para limpieza y preparación de datos

Esto no significa que el algoritmo deba decidir automáticamente qué transformación aplicar. En análisis de datos, eliminar un registro, imputar un valor ausente o modificar una variable podría cambiar la distribución estadística y, en consecuencia, las conclusiones posteriores. Es decir, la IA generativa formula una propuesta, pero la decisión metodológica corresponde al profesional.

De la automatización a la supervisión

La diferencia entre automatizar una operación y automatizar una decisión es de gran importancia. Generar código para convertir cualquier fecha almacenada como texto en formato temporal estándar constituye una tarea relativamente acotada. Decidir que determinados valores extremos son errores y deben eliminarse implica una consideración metodológica mucho más compleja.

Por ello, la incorporación de IA generativa debe mantener una estructura human-in-the-loop, particularmente cuando las transformaciones afectan a la representatividad de la muestra, a variables sensibles o a las conclusiones del estudio.

IA generativa para escribir SQL y código de análisis

La generación automática de código constituye actualmente uno de los usos más consolidados. El analista describe en lenguaje natural una operación y solicita que el sistema produzca SQL, Python o R. Como es conocido, esto reduce el tiempo empleado en tareas repetitivas y facilita la exploración de alternativas.

<img class=

Los sistemas de IA generativa llegan, por ejemplo, a convertir una pregunta como “¿qué regiones han experimentado el mayor crecimiento de ventas durante los últimos tres años?” en una consulta SQL que agrupe, ordene y compare las variables correspondientes.

Las plataformas de datos están incorporando esta posibilidad directamente en sus entornos. BigQuery permite introducir instrucciones en lenguaje natural para generar consultas SQL, utilizando metadatos de las tablas para contextualizar la petición.

Asimismo, la literatura reciente sobre Text-to-SQL muestra que la traducción de lenguaje natural a consultas SQL se ha convertido en una línea de investigación consolidada, con avances en prompt engineering, fine-tuning, evaluación y adaptación a diferentes esquemas de bases de datos.

El beneficio profesional es evidente, pero también lo es el riesgo, ya que una consulta sintácticamente correcta puede ser conceptualmente incorrecta.

Por ejemplo, el modelo puede interpretar “ventas” como facturación bruta cuando la organización utiliza ese concepto para referirse a ventas netas. Incluso seleccionar una dimensión temporal incorrecta o efectuar alguna agregación que no responde realmente a la pregunta planteada.

Por tanto, la competencia analítica no desaparece con la generación automática de código; al contrario, adquiere mayor importancia porque es necesario evaluar el significado de lo que el código hace. Sin contar con que el código aportado por una IA generativa no suele estar muy depurado ni limpio, lo que provoca pérdida de tiempos en procesos si no se tienen conocimientos al respecto.

Exploratory Data Analysis asistido por IA generativa

El análisis exploratorio de datos (EDA) forma otro ámbito de gran interés. Ante un conjunto de datos, el sistema generativo ayuda a identificar distribuciones, correlaciones, variables potencialmente relevantes, valores atípicos o relaciones que merecen una investigación adicional. También puede proponer gráficos apropiados y explicar el significado estadístico básico de ciertos resultados.

Los avances recientes en herramientas de análisis automatizado con LLM muestran precisamente una tendencia hacia sistemas capaces de coordinar varias etapas, entiéndase exploración, generación de código, visualización e interpretación.

Esto es especialmente útil durante la primera aproximación a datasets grandes o desconocidos. En lugar de comenzar desde cero, el analista puede obtener una primera cartografía de las variables y utilizarla para formular hipótesis.

Ahora bien, una exploración automatizada no debe confundirse con una investigación científica. La IA generativa podría llegar a sugerir una correlación, corresponde al analista determinar si existe una relación estadísticamente significativa, si es explicable por variables de confusión y, sobre todo, si existe fundamento para interpretarla causalmente.

Visualización y comunicación de resultados

La IA generativa también está modificando la producción de visualizaciones y narrativas analíticas. Las herramientas actuales permiten pedir en lenguaje natural un gráfico, comparación, explicación de tendencias o un resumen ejecutivo. Power BI, por ejemplo, genera visualizaciones a partir de preguntas formuladas sobre un modelo semántico, además de permitir consultar información utilizando lenguaje natural.

Esta capacidad reduce considerablemente la distancia entre análisis y comunicación. Sin embargo, como ya sabemos una visualización adecuada no es exclusivamente una cuestión estética. La selección de escalas, agregaciones, intervalos temporales y variables determina la interpretación.

La IA generativa podría producir un gráfico técnicamente correcto, pero metodológicamente poco apropiado. Por supuesto, el profesional en datos debe evaluar si el tipo de representación elegido responde realmente a la pregunta analítica. Y hablar de profesional en datos no es otra cosa que referirse a la calidad de la formación recibida, algo que sabemos bien, luego de múltiples ediciones, en el Máster en Big Data y Data Science de la UNED.

Análisis predictivo y generación de hipótesis

La relación entre IA generativa y Data Science resulta todavía más interesante cuando se incorpora el machine learning.

Los modelos generativos ayudan a formular hipótesis, preparar conjuntos de entrenamiento, generar código de modelización, explicar determinadas variables, comparar algoritmos o documentar resultados. En algunos entornos incluso se integran en workflows donde el usuario solicita tareas analíticas complejas mediante instrucciones lingüísticas.

La evolución de los llamados data agents apunta en esa dirección. La literatura académica reciente describe agentes basados en LLM capaces de planificar tareas, dividir problemas en subtareas, razonar, incorporar conocimiento y coordinar diferentes operaciones de análisis estadístico con una intervención humana reducida.

El cambio conceptual es importante, ya no se trata únicamente de un chatbot que responde preguntas sobre un cúmulo de datos, hablamos de sistemas que pueden actuar como orquestadores de procesos analíticos.

IA generativa y Big Data

Cuando el volumen y la variedad de información aumentan, la IA generativa es integrable en arquitecturas Big Data.

El objetivo no consiste en introducir todos los datos dentro de un modelo de lenguaje. Lo habitual es construir una arquitectura en la que el modelo interactúe con sistemas especializados, como bases de datos, data warehouses, data lakes, motores SQL, APIs, catálogos y herramientas de visualización.

Arquitectura Big Data integrada con inteligencia artificial generativa

En el anterior escenario, el LLM funciona como una capa de interpretación y coordinación. El usuario formula una pregunta, el sistema identifica la fuente apropiada, genera la consulta, obtiene resultados, interpreta y presenta una respuesta.

Google ha desarrollado, por ejemplo, capacidades de análisis conversacional conectadas con BigQuery y Looker, permitiendo formular preguntas sobre datos mediante lenguaje natural y construir agentes personalizados para interactuar con información empresarial.

Esta integración explica por qué la formación en Big Data y Data Science debe trascender el conocimiento aislado de la IA generativa.

En el Máster en Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas de la UNED, el análisis de datos, la minería de datos y las herramientas Big Data forman parte de una estructura académica de 60 ECTS. En todo este modelo formativo, comprender la IA generativa significa aprender a integrarla dentro de un ecosistema donde siguen siendo fundamentales la estadística, la programación, la gestión de datos y la evaluación de modelos. De hecho, el peso del conocimiento estadístico en el Máster Big Data y Data Science de la UNED es uno de sus factores diferenciales.

El problema de las alucinaciones y la calidad de los resultados

Una de las mayores limitaciones de los sistemas generativos es que pueden producir respuestas plausibles sin que estas sean necesariamente correctas. En Data Science, este problema adquiere su dimensión particular. Un error lingüístico puede llegar a ser evidente o una consulta SQL incorrecta producir cifras aparentemente razonables. Y el resultado termina incorporándose a un informe, un dashboard o una decisión empresarial sin que el error sea detectado (es uno de los escenarios más graves).

Por eso, el principio fundamental debe ser verificar tanto el resultado como la explicación proporcionada por el modelo. La revisión debe incluir, según el caso, comprobación del código, consulta original, variables utilizadas, filtros aplicados, tamaño de la muestra, unidades, transformaciones y consistencia con resultados obtenidos mediante procedimientos independientes.

Privacidad, seguridad y gobierno del dato

El empleo de IA generativa introduce, por otra parte, una dimensión de gobernanza. Enviar datos empresariales, información personal o registros sensibles a un servicio externo plantea problemas relacionados con privacidad, confidencialidad, seguridad y cumplimiento normativo.

La guía del NIST para la gestión de riesgos de IA generativa incorpora precisamente aspectos relacionados con fiabilidad, seguridad, privacidad y evaluación de estos sistemas.

La seguridad de las aplicaciones LLM también se ha convertido en una disciplina específica. OWASP identifica entre los principales riesgos de 2025 la prompt injection, la divulgación de información sensible, el envenenamiento de datos, manejo inadecuado de las salidas y el consumo no acotado de recursos.

Por tanto, una arquitectura de análisis asistido por IA debería establecer controles de acceso, políticas sobre qué información se envía a modelos externos, trazabilidad de las consultas, validación de resultados y mecanismos de auditoría.

El nuevo papel del profesional de Data Science

La IA generativa no elimina la necesidad de especialistas, modifica el perfil de competencias requerido.

El profesional del futuro deberá saber formular problemas, comprender estadística, programar, manejar arquitecturas de datos y evaluar modelos, pero también deberá saber interrogar sistemas generativos, contextualizar sus respuestas y detectar sus errores.

Este cambio refuerza la necesidad de una formación integral. El Máster en Big Data y Data Science de la UNED se estructura precisamente alrededor de competencias que permiten comprender los datos desde distintas perspectivas, incluyendo herramientas Big Data, análisis multivariante y minería de datos.

El dominio de la IA generativa tiene valor cuando se incorpora sobre una base metodológica sólida. Sin conocimientos estadísticos, el usuario podría aceptar una correlación espuria; sin habilidad con bases de datos, confiar en una consulta SQL mal planteada y sin conocimientos de machine learning, interpretar como predicción fiable lo que solamente constituye una asociación.

Ciclo de análisis de datos con IA generativa y supervisión humana

Conclusiones

La IA generativa está transformando el análisis de datos al introducir una nueva capa de interacción entre humanos, código, bases de datos y herramientas analíticas. Sus aplicaciones abarcan la preparación de datos, generación de SQL y código, análisis exploratorio, visualización, documentación, formulación de hipótesis y automatización progresiva de workflows.

La evolución más significativa es construir sistemas en los que los modelos generativos interactúan de forma controlada con infraestructuras de datos y herramientas especializadas.

Esta transformación ofrece importantes ganancias de productividad, pero también aumenta la responsabilidad del analista. La IA puede generar una respuesta convincente y equivocada, interpretar mal una variable o aplicar X transformación inadecuada. Por ello, la competencia decisiva seguirá siendo la capacidad de evaluar críticamente los resultados.

El futuro del análisis de datos no parece orientarse hacia la sustitución del científico de datos, sino hacia una colaboración más estrecha entre profesionales y sistemas inteligentes. En ese escenario ya abordado en textos anteriores, la estadística, programación, ingeniería de datos y comprensión del negocio continúan siendo fundamentales. La IA generativa se convierte en una nueva herramienta dentro de todo ese conocimiento. Sin embargo, sin la base adecuada, tanto conceptual como práctica, en el área de ciencia de datos, el uso puede derivar en problemas, errores y otras desviaciones significativas.

 

FAQ sobre IA generativa aplicada al análisis de datos

¿Qué es la IA generativa aplicada al análisis de datos?

Es la utilización de modelos generativos, especialmente modelos de lenguaje, para asistir o automatizar tareas relacionadas con la preparación, consulta, transformación, exploración, visualización e interpretación de datos.

¿Puede una IA generativa analizar datos por sí sola?

Sí, ejecuta determinadas tareas automatizadas, especialmente cuando está conectada a herramientas y fuentes de datos. Sin embargo, sus resultados deben ser validados, dado que es posible la existencia de errores en interpretación, generación de código o razonamiento.

¿ChatGPT genera consultas SQL?

Sí. Los modelos de lenguaje generan y explican consultas SQL a partir de instrucciones en lenguaje natural. No obstante, la consulta debe revisarse para comprobar que utiliza correctamente tablas, relaciones, filtros, agregaciones y definiciones de negocio.

¿Cómo se utiliza la IA generativa en Data Science?

Entre otros frentes, se emplea para preparar datos, generar código, explorar datasets, producir visualizaciones, documentar análisis, formular hipótesis y asistir en determinados workflows de machine learning y análisis estadístico.

¿Qué riesgos tiene utilizar IA generativa para analizar datos?

Entre los principales riesgos se encuentran las alucinaciones, errores de código, interpretaciones incorrectas, sesgos, filtración de información sensible y vulnerabilidades específicas de las aplicaciones LLM, como la prompt injection.

¿La IA generativa sustituirá a los científicos de datos?

Es improbable que la automatización elimine la necesidad de profesionales capaces de plantear problemas, seleccionar métodos, evaluar la calidad de los datos e interpretar resultados. Es más probable una transformación del trabajo hacia funciones de mayor supervisión, diseño y evaluación.

¿Qué formación es recomendable para trabajar con IA, Big Data y Data Science?

Resulta recomendable una formación que combine estadística, programación, gestión y análisis de datos, machine learning y tecnologías Big Data. El Máster de Formación Permanente en Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas de la UNED cuenta actualmente con 60 ECTS y una estructura que incluye Data Science y Big Data, herramientas Big Data, análisis multivariante y minería de datos, es sin duda la mejor opción del mercado.

 

Referencias bibliográficas

Autio, C., Schwartz, R., Dunietz, J., Jain, S., Stanley, M., Tabassi, E., Hall, P., & Roberts, K. (2024). Artificial intelligence risk management framework: Generative artificial intelligence profile (NIST AI 600-1). National Institute of Standards and Technology. https://doi.org/10.6028/NIST.AI.600-1

Google Cloud. (2026). Analiza datos con la ayuda de Gemini. Google Cloud Documentation. https://docs.cloud.google.com/bigquery/docs/gemini-analyze-data

Microsoft. (2026). Haz Copilot preguntas sobre tus datos. Microsoft Learn. https://learn.microsoft.com/es-es/power-bi/create-reports/copilot-ask-data-question

OWASP Foundation. (2025). LLM01:2025 Prompt Injection. OWASP Gen AI Security Project. https://genai.owasp.org/llmrisk/llm01-prompt-injection/

OWASP Foundation. (2025). LLM02:2025 Sensitive Information Disclosure. OWASP Gen AI Security Project. https://genai.owasp.org/llmrisk/llm022025-sensitive-information-disclosure/

OWASP Foundation. (2026). Top 10 for LLMs and GenAI applications. OWASP Gen AI Security Project. https://genai.owasp.org/llm-top-10/

UNED. (2026). Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas. Universidad Nacional de Educación a Distancia. https://www.masterbigdataonline.com

 

Máster en Big Data y Data Science de la UNED. Matrícula abierta - Edición 2027.