Introducción
Guía Data Science - Machine Learning: El Machine Learning constituye una de las áreas fundamentales en inteligencia artificial y, al mismo tiempo, una de las herramientas centrales del Data Science. Su objetivo es construir modelos capaces de extraer regularidades de los datos para realizar predicciones, clasificar observaciones, detectar estructuras o identificar comportamientos que no resultan evidentes mediante una inspección convencional.
Dentro del aprendizaje automático existen diferentes paradigmas. Entre ellos, el aprendizaje supervisado y el aprendizaje no supervisado representan dos aproximaciones fundamentales y conceptualmente diferentes. La distinción principal reside en la información disponible durante el entrenamiento. En el primer caso existen observaciones acompañadas de una variable objetivo conocida. En el segundo, el algoritmo trabaja con datos que carecen de etiqueta o resultado previamente definido.
Esta diferencia condiciona tanto los algoritmos empleados como la forma de evaluar los resultados, así como el tipo de problema que resulta abordable. Mientras que un modelo supervisado aprende a identificar qué clientes presentan riesgo de abandono a partir de ejemplos históricos, uno no supervisado descubre grupos de clientes con comportamientos similares sin que estos grupos hayan sido definidos previamente.
Comprender esta distinción es esencial para cualquier profesional que trabaje con datos. La elección entre ambos enfoques parte de la naturaleza del problema, la disponibilidad de datos etiquetados, el objetivo analítico y las características de la infraestructura.
¿Qué es el Machine Learning supervisado?
El aprendizaje supervisado se basa en un conjunto de datos donde cada observación dispone de una respuesta conocida o variable objetivo. El modelo recibe variables de entrada (habitualmente denominadas features) y aprende la relación entre éstas y una variable de salida o target. Posteriormente, intenta generalizar esa relación para realizar predicciones sobre observaciones que no se han utilizado durante el entrenamiento.
Formalmente, puede representarse como el aprendizaje de una función:
f(X) → y
Donde X representa las variables predictoras e y el resultado que se pretende estimar.

La característica decisiva es, por lo tanto, la existencia de una referencia conocida frente a la cual puede compararse la predicción. Entre las dos tareas supervisadas más importantes se encuentran la clasificación y la regresión. La documentación actual de scikit-learn incluye ambas entre las familias principales de algoritmos supervisados.
Clasificación
En clasificación, el objetivo consiste en asignar cada observación a una categoría. El modelo aprende, por ejemplo, a determinar si una transacción es legítima o potencialmente fraudulenta, si un correo electrónico es spam, si una imagen pertenece a una determinada clase o si un cliente tiene una probabilidad alta o baja de abandonar un servicio.
Dependiendo del problema pueden existir dos clases (clasificación binaria) o múltiples categorías. También son posibles problemas multilabel, en los que una misma observación recibe varias etiquetas.
Entre los algoritmos utilizados se encuentran la regresión logística, árboles de decisión, bosques aleatorios, máquinas de vectores soporte, métodos de gradient boosting y algunas arquitecturas de redes neuronales.
Regresión
En regresión, la variable objetivo es numérica y continua. El propósito es estimar un valor, pero no asignar una categoría. Predecir la demanda energética de una instalación, estimar el precio de una vivienda, anticipar ingresos o calcular el tiempo esperado hasta determinado evento son ejemplos característicos.
La regresión lineal constituye uno de los métodos clásicos, aunque actualmente se emplean también regresión regularizada, árboles, random forests, gradient boosting y redes neuronales.
En ambos casos (clasificación y regresión) la calidad del modelo debe evaluarse con datos que permitan estimar la capacidad de generalización y no solamente su ajuste sobre los datos de entrenamiento.
¿Qué es el Machine Learning no supervisado?
En el aprendizaje no supervisado no existe una variable objetivo conocida que funcione como respuesta correcta durante el entrenamiento. El algoritmo trabaja con las características de las observaciones e intenta identificar estructuras internas, similitudes, dependencias o agrupaciones.
La pregunta cambia sustancialmente. En lugar de plantear, por ejemplo, “¿qué resultado tendrá esta observación?”, el analista podría preguntar: “¿qué estructura existe en estos datos?”

Entre las aplicaciones más habituales aparecen el clustering, la reducción de dimensionalidad y técnicas de asociación y detección de anomalías.
Esto hace que el aprendizaje no supervisado sea particularmente útil cuando no existe una clasificación previa o se pretende descubrir x estructura que todavía no ha sido conceptualizada.
Clustering
El clustering consiste en agrupar observaciones de acuerdo con ciertas medidas de similitud o distancia. El algoritmo busca construir grupos internamente relativamente homogéneos y suficientemente diferenciados entre sí.

K-means es uno de los métodos más conocidos. Reparte las observaciones alrededor de centroides y requiere especificar previamente el número de grupos.
Otros métodos utilizan estrategias diferentes. DBSCAN, por ejemplo, identifica zonas de elevada densidad y encuentra agrupaciones con formas arbitrarias, además de clasificar observaciones como ruido. A diferencia de K-means, no exige especificar por adelantado el número de clusters.
Una aplicación empresarial sería la segmentación de clientes a partir de variables como frecuencia de compra, gasto medio, antigüedad y comportamiento digital. En lugar de imponer categorías previamente, el algoritmo revela perfiles diferenciados que posteriormente serán interpretados por los analistas.
Reducción de dimensionalidad
Cuando un dataset contiene algún número muy elevado de variables, el análisis puede resultar complejo tanto computacionalmente como desde el punto de vista interpretativo. La reducción de dimensionalidad pretende representar la información utilizando un menor número de dimensiones, intentando conservar parte significativa de la estructura existente.

El Análisis de Componentes Principales (PCA) es una de las técnicas clásicas. Busca combinaciones lineales de las variables originales que expliquen una proporción relevante de su varianza. También puede utilizarse como etapa previa a otros modelos para reducir la complejidad de los datos.
Machine Learning supervisado vs. no supervisado
La diferencia fundamental se resume en lo siguiente: ¿Existe una variable objetivo conocida durante el entrenamiento?
Esta diferencia tiene consecuencias metodológicas importantes. En un problema supervisado, se pueden comparar las predicciones con los valores reales y calcular métricas de rendimiento. En un modelo no supervisado, por el contrario, no existe necesariamente respuesta objetiva previamente establecida que indique cuál debería ser la agrupación correcta.
Por el motivo anterior, evaluar el resultado no supervisado suele exigir una combinación de métricas, conocimiento del dominio y validación sustantiva.
¿Cómo se evalúan los modelos supervisados?
La evaluación es una etapa crítica del proceso de Machine Learning. El modelo que funciona perfectamente sobre los datos con los que fue entrenado posiblemente presenta un comportamiento deficiente cuando recibe nuevas observaciones. Este fenómeno está relacionado con el sobreajuste u overfitting.
En clasificación pueden utilizarse métricas como accuracy, precisión, recall, F1, matriz de confusión o ROC-AUC, dependiendo de las características del problema. En regresión son habituales el error absoluto medio, el error cuadrático medio y el coeficiente de determinación R². Scikit-learn proporciona actualmente un conjunto amplio de métricas para clasificación y regresión, además de herramientas de validación cruzada.
Claramente, la selección de la métrica tampoco es neutral. En un sistema de detección de fraude, por ejemplo, es más importante reducir los falsos negativos que maximizar simplemente la exactitud global. En un problema de clasificación desequilibrado, una accuracy elevada podría ocultar un rendimiento deficiente sobre la clase minoritaria. Por esto, el criterio de evaluación debe estar vinculado al coste real de los errores.
Validación cruzada y generalización
La validación cruzada permite utilizar distintas particiones de los datos para obtener una estimación más robusta del rendimiento del modelo. Herramientas como GridSearchCV y cross_validate incorporan estrategias de evaluación que permiten comparar modelos y ajustar hiperparámetros.
El propósito no es conseguir la puntuación más elevada posible sobre un único conjunto de datos, sino estimar razonablemente cómo responderá el modelo ante información no observada.
¿Cómo se evalúa el aprendizaje no supervisado?
La evaluación del clustering presenta mayores dificultades porque no existe necesariamente una etiqueta de referencia. Puede utilizarse información interna sobre la cohesión de los grupos y su separación respecto a otros grupos, aunque estas métricas no determinan por sí mismas que una solución X sea científicamente útil.
Por ejemplo, un algoritmo puede generar cuatro clusters matemáticamente diferenciados y, sin embargo, esos grupos ser irrelevantes para una estrategia comercial. Por esto, el análisis debe incorporar interpretación del dominio y comprobaciones de estabilidad.
La falta de una variable objetivo no significa ausencia de rigor, pero sí que la validación debe plantearse de otra forma.
Aplicaciones del aprendizaje supervisado
El aprendizaje supervisado es especialmente adecuado cuando existe información histórica suficiente y el objetivo está claramente definido.
En finanzas se utiliza para evaluación del riesgo crediticio o detección de fraude. En comercio electrónico permite estimar demanda, propensión de compra o abandono. En medicina contribuye a clasificar diversas imágenes o apoyar modelos predictivos. En industria utiliza para mantenimiento predictivo cuando existen registros históricos de fallos.
La característica común es que el problema dispone de ejemplos anteriores que permiten asociar un grupo de características con un resultado conocido. La calidad del modelo dependerá, entre otros factores, de la representatividad del conjunto de entrenamiento y de la calidad de las etiquetas. Un dataset mal etiquetado limita seriamente la capacidad predictiva, incluso cuando el algoritmo sea muy sofisticado.
Aplicaciones del aprendizaje no supervisado
El aprendizaje no supervisado resulta especialmente interesante cuando el conocimiento previo sobre la estructura de los datos es limitado.
La segmentación de clientes es uno de los ejemplos más conocidos, pero existen muchos otros: detección de anomalías, análisis de comportamiento, agrupación documental, exploración de datos biomédicos, identificación de comunidades en redes o reducción de dimensionalidad para visualización.
En algunos escenarios también es una fase previa a un modelo supervisado. La reducción de dimensionalidad o determinados procedimientos de agrupación pueden utilizarse como etapas de preprocesamiento o exploración antes de construir un predictor. La documentación de scikit-learn contempla expresamente la posibilidad de encadenar transformaciones no supervisadas con estimadores supervisados.
No son metodologías excluyentes
Naturalmente, presentar aprendizaje supervisado y no supervisado como dos alternativas completamente independientes sería una simplificación. En proyectos reales pueden utilizarse conjuntamente. Un equipo de trabajo comenzaría con técnicas no supervisadas para explorar la estructura de un dataset, identificar segmentos o detectar observaciones atípicas y, posteriormente, emplearía un algoritmo supervisado para realizar predicciones.
También existen enfoques intermedios, como el aprendizaje semisupervisado, que utiliza cantidades reducidas de datos etiquetados junto con grandes conjuntos de datos sin etiquetar. Scikit-learn incluye actualmente algoritmos como Label Propagation, Label Spreading y Self-Training.
Esta posibilidad es especialmente relevante cuando etiquetar datos requiere mucho tiempo o conocimientos expertos. La clasificación manual de imágenes médicas, documentos especializados o ciertos eventos industriales resultaría costosa, pero aprovechar información no etiquetada mejora la eficiencia del proceso.
Del algoritmo al proyecto de Data Science
La elección entre aprendizaje supervisado y no supervisado debe realizarse dentro de una metodología de proyecto más amplia. Antes de seleccionar el algoritmo conviene definir el problema, comprender el contexto, examinar la calidad de los datos y establecer qué resultado sería útil para la organización.
Está claro que un modelo no convierte automáticamente correlaciones en conocimiento, tampoco garantiza causalidad. El profesional debe distinguir entre asociación estadística, capacidad predictiva y explicación causal.
Aquí aparece una de las razones por las que la formación en Big Data y Data Science requiere integrar diferentes competencias. El Máster de Formación Permanente de la UNED en Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas incluye 60 ECTS y contempla módulos como Data Science y Big Data, Herramientas Big Data, Análisis de Datos Multivariantes y Minería de Datos.
La combinación es significativa, comprender un algoritmo de Machine Learning es solo una parte de la competencia profesional. Es necesario saber preparar los datos, seleccionar variables, evaluar modelos, interpretar resultados y situar el análisis dentro del problema que se quiere resolver.
Machine Learning, Big Data y capacidad computacional
El tamaño de los datasets también condiciona la elección de los métodos. Un algoritmo que funciona adecuadamente con algunos miles de observaciones requiere arquitecturas diferentes cuando los datos alcanzan millones o miles de millones de registros. En estos casos entran en juego técnicas de procesamiento distribuido, almacenamiento escalable y herramientas especializadas.
Por esta razón, Big Data y Machine Learning están estrechamente relacionados, pero no son sinónimos. Big Data aborda fundamentalmente la gestión y procesamiento de datos a gran escala y Machine Learning utiliza algoritmos para aprender patrones a partir de datos.
En proyectos complejos, los dos ámbitos confluyen. La infraestructura permite almacenar y procesar la información, el modelo estadístico o de aprendizaje automático transforma esa información en una capacidad analítica.
Consideraciones éticas y de gobernanza
La utilización de modelos predictivos introduce además debates relacionadas con sesgos, transparencia, privacidad y responsabilidad. El algoritmo supervisado aprende de los datos históricos que recibe. Si esos datos contienen sesgos estructurales, el modelo puede reproducirlos o incluso amplificarlos.
En los sistemas no supervisados aparece otro tipo de riesgo: una agrupación matemática puede ser presentada como si representara categorías naturales o sociales objetivas cuando, en realidad, depende de las variables seleccionadas, la escala utilizada y los parámetros del algoritmo.

La evaluación responsable del sistema debe considerar el rendimiento técnico, pero también el contexto de utilización. NIST plantea la gestión del riesgo de IA como un proceso destinado a incorporar consideraciones de confianza y responsabilidad durante el diseño, desarrollo, uso y evaluación de estos sistemas.
Conclusiones
El Machine Learning supervisado y no supervisado responde a dos formas diferentes de extraer información de los datos.
El aprendizaje supervisado parte de ejemplos etiquetados y busca aprender una función capaz de predecir resultados. Sus principales problemas son la clasificación y la regresión, y su rendimiento puede evaluarse comparando las predicciones con valores conocidos.
El aprendizaje no supervisado trabaja sin una variable objetivo predefinida y busca descubrir estructuras internas. El clustering y la reducción de dimensionalidad constituyen dos de sus aplicaciones más importantes. Su evaluación exige, en mayor medida, combinar criterios matemáticos con interpretación del dominio.
La diferencia esencial, por tanto, está en la pregunta que se plantea al dato. Cuando conocemos el resultado que queremos predecir, el aprendizaje supervisado ofrece un marco apropiado. Cuando necesitamos descubrir estructuras que todavía no conocemos, el aprendizaje no supervisado puede proporcionar una vía de exploración.
En Data Science profesional ambos enfoques deben entenderse como herramientas complementarias. La elección correcta depende de los datos disponibles, el objetivo analítico, la calidad de la información, la capacidad computacional y las consecuencias de las decisiones que puedan derivarse del modelo.
Por ello, formarse en Machine Learning implica comprender los datos, formular problemas, seleccionar métodos, evaluar resultados y reconocer las limitaciones de cada modelo. Esta visión integral es la que permite transformar el aprendizaje automático en una verdadera herramienta de análisis y toma de decisiones.
FAQ sobre Machine Learning supervisado y no supervisado
¿Cuál es la principal diferencia entre Machine Learning supervisado y no supervisado?
El aprendizaje supervisado utiliza datos etiquetados con una variable objetivo conocida, mientras que el no supervisado trabaja fundamentalmente con datos sin etiquetas para descubrir estructuras, relaciones o agrupaciones.
¿Qué ejemplos existen de Machine Learning supervisado?
La detección de fraude, la clasificación de correos electrónicos, la predicción de abandono de clientes, la estimación de precios y numerosos problemas de reconocimiento de imágenes son aplicaciones habituales.
¿Qué ejemplos existen de aprendizaje no supervisado?
La segmentación de clientes, el clustering, la detección de determinadas anomalías y la reducción de dimensionalidad son aplicaciones frecuentes del aprendizaje no supervisado.
¿K-means es supervisado o no supervisado?
K-means es un algoritmo de aprendizaje no supervisado utilizado para clustering. Agrupa las observaciones alrededor de centroides y requiere establecer el número de clusters que se desean obtener.
¿Qué algoritmo es mejor: supervisado o no supervisado?
No existe uno universalmente mejor. El enfoque adecuado depende de la disponibilidad de datos etiquetados y del objetivo del proyecto. Si se pretende predecir un resultado conocido, el aprendizaje supervisado suele ser apropiado; si se desea descubrir estructuras no conocidas, es preferible el no supervisado.
¿Se pueden combinar ambos métodos?
Sí. Un proyecto podría utilizar aprendizaje no supervisado para explorar o transformar los datos y posteriormente incorporar un modelo supervisado. También existen metodologías semisupervisadas que combinan datos etiquetados y no etiquetados.
¿Qué relación existe entre Machine Learning y Data Science?
Machine Learning proporciona métodos para construir modelos que aprenden de los datos, mientras que Data Science integra esos métodos con estadística, programación, preparación y gestión de datos, visualización, conocimiento del dominio y evaluación de resultados.
¿Qué formación permite especializarse en Big Data y Data Science?
El Máster de Formación Permanente de la UNED en Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas ofrece una formación de 60 ECTS e incorpora contenidos de Data Science, Big Data, herramientas Big Data, análisis multivariante y minería de datos.
Referencias bibliográficas
IBM. (2023). Tipos de machine learning. IBM Think. https://www.ibm.com/es-es/think/topics/machine-learning-types
IBM. (2024). Aprendizaje supervisado frente a aprendizaje no supervisado: ¿Cuál es la diferencia? IBM Think. https://www.ibm.com/es-es/think/topics/supervised-vs-unsupervised-learning
IBM. (2024). ¿Qué es el aprendizaje no supervisado? IBM Think. https://www.ibm.com/es-es/think/topics/unsupervised-learning
National Institute of Standards and Technology. (2023). Artificial intelligence risk management framework (AI RMF 1.0) (NIST AI 100-1). U.S. Department of Commerce. https://doi.org/10.6028/NIST.AI.100-1
National Institute of Standards and Technology. (2024). Artificial intelligence risk management framework: Generative artificial intelligence profile (NIST AI 600-1). U.S. Department of Commerce. https://doi.org/10.6028/NIST.AI.600-1
scikit-learn developers. (2026). Scikit-learn 1.9.0 user guide. https://scikit-learn.org/stable/user_guide.html
scikit-learn developers. (2026). Metrics and scoring: Quantifying the quality of predictions. https://scikit-learn.org/stable/modules/model_evaluation.html
scikit-learn developers. (2026). DBSCAN. https://scikit-learn.org/stable/modules/generated/sklearn.cluster.DBSCAN.html
scikit-learn developers. (2026). Semi-supervised learning. https://scikit-learn.org/stable/api/sklearn.semi_supervised.html
Universidad Nacional de Educación a Distancia. (2026). Big Data y Data Science aplicados a la Economía y a la Administración y Dirección de Empresas. Formación Permanente UNED. https://www.masterbigdataonline.com/