+593 98 492 5548 info@riiote.org

INVESTIGACIÓN | INTELIGENCIA ARTIFICIAL

Aprendizaje automático con múltiples anotadores y datos desbalanceados

Por: Edison Narváez
Publicado: Agosto 2026
Área: Inteligencia Artificial · Machine Learning · Ciencia de Datos

Resumen

El entrenamiento de modelos de inteligencia artificial depende en gran medida de la disponibilidad de datos correctamente etiquetados. Sin embargo, cuando los datos son etiquetados mediante plataformas de colaboración colectiva, diferentes personas pueden presentar distintos niveles de experiencia y criterios al asignar etiquetas.

Esta situación puede generar información incompleta, inconsistente y desbalanceada, afectando el rendimiento de los modelos de aprendizaje automático.

El artículo Learning from Crowds Using a Focal Loss Function: Dealing with Imbalanced Annotations propone un nuevo enfoque denominado CCGPFL (Correlated Chained Gaussian Process with Focal Loss) para abordar estos problemas.

La propuesta combina un modelo probabilístico capaz de representar la confiabilidad de diferentes anotadores con una función de pérdida focal (Focal Loss), diseñada para otorgar mayor importancia a los ejemplos difíciles o pertenecientes a clases minoritarias.

Los experimentos realizados sobre conjuntos de datos sintéticos, semisintéticos y reales muestran que el método propuesto obtiene resultados competitivos y, en varios escenarios, superiores a diferentes métodos existentes para aprendizaje a partir de múltiples anotadores. La evaluación se realiza principalmente mediante métricas como Overall Accuracy (OA) y Area Under the ROC Curve (AUC).

Palabras clave: Inteligencia artificial, aprendizaje automático, crowdsourcing, Focal Loss, datos desbalanceados, anotadores, Gaussian Process, clasificación.


1. Introducción

Para desarrollar un modelo de inteligencia artificial supervisado se necesita una gran cantidad de información etiquetada.

Por ejemplo, si queremos desarrollar un sistema capaz de reconocer imágenes de vehículos, cada imagen debe indicar previamente qué objeto contiene.

El problema aparece cuando las etiquetas son creadas por diferentes personas.

Un anotador puede considerar que una imagen pertenece a una categoría, mientras que otro puede interpretarla de manera diferente. Además, algunos anotadores pueden etiquetar únicamente una pequeña parte de los datos.

Esta situación genera dos problemas importantes:

Diferencias entre anotadores

No todas las personas tienen el mismo nivel de experiencia o precisión.

Desbalance de clases

Algunas categorías pueden recibir muchas etiquetas mientras que otras quedan representadas por muy pocos ejemplos.

El artículo analiza precisamente esta problemática y propone una metodología para aprender de múltiples anotadores considerando tanto su confiabilidad como el desbalance de las anotaciones.


2. ¿Qué significa “Learning from Crowds”?

El concepto Learning from Crowds hace referencia al aprendizaje automático utilizando datos etiquetados por múltiples personas.

En lugar de depender de un único experto, una organización puede distribuir la tarea de etiquetado entre numerosos colaboradores.

Por ejemplo:

              DATOS
                ↓
      ┌─────────┼─────────┐
      ↓         ↓         ↓
 Anotador A  Anotador B  Anotador C
      ↓         ↓         ↓
      └─────────┼─────────┘
                ↓
       Etiquetas diferentes
                ↓
          MODELO DE IA

Este enfoque permite etiquetar grandes cantidades de información, pero introduce incertidumbre sobre cuál es la etiqueta correcta y qué tan confiable es cada anotador.


3. El problema de las clases desbalanceadas

Uno de los principales problemas estudiados es el desbalance de clases.

Supongamos que tenemos 10.000 imágenes:

  • 8.000 pertenecen a la categoría A.
  • 1.500 pertenecen a la categoría B.
  • 500 pertenecen a la categoría C.

Un modelo tradicional puede aprender principalmente a reconocer la categoría A porque aparece con mucha mayor frecuencia.

Esto puede producir una situación engañosa: el modelo puede obtener una precisión aparentemente elevada, pero funcionar mal cuando encuentra ejemplos de las categorías minoritarias.

Por esta razón, el artículo propone utilizar Focal Loss, una función diseñada para dar mayor importancia a los ejemplos difíciles durante el entrenamiento.


4. ¿Qué es Focal Loss?

La Focal Loss modifica la función de pérdida tradicional utilizada durante el entrenamiento de modelos de clasificación.

Su objetivo es evitar que los ejemplos fáciles dominen el proceso de aprendizaje.

De manera simplificada:

Ejemplos fáciles → menor peso

Ejemplos difíciles → mayor peso

Esto permite que el modelo concentre una mayor parte de su aprendizaje en los casos que presentan dificultades.

La idea es especialmente útil cuando existen clases minoritarias o cuando las anotaciones proporcionadas por diferentes personas son incompletas.


5. El método CCGPFL

La principal propuesta del artículo recibe el nombre de:

CCGPFL — Correlated Chained Gaussian Process with Focal Loss

El método combina diferentes componentes.

Gaussian Process

Los procesos gaussianos permiten construir modelos probabilísticos capaces de representar incertidumbre.

En este trabajo se utilizan para modelar información relacionada con las etiquetas y la confiabilidad de los anotadores.

Correlación entre anotadores

El método también considera que los diferentes anotadores no necesariamente trabajan de manera completamente independiente.

Sus decisiones pueden presentar relaciones o patrones.

Focal Loss

La función de pérdida focal permite reducir el impacto de los ejemplos fáciles y concentrarse en los casos más difíciles.

La combinación de estos elementos permite construir un modelo capaz de manejar simultáneamente:

Incertidumbre + múltiples anotadores + clases desbalanceadas.


6. ¿Cómo funciona?

El proceso puede representarse de forma simplificada:

DATOS SIN ETIQUETAR
        ↓
MÚLTIPLES ANOTADORES
        ↓
ETIQUETAS DISPERSAS
        ↓
ANÁLISIS DE CONFIABILIDAD
        ↓
MODELO GAUSSIANO
        ↓
FOCAL LOSS
        ↓
APRENDIZAJE DEL MODELO
        ↓
CLASIFICACIÓN

El sistema intenta estimar simultáneamente cuál sería la etiqueta verdadera y qué tan confiables son las diferentes anotaciones.

Esto permite utilizar mejor conjuntos de datos donde la información proporcionada por los anotadores es incompleta o desigual.


7. Evaluación experimental

Los autores evaluaron el método utilizando diferentes tipos de conjuntos de datos:

  • Datos sintéticos.
  • Datos semisintéticos.
  • Datos reales con múltiples anotadores.

Esto permite comprobar el comportamiento del modelo en diferentes escenarios.

La evaluación utiliza principalmente métricas como:

Overall Accuracy (OA)

Mide la proporción general de predicciones correctas.

Area Under the ROC Curve (AUC)

Permite evaluar la capacidad del modelo para distinguir entre diferentes clases.

Un AUC cercano a 1 indica una capacidad de discriminación elevada.

Los experimentos muestran que CCGPFL consigue resultados competitivos y, en varios escenarios, superiores a diferentes métodos utilizados como referencia.


8. ¿Por qué es importante?

El problema abordado por esta investigación aparece en numerosos proyectos reales de inteligencia artificial.

Por ejemplo:

Medicina

Diferentes especialistas pueden etiquetar imágenes médicas y no siempre coincidir completamente.

Reconocimiento de imágenes

Miles de usuarios pueden participar en la clasificación de fotografías.

Procesamiento de lenguaje

Diferentes personas pueden etiquetar sentimientos, temas o intenciones de un texto de maneras diferentes.

Moderación de contenido

Los anotadores pueden clasificar contenido como apropiado, inapropiado o potencialmente dañino.

Ciencia de datos

Las plataformas de crowdsourcing permiten construir grandes conjuntos de datos mediante la colaboración de múltiples personas.

Por tanto, mejorar la forma en que los modelos utilizan estas etiquetas puede tener un impacto considerable en diferentes áreas de la inteligencia artificial.


9. Ventajas del enfoque

La propuesta presenta varias características interesantes.

Considera la confiabilidad de los anotadores

No supone que todas las personas proporcionan etiquetas con exactamente la misma calidad.

Maneja datos incompletos

Puede trabajar con situaciones donde cada anotador etiqueta solamente una parte del conjunto de datos.

Considera el desbalance

La Focal Loss ayuda a prestar mayor atención a ejemplos difíciles y clases minoritarias.

Utiliza un enfoque probabilístico

El modelo permite representar incertidumbre en el proceso de aprendizaje.


10. Limitaciones

Aunque los resultados son prometedores, todavía existen desafíos.

Entre ellos:

  • Mayor complejidad computacional.
  • Necesidad de analizar conjuntos de datos más grandes.
  • Diferencias entre tipos de anotadores.
  • Posible variación en el rendimiento dependiendo del dominio.
  • Necesidad de validar el método en más aplicaciones reales.

También resulta importante estudiar cómo se comporta el modelo cuando existe una gran cantidad de anotadores con niveles de confiabilidad muy diferentes.


11. Aplicaciones futuras

El enfoque podría aplicarse a sistemas donde la calidad de las etiquetas representa un problema importante.

Algunas posibilidades son:

  • Diagnóstico asistido por inteligencia artificial.
  • Clasificación de imágenes médicas.
  • Reconocimiento de objetos.
  • Procesamiento de lenguaje natural.
  • Detección de contenido malicioso.
  • Sistemas de recomendación.
  • Análisis de sentimientos.
  • Moderación automática.
  • Reconocimiento de señales.
  • Construcción de grandes datasets para IA.

Una línea interesante sería combinar este tipo de técnicas con modelos modernos de Deep Learning y modelos multimodales, permitiendo trabajar con grandes cantidades de datos etiquetados de manera colaborativa.


12. Conclusiones

La investigación demuestra que uno de los desafíos menos visibles del aprendizaje automático no siempre está relacionado con el modelo utilizado, sino con la calidad y distribución de los datos de entrenamiento.

Cuando diferentes personas etiquetan los mismos datos, pueden aparecer inconsistencias, incertidumbre y desbalance entre categorías.

El método CCGPFL aborda este problema combinando un modelo probabilístico para representar la confiabilidad de los anotadores con una función de pérdida focal que presta mayor atención a los ejemplos difíciles.

Los experimentos realizados con datos sintéticos, semisintéticos y reales muestran que el método puede alcanzar resultados competitivos frente a diferentes técnicas existentes, especialmente utilizando métricas como OA y AUC.

En definitiva, el trabajo demuestra que mejorar la forma en que una inteligencia artificial interpreta las etiquetas humanas puede ser tan importante como mejorar el propio algoritmo de clasificación.


Referencia original

Gil-Gonzalez, J., Cárdenas-Peña, D. A., Orozco-Gutiérrez, A., Guijarro-Estelles, E. D., & Álvarez-Meza, A. M. (2026). Learning from Crowds Using a Focal Loss Function: Dealing with Imbalanced Annotations. Technologies, 14(6), 370.

DOI: 10.3390/technologies14060370