Inteligencia artificial para la identificación temprana del autismo mediante análisis de lenguaje

Por: Edison Narváez
Publicado: Agosto 2026
Área: Inteligencia Artificial · Machine Learning · Salud Digital · Procesamiento de Lenguaje Natural
Resumen
La identificación temprana de los trastornos del espectro autista (TEA) representa un desafío importante, especialmente en regiones donde el acceso a especialistas y herramientas de evaluación puede ser limitado.
El artículo Opinion Mining-Driven Classification Model for Early Autism Spectrum Disorders Identification Based on Standardized Assessments presenta un modelo denominado ASDOM-ML, diseñado para apoyar la identificación temprana de posibles indicadores asociados al TEA mediante técnicas de procesamiento de lenguaje natural (NLP), minería de opiniones y aprendizaje automático.
La propuesta analiza información obtenida a partir de observaciones realizadas por padres o cuidadores y la combina con evaluaciones estandarizadas. Los investigadores consolidaron 153 registros de niños de entre 2 y 6 años procedentes de dos centros especializados, ubicados en México y Chile.
El sistema transforma las narraciones de los cuidadores en características numéricas mediante TF-IDF, posteriormente organiza la información utilizando K-means y finalmente emplea diferentes clasificadores de aprendizaje automático.
Entre los modelos evaluados, SVM obtuvo el mejor desempeño general, alcanzando para una de las categorías una precisión de 91,34 %, precision de 90,02 %, recall de 89,02 % y F-measure de 91,12 %.
Palabras clave: Inteligencia artificial, autismo, machine learning, NLP, minería de opiniones, TF-IDF, K-means, SVM, diagnóstico asistido.
1. Introducción
El trastorno del espectro autista comprende un conjunto de condiciones relacionadas con diferencias en la comunicación, interacción social y determinados patrones de comportamiento.
La identificación temprana puede facilitar la intervención y el acceso a servicios de apoyo. Sin embargo, los métodos tradicionales pueden requerir profesionales especializados y una cantidad considerable de tiempo.
Ante esta situación, las técnicas de inteligencia artificial pueden convertirse en herramientas complementarias para analizar grandes cantidades de información y detectar patrones que podrían ser difíciles de identificar manualmente.
El estudio analizado propone utilizar minería de opiniones y procesamiento de lenguaje natural para transformar las observaciones realizadas por padres o cuidadores en información que pueda ser procesada mediante algoritmos de aprendizaje automático.
2. ¿Cómo funciona el sistema ASDOM-ML?
El modelo propuesto se denomina ASDOM-ML y está compuesto por diferentes etapas.
De forma simplificada:
Observaciones de padres/cuidadores
↓
Procesamiento del lenguaje
↓
TF-IDF
↓
Organización mediante K-means
↓
Clasificación mediante Machine Learning
↓
Resultado
El objetivo es transformar información textual no estructurada en características que puedan ser utilizadas por algoritmos de clasificación.
3. Datos utilizados
Uno de los aspectos interesantes del estudio es que los investigadores consolidaron información procedente de dos centros especializados.
| Centro | Ubicación | Registros | Edad | Evaluación |
|---|---|---|---|---|
| Centro 1 | Orizaba, Veracruz, México | 82 | 2–6 años | ADI-R / ADOS-2 |
| Centro 2 | Valdivia, Chile | 71 | 2–6 años | M-CHAT-R/F / CARS |
| Total | México + Chile | 153 | 2–6 años | — |
Los registros incluyen información demográfica, narraciones de los padres y resultados de evaluaciones estandarizadas.
4. Procesamiento del lenguaje natural
Una de las partes fundamentales del modelo es transformar las respuestas textuales de los padres en información que pueda ser procesada por una computadora.
Por ejemplo, una pregunta puede ser:
¿El niño mantiene contacto visual cuando se le habla o se le llama por su nombre?
La respuesta puede contener información como:
No siempre. A veces no responde cuando lo llamo…
El sistema procesa este texto mediante diferentes etapas:
Tokenización
Divide el texto en unidades o palabras.
Filtrado
Elimina elementos que aportan poca información al análisis.
TF-IDF
Calcula qué tan relevante es una palabra dentro de un documento en relación con todo el conjunto de textos.
El resultado es una representación numérica del contenido textual.
5. ¿Qué es TF-IDF?
TF-IDF (Term Frequency–Inverse Document Frequency) es una técnica ampliamente utilizada en procesamiento de lenguaje natural.
Su función principal es determinar qué términos son especialmente relevantes dentro de un conjunto de documentos.
De forma sencilla:
TF → frecuencia de una palabra en un documento
IDF → qué tan poco frecuente es esa palabra en el conjunto de documentos
Al combinar ambas medidas se obtiene una representación numérica que permite a los algoritmos de machine learning trabajar con información textual.
En este estudio, TF-IDF permite convertir las observaciones de los cuidadores en vectores que posteriormente son utilizados por las etapas de agrupamiento y clasificación.
6. K-means y los dominios del autismo
Después de obtener los vectores TF-IDF, el modelo utiliza K-means para organizar los términos en grupos.
En este estudio se establecen tres grupos, relacionados con los principales dominios considerados en la evaluación del TEA:
- Comunicación lingüística.
- Interacción social recíproca.
- Comportamientos restringidos o repetitivos.
K-means busca agrupar elementos similares alrededor de determinados centroides.
De esta manera, las narraciones textuales pueden organizarse en categorías que tienen una interpretación relacionada con los dominios clínicos utilizados por los instrumentos de evaluación.
7. Clasificación mediante Machine Learning
Una vez procesada la información, el modelo utiliza diferentes algoritmos de aprendizaje automático.
Los investigadores evaluaron:
- Naive Bayes (NB).
- Support Vector Machine (SVM).
- K-Nearest Neighbors (KNN).
- Random Forest (RF).
- Logistic Regression (LR).
El objetivo es determinar qué algoritmo puede clasificar mejor los datos obtenidos a partir del procesamiento de las observaciones.
8. Resultados
Los resultados muestran diferencias importantes entre los clasificadores.
El SVM presentó uno de los mejores desempeños generales.
Para la categoría 2, el modelo obtuvo:
| Métrica | Resultado |
|---|---|
| Accuracy | 91,34 % |
| Precision | 90,02 % |
| Recall | 89,02 % |
| F-measure | 91,12 % |
| MCC | 91,22 % |
| AUC-ROC | 92,15 % |
Estos resultados fueron superiores a los obtenidos por los demás clasificadores en varias de las métricas analizadas.
Sin embargo, es importante aclarar que estos resultados no significan que el sistema pueda diagnosticar autismo por sí solo. Se trata de un modelo de apoyo a la identificación temprana basado en información recopilada y comparada con evaluaciones estandarizadas.
9. ¿Por qué es importante?
La propuesta resulta interesante porque utiliza una fuente de información que puede ser muy valiosa: las observaciones realizadas por los propios cuidadores.
En lugar de analizar únicamente imágenes médicas o señales fisiológicas, el modelo analiza descripciones lingüísticas relacionadas con el comportamiento de los niños.
Esto abre la posibilidad de utilizar herramientas de inteligencia artificial para procesar información que normalmente se encuentra en formato textual y que puede resultar difícil de analizar a gran escala.
Además, el trabajo combina:
Lenguaje natural + Machine Learning + Evaluaciones clínicas
creando un enfoque híbrido para apoyar la identificación temprana.
10. Aplicación práctica
El modelo podría utilizarse como una herramienta de apoyo en centros especializados.
Por ejemplo:
Padre o cuidador
↓
Responde preguntas sobre el comportamiento del niño
↓
Sistema NLP
Analiza el texto
↓
TF-IDF
Convierte las respuestas en características numéricas
↓
K-means
Organiza las características
↓
SVM / Machine Learning
Clasifica los patrones
↓
Resultado para el especialista
El resultado podría ayudar al profesional a determinar si es necesario realizar una evaluación más profunda.
11. Limitaciones
Los autores señalan diferentes aspectos que deben mejorarse antes de una implementación más amplia.
Uno de ellos es la necesidad de ampliar y diversificar los conjuntos de datos.
También sería importante incorporar información adicional, como:
- Expresiones faciales.
- Comportamiento visual.
- Seguimiento ocular.
- Datos de diferentes regiones.
- Mayor número de participantes.
- Diferentes contextos culturales.
Además, debido a que se trabaja con información relacionada con niños, existen importantes cuestiones de privacidad, ética y protección de datos sensibles.
12. Inteligencia artificial como herramienta de apoyo
Una de las ideas más importantes del artículo es que la inteligencia artificial no necesariamente debe sustituir al especialista.
En este contexto puede utilizarse como una herramienta para:
- Procesar grandes cantidades de información.
- Encontrar patrones.
- Organizar observaciones.
- Apoyar la clasificación.
- Facilitar la identificación de casos que requieren mayor evaluación.
Por tanto, el sistema debe entenderse como una herramienta de apoyo a la evaluación, no como un sustituto de una evaluación clínica profesional.
13. Aplicaciones futuras
El enfoque podría evolucionar hacia sistemas capaces de combinar diferentes tipos de información.
Por ejemplo:
Texto
Audio
Expresiones faciales
Seguimiento ocular
Machine Learning
↓
Sistema multimodal de apoyo a la evaluación
Los autores también recomiendan desarrollar interfaces gráficas fáciles de utilizar y continuar ampliando los conjuntos de datos para mejorar la capacidad del modelo en diferentes contextos clínicos.
14. Conclusiones
El artículo demuestra cómo las técnicas de procesamiento de lenguaje natural y aprendizaje automático pueden utilizarse para analizar observaciones de padres y cuidadores como parte de un sistema de apoyo para la identificación temprana de indicadores relacionados con el TEA.
El modelo ASDOM-ML integra procesamiento de texto mediante TF-IDF, agrupamiento K-means y diferentes algoritmos de clasificación.
Entre los modelos evaluados, SVM alcanzó resultados particularmente favorables, con una precisión de hasta 91,34 % y un AUC-ROC de 92,15 % para una de las categorías.
La investigación representa un ejemplo de cómo la inteligencia artificial puede utilizar información lingüística y conductual para apoyar procesos relacionados con la salud.
Sin embargo, debido a la naturaleza sensible de los datos y a las limitaciones del conjunto de datos utilizado, estos sistemas deben considerarse herramientas complementarias, sujetas a validación clínica y supervisión profesional.
Referencia original
Grande-Ramírez, J. R., Roldán-Reyes, E., Cortés-Robles, G., Delgado-Maciel, J., Morales-Saucedo, M., & Díaz-Martínez, M. A. (2026). Opinion Mining-Driven Classification Model for Early Autism Spectrum Disorders Identification Based on Standardized Assessments. Technologies, 14(1), 36.
DOI: 10.3390/technologies14010036
