Ivan Smirnov, Investigador Principal del Laboratorio de Ciencias Sociales Computacionales del Instituto de Educación de la Universidad HSE, ha creado un modelo informático que puede distinguir a los que tienen un alto rendimiento académico de los que tienen un bajo rendimiento en función de sus publicaciones en los medios sociales.
El modelo de predicción utiliza un análisis textual matemático que registra el vocabulario de los usuarios (su alcance y los campos semánticos de los que se extraen los conceptos), los caracteres y símbolos, la longitud de los mensajes y la longitud de las palabras.
Cada palabra tiene su propia clasificación (una especie de coeficiente intelectual). Los temas científicos y culturales, las palabras inglesas y las palabras y posts de mayor longitud tienen una alta calificación y sirven como indicadores de un buen rendimiento académico. La abundancia de emojis, palabras o frases enteras escritas en mayúsculas, y el vocabulario relacionado con horóscopos, la conducción de vehículos y el servicio militar indican grados inferiores en la escuela. Al mismo tiempo, los mensajes pueden ser bastante cortos, de forma que incluso los tweets son bastante informativos. El estudio fue apoyado por una subvención de la Fundación Rusa para la Ciencia (RSF), y se publicó un artículo detallando los resultados del estudio en la revista EPJ Data Science.
El estudio de Smirnov utilizó una muestra representativa de datos de un trabajo previo de la Universidad HSE. El estudio traza las trayectorias profesionales de 4.400 estudiantes de 42 regiones rusas de escuelas secundarias que participan en el PISA (Programa de Evaluación de Estudiantes Internacionales). Los datos también incluyen datos sobre las cuentas VK (Vkontakte, la red social más popular en Rusia) de los estudiantes (3.483 de los estudiantes participantes consintieron en proporcionar esta información).
«Como este tipo de datos, en combinación con los rastros digitales, es difícil de obtener, casi nunca se utiliza», dice Smirnov. En cambio, este tipo de datos permite desarrollar un modelo fiable que puede ser aplicado a otros entornos. Y los resultados pueden ser extrapolados a todos los demás estudiantes, tanto de secundaria como de preparatoria.














