
La demostración es impecable. Tres mil currículums entran al sistema y en minutos salen ordenados de mayor a menor ajuste al puesto. El vendedor muestra la pantalla, da una cifra de ahorro en horas de reclutamiento y pregunta cuándo quieres arrancar el piloto.
Casi nadie hace, en ese momento, la única pregunta que importa: ¿con base en qué?
No es una objeción de principio. Es una pregunta con tres formas precisas, y cada una corresponde a algo que un proveedor debería poder demostrar con documentos, no con una demo.
Toda herramienta que ordena candidatos por su supuesto ajuste o potencial hace la misma promesa: que quienes obtienen mejor puntaje van a desempeñarse mejor en el trabajo. Esa promesa tiene un nombre técnico —validez de criterio— y una forma de comprobarse establecida desde hace décadas.
La pregunta útil no es si el modelo predice. Es el desempeño de qué. La evidencia disponible sobre entrevistas puntuadas por aprendizaje automático valida estos modelos principalmente contra calificaciones de desempeño en la entrevista, no contra desempeño laboral posterior (Koutsoumpis et al., 2024). Predecir cómo va a calificar un evaluador humano es un logro técnico real, y es una afirmación mucho más modesta que predecir cómo va a trabajar alguien.
Aquí está el hallazgo que más cambia una conversación de compra, y es metodológico.
Un estudio independiente analizó millones de solicitudes evaluadas por los modelos de un mismo proveedor, en más de un centenar de empleadores y once sectores, en condiciones reales (Bommasani et al., 2026). Los autores reportan que si se agrupan todas las recomendaciones como si fueran un solo proceso de contratación, no aparece impacto adverso. Si se examina cada posición por separado, aparece en muchas posiciones.
La razón es aritmética. Si un sistema recomienda mucho a un grupo para cierto tipo de vacante y poco para otro, el promedio de todas las vacantes cancela ambos patrones y el resultado agregado parece limpio.
Eso convierte una pregunta abstracta en una muy concreta. Cuando tu proveedor te entregue una auditoría de sesgo, el dato decisivo no es que la haya hecho: es a qué nivel agregó los datos. Sobre cómo se detecta esto en un proceso propio, con o sin algoritmos, está impacto adverso en selección de personal.
Conviene distinguir dos cosas que un proveedor puede llamar, con la misma palabra, explicabilidad. Un modelo interpretable permite entender por qué produjo cierto resultado observando su funcionamiento. En un modelo opaco, las explicaciones se generan después del entrenamiento y aproximan su comportamiento, con una fidelidad que a su vez hay que evaluar (Rudin, 2019).
La diferencia importa poco en un recomendador de películas. Importa mucho cuando hay que sostener, frente a una persona concreta, por qué no avanzó.
Que México no tenga una ley dedicada exclusivamente a la inteligencia artificial no significa que la inteligencia artificial no esté regulada en el reclutamiento. Significa que la regulan las leyes de siempre —datos personales, no discriminación y materia laboral— y ninguna de ellas exime a nadie por haber delegado la decisión en una máquina.
El whitepaper desarrolla ese marco con precisión, incluida la razón por la que la evidencia técnica de validez se vuelve una pieza jurídica: es central para sostener que un criterio de selección es razonable, proporcional y objetivo.
En el whitepaper hay trece preguntas para llevarle a un proveedor. Cada una admite respuesta documental; si la respuesta es verbal, la pregunta sigue abierta. Estas tres dan el tono:
El tiempo que tarde un proveedor en contestarlas, y lo que ese silencio diga, es información tan útil como las respuestas mismas.
IA en reclutamiento sin base científica: tres riesgos legales y operativos desarrolla lo anterior con las seis familias tecnológicas que hoy se venden bajo la misma etiqueta y qué evidencia mínima le corresponde a cada una, el marco normativo mexicano aplicable, la evidencia revisada por pares sobre cada riesgo, y las trece preguntas en formato listo para enviar.
👉 [Descargar el whitepaper]( ⚠ URL DE LA LANDING WP08 — PENDIENTE )
Este documento no argumenta contra el uso de inteligencia artificial en reclutamiento. Argumenta contra su uso sin evidencia, que es una cosa distinta. Evaluar con ciencia no significa evaluar sin tecnología: significa que la tecnología también tiene que poder demostrar lo que afirma.
Si todavía no tienes claro con qué tipo de herramienta estás tratando, «IA para reclutamiento» no es una sola cosa separa las seis familias.
¿Qué debe demostrar un proveedor de inteligencia artificial para reclutamiento? Tres cosas, con documentos: que su sistema predice lo que dice predecir, medido contra un criterio de desempeño laboral nombrado; que no produce desventaja sistemática contra grupos protegidos; y que puede explicar cómo decidió y decir quién responde por la decisión.
¿Está regulada la inteligencia artificial en el reclutamiento en México? México no tiene una ley dedicada exclusivamente a la inteligencia artificial, pero su uso en reclutamiento sí está alcanzado por las leyes vigentes en materia de datos personales, de no discriminación y laboral. Ninguna exime a nadie por haber delegado la decisión en un sistema automatizado.
¿Una auditoría de sesgo garantiza que el sistema no discrimina? No. Un análisis que agrega vacantes distintas puede ocultar disparidades que aparecen al analizarlas por separado. Un estudio a gran escala reportó que agrupando todas las recomendaciones de un proveedor no aparecía impacto adverso, mientras que al examinar cada posición sí aparecía en muchas de ellas (Bommasani et al., 2026).
¿Existe evidencia de que las entrevistas puntuadas por IA predicen el desempeño laboral? La evidencia disponible valida estos modelos principalmente contra calificaciones de desempeño en la entrevista, no contra desempeño laboral posterior (Koutsoumpis et al., 2024). Por eso conviene preguntar siempre contra qué criterio concreto se validó el modelo.
Referencias
Bommasani, R., Bana, S. H., Creel, K. A., Jurafsky, D., y Liang, P. (2026). Algorithmic monocultures in hiring. En Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (pp. 6351–6382). Association for Computing Machinery. https://doi.org/10.1145/3805689.3812400
Koutsoumpis, A., Ghassemi, S., Oostrom, J. K., Holtrop, D., van Breda, W., Zhang, T., y de Vries, R. E. (2024). Beyond traditional interviews: Psychometric analysis of asynchronous video interviews for personality and interview performance evaluation using machine learning. Computers in Human Behavior, 154, 108128. https://doi.org/10.1016/j.chb.2023.108128
Rudin, C. (2019). Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nature Machine Intelligence, 1(5), 206–215. https://doi.org/10.1038/s42256-019-0048-x
Este documento no sustituye la asesoría de un profesional, ya que es meramente informativo y el lector es el único responsable del uso y aplicación que se le otorgue a dicha información, así como de su interpretación.