Por qué la lista de «reincidentes» habla más de los señuelos que de las personas

Una hilera de listones de salto de altura sobre una pista de atletismo, cada uno colocado a una altura distinta del anterior, todos alineados hacia un único marcador de resultados en blanco

Por qué la lista de «reincidentes» habla más de los señuelos que de las personas

Por qué la lista de «reincidentes» habla más de los señuelos que de las personas

Dos correos simulados salieron de la misma organización, hacia la misma población de empleados, dentro del mismo programa de ocho meses. Uno avisaba que la contraseña de Outlook estaba por vencer. Falló el 1,82% de quienes lo recibieron. El otro anunciaba un cambio en la política de vacaciones. Falló el 30,80%.

Las mismas personas. Un correo resultó casi diecisiete veces más engañoso que el otro.

El dato viene de un experimento controlado de 2025 sobre 19.789 empleados de una organización sanitaria de gran tamaño, que recibieron diez señuelos distintos a lo largo de ocho meses. Y tiene una consecuencia incómoda para cualquier tablero que ordene personas por cantidad de caídas.

Si el resultado depende tanto del correo, entonces una parte del puntaje de cada persona no es de esa persona.

¿Qué mide en realidad una lista de reincidentes?

Mide dos cosas sumadas: lo que hizo alguien y qué tan difícil era lo que le tocó. El tablero las entrega juntas y no trae forma de separarlas.

La tabla de ese estudio ordena los diez señuelos por tasa de fallo y el recorrido completo va de 1,82% a 30,80%. La variación no se explica por el tema. Dos correos de la misma familia, los dos sobre cambios en beneficios, dieron 7,62% y 30,80%.

Los autores sacan de ahí una advertencia metodológica que vale citar tal como la escribieron, porque no es una lectura mía del dato. Señalan que hacen falta una comparación aleatorizada y un análisis estadístico cuidadoso para evaluar si el cambio en el resultado de una persona se debe al entrenamiento que recibió o a otros factores de confusión, como haber recibido después mensajes más débiles, que resultan más fáciles de identificar.

Traducido a la operación de un programa: cuando alguien “mejora” entre dos campañas, el dato disponible no dice si mejoró la persona o si bajó la dificultad. Y cuando empeora, tampoco.

Cómo se construye un puntaje que aguante esa objeción es un problema de ingeniería de datos, y está tratado en qué necesita un puntaje de riesgo humano fiable. Acá me interesa lo que pasa después, cuando ese número se convierte en un nombre dentro de una lista.

¿Por qué caer dos veces dice menos de lo que parece?

Porque la etiqueta de reincidente depende de cuántas oportunidades hubo de ganarla.

En el mismo estudio, al cabo del primer mes había fallado al menos una vez el 9,7% de la población. Al octavo, el 56%, que son 11.077 personas de 19.789. El 25,9% falló al menos dos simulaciones, el 9,8% al menos tres y el 3,5% al menos cuatro. Una persona falló todas.

La conclusión que sacan los autores es que quien evitó los primeros correos no necesariamente evitará los siguientes. Con tiempo y esfuerzo suficientes, dicen, un atacante lograría engañar a una fracción grande de los empleados de una organización.

Hay un segundo dato que muestra lo mismo desde otro ángulo. Un estudio de quince meses en una empresa, con 14.733 participantes y ocho simulaciones por persona, encontró que 1.448 personas cayeron dos veces o más. Ese número es el 30,62% de quienes habían caído al menos una vez, no del total. La distinción importa, porque las dos formas de contarlo circulan como si fueran la misma y producen titulares muy distintos.

Ahí está el problema del corte. Lo que la lista separa son quienes acumularon exposición desafortunada primero, y eso se parece poco a un grupo estable de personas propensas.

¿Qué sesgo hace que el tablero se lea como un rasgo de la persona?

El sesgo de correspondencia: la tendencia a inferir una disposición estable de alguien a partir de una conducta que la situación explica igual de bien.

Es uno de los hallazgos más sólidos de la psicología social y se demostró por primera vez en 1967, con un diseño que se parece bastante a lo que hace un tablero. A un grupo de personas se le dio a leer un ensayo a favor o en contra del régimen cubano y se le pidió estimar qué pensaba de verdad quien lo había escrito. Aunque se les dijera que la posición del ensayo había sido asignada, y que quien escribía no había elegido nada, igual le atribuían esa opinión.

La replicación a gran escala de 2018 repitió el diseño con otro tema de debate y volvió a obtener el efecto sobre 7.197 participantes, con un tamaño de 1,82 en la escala de Cohen, donde 0,8 ya se considera grande. Saber que la situación obligaba no evitó que se leyera la conducta como carácter.

El problema de un tablero de reincidentes está en cómo se interpreta. Un registro de conductas se lee como un registro de personas, y esa lectura ocurre igual aunque quien mira sepa que el señuelo era difícil.

¿Qué le pasa al programa cuando la etiqueta se vuelve intervención?

El estudio de los quince meses midió exactamente eso y el resultado fue el contrario del esperado. Los participantes que recibieron la página de entrenamiento inmediatamente después de caer terminaron con tasas de clic y de acción peligrosa más altas que las de quienes no la recibieron.

El experimento de 2025 midió lo mismo con otro diseño y encontró un efecto en la dirección correcta, aunque muy chico. La diferencia absoluta entre el grupo de control y los grupos entrenados fue de 1,7 puntos porcentuales sobre todos los correos. Ese mismo trabajo tampoco encontró relación entre haber completado hace poco la formación anual obligatoria y fallar menos.

Los dos resultados dejan en pie la posibilidad de enseñar y acotan dónde. El circuito habitual, marcar a quien cayó y mostrarle una página en ese momento, es la parte del programa con menos evidencia a favor, y en un caso con evidencia en contra.

Sobre lo que la etiqueta produce en quien la recibe hay un límite que conviene declarar. Lo medido es el efecto sobre la conducta posterior. El mecanismo interno que lo explica queda fuera del alcance de los dos estudios. Si el efecto viene de la vergüenza, del apuro por cerrar la ventana o de haber aprendido que la consecuencia de caer es un trámite de dos minutos, la evidencia disponible no lo resuelve.

Lo que sí está claro es la asimetría de costos. Una etiqueta mal puesta sobre quien recibió señuelos difíciles cuesta más que el número que corrige, porque el canal que el programa más necesita es el voluntario. En el hábito de reportar sin respuesta está desarrollado qué pasa con ese canal cuando la organización no devuelve nada.

¿Qué se puede hacer con esa lista sin convertirla en una etiqueta?

La lista sirve, con tres condiciones que se pueden verificar antes de usarla.

  1. Registrar la dificultad del señuelo junto al resultado. Sin ese dato, el número de una persona no es comparable ni con el de ella misma en otra campaña. Es el requisito que habilita todo lo demás, y hoy suele faltar.
  2. Comparar a cada persona contra su propio historial, bajo señuelos equivalentes. Un ranking entre compañeros mezcla las dos variables y devuelve un orden que depende de qué le tocó a cada uno. La serie propia de alguien, medida con dificultad comparable, es una señal mucho más limpia.
  3. Que la consecuencia de aparecer sea contenido asignado y no una marca. La diferencia operativa está en quién lo ve y para qué. Un plan que cambia porque a esa persona le falta un tema es distinto de una condición que la acompaña de campaña en campaña.

El tablero de SMARTFENSE es un buen sitio para aplicar el argumento, porque tiene las dos piezas. El hub de reportes incluye una ficha 360° por usuario que integra el riesgo, la resiliencia, las simulaciones, la formación y la actividad proactiva, y también una lista priorizada de usuarios para intervenir. Esa lista es exactamente el objeto del que habla esta pieza, y la tercera condición es la que decide si esa lista ayuda o estorba.

La salida está en cómo se resuelve la intervención. Smart Path evalúa a cada persona una vez por día y le asigna contenido sin repetir lo que ya hizo, dentro de un presupuesto mensual de minutos. El criterio es lo que a cada quien le falta del plan. Decide persona por persona y no por grupo, que es la forma de personalizar que no necesita etiquetar a nadie.

Queda una pregunta abierta, y es de diseño de producto más que de psicología. La dificultad del señuelo se mide y se publica. El estudio de 2025 la trae campaña por campaña, y cualquier programa que repita un señuelo la tiene a mano. Lo que hay que revisar es si ese dato viaja pegado al registro de cada persona, que es lo que haría comparables dos resultados. Vale la pena preguntárselo a cualquier tablero, incluido el nuestro.

Sobre qué indicadores mirar en lugar de la tasa de clic ya escribió Nicolás en ¿tu programa de awareness está midiendo lo que importa?, y la variable que ninguno de esos indicadores captura la trabajé en la variable que predice la conducta segura. Esta pieza se ocupa del paso anterior a los dos. Antes de preguntar qué indicador mirar, conviene saber de quién habla el que ya tenemos.

Un tablero que ordena personas por cantidad de caídas está describiendo, sin decirlo, el catálogo de correos que eligió mandar.

Tatiana Stacul

Psicóloga cognitivo-conductual enfocada en comportamiento humano en entornos digitales: estudia cómo la atención, la carga cognitiva y la respuesta emocional al riesgo condicionan la toma de decisiones frente a la pantalla. Colabora con SMARTFENSE en el diseño de contenidos de concienciación en ciberseguridad y divulga sobre ciberpsicología y bienestar digital en Código Calma. Forma parte de Women4Cyber Sweden y Cibervoluntarios.

Deja un comentario