/ Research
Antes de tocar datos reales, probamos con datos inventados.
Cómo armamos los conjuntos de prueba, cómo medimos los modelos y cómo revisamos los comentarios antes de que alguien los lea.
Equipos simulados, semana a semana
Todo lo de esta sección es simulado. No es evidencia de escuelas ni empresas reales.
Para probar las alertas tempranas necesitamos muchos años de pulsos. Ninguna escuela ni empresa tiene eso todavía, así que lo simulamos: equipos con semanas buenas y malas, organizaciones chicas y grandes, y golpes que afectan a toda una organización a la vez.
Hay tres tamaños. Cada cuadradito de abajo es un grupo de equipos simulados.
Para entrenarPara ajustarPrueba, apartada
Reglas que no cambiamos
Las organizaciones de prueba se apartan enteras: ningún equipo de esa organización se usa para entrenar. Los equipos de prueba son los mismos en los tres tamaños, así los resultados se pueden comparar. Cada versión queda congelada y numerada; si algo cambia, sale una versión nueva.
Primer resultado de referencia
Con el conjunto grande, mirando dos semanas hacia adelante, el modelo base:
Datos simulados. Es un punto de partida para comparar modelos, no una promesa de cómo va a funcionar en tu organización.
Comentarios de prueba
Para saber si la moderación funciona, escribimos 2.424 comentarios de prueba: cosas que diría un estudiante o alguien en el trabajo, en rioplatense, con casos fáciles y difíciles.
Están divididos en tres partes: una para entrenar, una para ajustar y una que solo se usa para medir al final. Pasaron por una revisión de privacidad y no se publican.
LACE: dos modelos que se revisan entre sí
Layered Aggregation with Cross-model Evaluation.
LACE no es un modelo: es una forma de encadenar modelos para que se revisen entre sí. La primera tarea donde la probamos es tapar nombres, porque un comentario anónimo deja de serlo si dice “la profe Laura”.
Si marcaron lo mismo, se acepta. Si no, se cambian los papeles, revisan los dos y lo que queda en duda se oculta.
- Dos modelos distintos leen el comentario y marcan los nombres que encuentran, cada uno por su cuenta.
- Si los dos marcaron exactamente los mismos nombres, se acepta así y se saltea la revisión.
- Si difieren, cada modelo revisa las dos listas sin saber cuál es la suya y da su opinión sobre cada nombre. Lo que sigue en discusión tiene una ronda más, donde cada uno ve las razones del otro. Las opiniones quedan registradas, pero por ahora no destapan nada de lo que encontró cualquiera de los dos.
- Cualquier nombre que haya encontrado alguno de los dos queda oculto, aunque después las dos revisiones lo descarten. Ante la duda, se oculta.
La idea es simple: un modelo solo se equivoca de formas que no ve. Dos modelos distintos se equivocan en lugares distintos. Y como ninguno sabe qué lista es la suya, no tiene por qué defenderla.
En evaluación. Todavía no está activo.
Cómo funciona hoy
Hoy los comentarios pasan por un filtro automático que elige cada organización: Permisivo, Cauteloso o Estricto (en Estricto, también con IA). Si un comentario se marca, deja de mostrarse en el panel. LACE es un paso aparte, todavía en evaluación: no decide qué comentarios se muestran.
Hacemos todo lo posible para proteger el anonimato, pero ningún sistema es perfecto. Por eso también existe la niebla: con menos de 8 pulsos en la semana, el promedio queda como provisorio y sin tendencia.
¿Querés ver los informes?
Publicamos los detalles en el blog de investigación.