Nuevo·Consulta los últimos rankings de tareas en agua
Water Benchmarks

Benchmarks reales, resultados reales

Estudios definidos por pares sobre cómo rinde la IA en casos de uso reales del tratamiento de agua. Toda la investigación es de acceso abierto — sin muros de pago ni informes restringidos.

Informe destacado · v1.0

Diagnóstico operativo RO

Comité Técnico de Water Benchmarks · mayo de 2026

Evaluamos 26 ejecuciones de modelos en 31 casos reales de planta RO en 5 familias de fallo, puntuados de 0 a 12 frente a respuestas gold privadas de expertos con una puerta de seguridad crítica.

En este informe

  1. 1.Resumen
  2. 2.El benchmark
  3. 3.Metodología y rúbrica
  4. 4.Resultados
  5. 5.La trampa del máximo
  6. 6.Calibración
  7. 7.Lecciones para el sector del agua
  8. 8.Limitaciones

Hallazgos principales

La trampa del máximo

El esfuerzo de razonamiento compra riesgo, no seguridad — el mismo modelo provoca un fallo crítico solo en sus niveles de esfuerzo más altos.

La trampa del precio por esfuerzo

El razonamiento al máximo iguala la misma competencia que con razonamiento desactivado, a varias veces el coste y la latencia.

Fragilidad de NOWE

Una familia de fallo se desploma a una tasa de aprobación del 38 % y concentra la mayoría de los fallos críticos.

La calibración es ortogonal

Los modelos mejor calibrados no son los mejor clasificados. Una puntuación alta no implica confianza fiable.

Todos los casos, la rúbrica y los scripts son públicos para reproducibilidad.