Benchmarks reales, resultados reales
Informe destacado · v1.0
Diagnóstico operativo RO
Comité Técnico de Water Benchmarks · mayo de 2026
Evaluamos 26 ejecuciones de modelos en 31 casos reales de planta RO en 5 familias de fallo, puntuados de 0 a 12 frente a respuestas gold privadas de expertos con una puerta de seguridad crítica.
En este informe
- 1.Resumen
- 2.El benchmark
- 3.Metodología y rúbrica
- 4.Resultados
- 5.La trampa del máximo
- 6.Calibración
- 7.Lecciones para el sector del agua
- 8.Limitaciones
Hallazgos principales
La trampa del máximo
El esfuerzo de razonamiento compra riesgo, no seguridad — el mismo modelo provoca un fallo crítico solo en sus niveles de esfuerzo más altos.
La trampa del precio por esfuerzo
El razonamiento al máximo iguala la misma competencia que con razonamiento desactivado, a varias veces el coste y la latencia.
Fragilidad de NOWE
Una familia de fallo se desploma a una tasa de aprobación del 38 % y concentra la mayoría de los fallos críticos.
La calibración es ortogonal
Los modelos mejor calibrados no son los mejor clasificados. Una puntuación alta no implica confianza fiable.
Todos los casos, la rúbrica y los scripts son públicos para reproducibilidad.