La referencia independiente para evaluar IA en el sector del agua
Diseñado y validado por profesionales que operan, diseñan y construyen plantas de tratamiento de agua.
El sector del agua lleva décadas evaluando personas, procesos y equipos con criterios técnicos claros. Sin embargo, todavía no existe un marco equivalente para evaluar herramientas de inteligencia artificial.
Y es necesario: si la IA va a apoyar decisiones operativas, técnicas o de seguridad, hay que saber qué modelos funcionan de verdad en tareas reales del sector.
Water Benchmarks nace para cubrir ese vacío: un marco independiente de evaluación, basado en casos de uso reales del agua y construido junto con profesionales del sector.
Independiente
Sin patrocinio de proveedores ni influencia comercial.
Definido por profesionales del sector
Moldeado por profesionales senior del tratamiento de agua en distintos roles.
Código abierto
Disponible públicamente e impulsado por la comunidad.
El problema
La adopción de IA en el tratamiento de agua necesita pruebas independientes
La inteligencia artificial está llegando rápidamente a la desalación, la potabilización, la depuración y el agua industrial. Pero la mayoría de equipos todavía no tiene una forma clara, técnica y defendible de comparar herramientas.
Los benchmarks genéricos no miden el campo
MMLU, suites de programación y matemáticas de competición no evalúan si un modelo razona sobre una situación real de planta — con consecuencias físicas cuando se equivoca.
Las compras se deciden en demos
Muchas decisiones dependen aún de presentaciones comerciales, claims de marketing y evaluaciones autoinformadas — no de puntuación independiente frente a criterios redactados por expertos.
El coste del error es real
Una mala recomendación puede dañar membranas, provocar una parada innecesaria, retrasar una actuación crítica o erosionar la confianza en una tecnología que podría aportar mucho valor.
Por eso, la evaluación de IA en agua no debe medir solo si una respuesta suena bien. Debe medir si es correcta, útil y segura para una tarea real del sector.
El resultado es claro: cada operadora y cada proveedor termina evaluando la IA por su cuenta, con criterios distintos y resultados difíciles de comparar.
Esto genera esfuerzo duplicado, comparaciones inconsistentes y una adopción guiada más por el discurso comercial que por evidencia independiente.
La solución
Benchmarks independientes de IA para el sector del agua
Water Benchmarks permite comparar modelos de IA con criterios técnicos, públicos y reproducibles, usando tareas reales del sector del agua.
Cada benchmark combina casos de planta revisados por expertos, una rúbrica transparente y resultados abiertos para que utilities, ingenierías y proveedores puedan evaluar la IA con la misma referencia.
La primera evaluación publicada se centra en desalación por ósmosis inversa. A partir de ahí, la plataforma crecerá hacia otros ámbitos del ciclo del agua.
Casos reales de planta evaluados
Familias de fallo en ósmosis inversa
- FOUL
- SCAL
- OXID
- MECH
- NOWE
Dimensiones de puntuación
- Competencia
- Seguridad
- Confianza
Cómo evaluamos
Tres dimensiones que importan en planta
Cada benchmark evalúa las respuestas en tres dimensiones separadas: competencia técnica, seguridad y calibración de la confianza.
Lo hacemos así porque una respuesta puede sonar técnicamente razonable, pero recomendar una acción insegura. O puede ser muy prudente, pero no aportar una decisión útil para el operador.
- 1
Competencia técnica
Evalúa si el diagnóstico estructurado es correcto.
Cada respuesta se puntúa frente a una respuesta de referencia elaborada por expertos, usando seis criterios: hipótesis principal, señales observadas, hipótesis alternativas, datos adicionales solicitados, acción recomendada y condición que cambiaría la decisión.
La puntuación va de 0 a 12.
- 2
Seguridad
Evalúa si la acción recomendada podría dañar la planta, generar un riesgo operativo o llevar a una decisión insegura.
Para ello, cada benchmark incluye un filtro de seguridad definido por expertos. Si un modelo recomienda una acción crítica insegura, queda descalificado en seguridad, independientemente de su puntuación técnica.
- 3
Calibración de la confianza
Evalúa si el modelo sabe reconocer cuándo está seguro y cuándo debería ser prudente.
Esta dimensión se informa por separado mediante métricas de calibración, como Brier y ECE. No se integra en el ranking principal, para evitar que un modelo parezca mejor simplemente por responder siempre con baja confianza.
Marco de adopción
Criterios para adoptar IA en el sector del agua
Además de medir el rendimiento de los modelos en tareas reales, cualquier organización que quiera adoptar una herramienta de IA debería evaluar ocho dimensiones clave:
- 1
Encaje con el caso de uso
Si la herramienta resuelve tareas reales del sector: operación, mantenimiento, ingeniería, licitaciones, laboratorio, cumplimiento o soporte técnico.
- 2
Integración operativa
Si puede encajar con los sistemas existentes, los flujos de trabajo del equipo y la forma real en la que se toman decisiones en planta.
- 3
Calidad técnica
Si las respuestas son correctas, completas, verificables y consistentes en escenarios reales del agua.
- 4
Seguridad operativa
Si evita recomendaciones que puedan dañar activos, comprometer la calidad del agua, generar paradas inseguras o inducir decisiones críticas erróneas.
- 5
Privacidad y gobierno del dato
Cómo se usan, almacenan, aíslan y eliminan los datos; si existen garantías de no entrenamiento; y cómo se gestionan documentos, históricos y embeddings.
- 6
Riesgo del proveedor
Solidez del proveedor, transparencia, contratos, trazabilidad, continuidad de servicio, portabilidad de datos y respuesta ante incidentes.
- 7
Adopción por el equipo
Formación, facilidad de uso, soporte, documentación y capacidad de generar confianza entre perfiles técnicos y operativos.
- 8
Coste total
Precio, esfuerzo interno de implantación, mantenimiento, dependencia tecnológica y retorno esperado frente al valor generado.
Evaluaciones publicadas
Benchmarks que puedes usar hoy
Cada evaluación se publica con una versión definida, un alcance concreto y una metodología transparente.
Una vez publicada, la evaluación no se modifica: los casos, la rúbrica y los resultados quedan fijados para que cualquier comparación sea reproducible.
La versión 1.0 ya está disponible y se centra en desalación por ósmosis inversa. Ya estamos trabajando en nuevos benchmarks para otros ámbitos del sector del agua.
En vivo · v1.0
Diagnóstico operativo RO
31 casos reales de planta en cinco familias de fallo en desalación por ósmosis inversa — 26 ejecuciones de modelos puntuadas de 0 a 12 con una puerta de seguridad crítica.
En el roadmap
- Pretratamiento, postratamiento y el resto de la cadena de desalación
- Potabilización, aguas residuales, reutilización y agua industrial
- Conjuntos ampliados de casos y episodios operativos multi-turno
Por dónde empezar
Tres formas de usar Water Benchmarks
Si operas una planta de agua, la diseñas, la construyes, comparas proveedores o desarrollas herramientas de IA para el sector del agua, empieza por el punto que más encaje contigo.
Entender la evidencia
Lee el informe v1.0 para conocer la metodología, las decisiones de diseño, los principales resultados y las lecciones para el sector.
Investigación →
Comparar modelos
Explora el ranking de modelos en diagnóstico operativo de ósmosis inversa, incluyendo distintos niveles de razonamiento, resultados por dimensión y descalificaciones por seguridad.
Ranking →
Aplicarlo a tus casos
Consulta las guías, las descargas y el caso resuelto RO-FOUL-001 para entender cómo se construye y evalúa un benchmark completo.
Recursos →
Cronología
Un marco que evoluciona
Water Benchmarks no es un estudio puntual. Cada versión publicada queda fijada y archivada, con sus propios casos, rúbrica y resultados, para que siga siendo comparable aunque la serie crezca.
Diagnóstico operativo RO v1.0
Primera evaluación pública centrada en desalación por ósmosis inversa: 31 casos reales de planta, filtro de seguridad activo, informe metodológico y ranking publicados.
Ampliación v2.0
Evolución progresiva de la plataforma, incorporando nuevos casos de uso, como interpretación de planos técnicos, redacción de memorias técnicas, extracción de información clave de especificaciones técnicas y mucho más.
Nuevos ámbitos del agua
Nuevos benchmarks más allá del diagnóstico operativo en ósmosis inversa, manteniendo la misma metodología y adaptándola a nuevos ámbitos del sector del agua.
¿Quieres influir en lo que viene? Únete a la comunidad →
FAQ
Preguntas frecuentes
¿Qué es Water Benchmarks y para quién es?
Water Benchmarks es una plataforma independiente que publica benchmarks de IA de acceso abierto para el sector del agua. Es para operadores de planta, ingenieros de proceso, utilities, EPCs, proveedores e investigadores que necesitan evidencia — no demos — antes de adoptar o vender herramientas de IA.
¿Cuál es la diferencia entre el marco y un benchmark?
Water Benchmarks es la plataforma y la metodología compartida (competencia, seguridad, calibración, rúbrica pública, golds privados). Un benchmark es una evaluación concreta publicada — por ejemplo Diagnóstico operativo RO v1.0 — con sus propios casos, alcance y versión.
¿En qué se diferencia de una demo de un proveedor?
Las demos muestran lo que el proveedor quiere que veas. Nuestros benchmarks usan casos anonimizados que no se resuelven buscando en internet, puntúan respuestas frente a golds privados de expertos y aplican una puerta de seguridad que descalifica recomendaciones peligrosas — con independencia del proveedor.
¿Puedo adaptarlo a mi organización?
Sí. La rúbrica, los esquemas y la metodología son puntos de partida públicos. Los equipos deben adaptar pesos y alcance a su propio perfil de riesgo y contexto regulatorio.
¿Qué significa acceso abierto?
Casos, rúbrica, prompts, scripts y todas las respuestas puntuadas de modelos son públicos para reproducibilidad. Las respuestas gold permanecen privadas para que los proveedores no puedan entrenar contra el benchmark y erosionar la señal.
¿Water Benchmarks avala herramientas concretas?
No. Publicamos rankings e informes; no certificamos ni recomendamos proveedores salvo que opten explícitamente por un programa de pago aparte. El ranking público es neutral.
¿Cómo puedo participar?
Únete a la comunidad para recibir novedades, contribuye con casos reales de planta o solicita formar parte del comité técnico. Los proveedores pueden enviar modelos para evaluación en la página de envío.
Ayuda a definir el estándar de IA en el agua
Benchmarks definidos por el sector, para el sector — no por quienes venden las herramientas.
Únete a la comunidad