Metodología: cómo estimamos el agua, la energía y el carbono de la IA
Cada cifra de este sitio es una sola multiplicación, hecha de tres maneras: la energía que usa un prompt, por un factor de agua (o de carbono). Las tres maneras (Bajo, Medio, Alto) no son optimismo y pesimismo. Son límites contables: solo el agua de refrigeración, más el agua de las centrales eléctricas, o el ciclo de vida completo con el entrenamiento y la fabricación de chips. Cada coeficiente de abajo lleva su fuente.
Cómo se construye una estimación
Cuando le preguntas a la calculadora por un prompt, pasan cinco cosas, en este orden:
- Tu uso se convierte en tokens. Un intercambio típico de chat (tu prompt más la respuesta del modelo) promedia unos 700 tokens (supuesto del sitio, en línea con los benchmarks de respuestas de 400 tokens de Jegham et al. 2025 más un prompt típico). Si introduces el número de tokens directamente, usamos ese.
- Los tokens se convierten en energía. Cada modelo se asigna a una clase (eficiente, estándar, frontera o razonamiento) con una intensidad energética medida en benchmarks, en vatios-hora por 1.000 tokens (Jegham et al. 2025; cifras de los operadores donde existen, como los 0,24 Wh de Google por prompt mediano de Gemini).
- La energía se convierte en agua. Multiplicamos por litros por kilovatio-hora. Aquí es donde importa el selector de escenario: el factor va de 0,3 L/kWh (Bajo) a 30 L/kWh (Alto), y la siguiente sección explica por qué.
- La energía se convierte en carbono. La misma multiplicación con otro factor: gramos de CO₂e por kilovatio-hora, desde un operador con energía limpia (Bajo) hasta una red intensiva en fósiles (Alto), anclados en EPA eGRID.
- El resultado se convierte en algo que puedes imaginar. Los mililitros son abstractos; las botellas, las duchas y las tazas de café, no. Cada equivalente también tiene fuente.
Los tres escenarios, con honestidad
Pregunta «¿cuánta agua usa una consulta a un chatbot?» y puedes obtener respuestas desde un cuarto de mililitro hasta medio litro (un factor de mil, más o menos), todas de fuentes creíbles. Las cifras no coinciden porque las preguntas no coinciden: cada estudio traza su límite alrededor de una parte distinta del sistema. En vez de coronar un límite como el correcto, calculamos los tres y los etiquetamos. Piénsalo como preguntar cuánto cuesta una hamburguesa: el precio de la carta, el precio con impuestos y propina, o el precio incluyendo los subsidios agrícolas. La misma hamburguesa, tres respuestas defendibles.
Bajo: solo refrigeración
Qué cuenta: el agua que evaporan los propios sistemas de refrigeración del centro de datos, por unidad de cómputo. Nada más.
Este es el límite que usan los operadores, porque es la parte del sistema que poseen y miden. La cifra oficial de Google (0,26 mL por prompt mediano de Gemini) vive aquí, igual que los ~0,32 mL por consulta de ChatGPT de OpenAI (Altman, junio de 2025). Los operadores eficientes declaran un consumo de agua in situ de unos 0,3 litros por kilovatio-hora (la media de flota de Microsoft es 0,30). La propia cifra por prompt de Google implica unos 1,1 L/kWh y la de OpenAI unos 0,9, así que nuestro factor Bajo de 0,3 L/kWh se sitúa en el extremo eficiente del rango de los operadores, y los valores Bajos de la calculadora para Gemini y ChatGPT quedan por debajo de las cifras de esas mismas empresas.
Bajo es un número real, medido con honestidad. También es la respuesta a la pregunta más estrecha posible. Si has visto un titular que dice que la IA apenas usa agua, se construyó sobre este límite.
Medio: + electricidad
Qué cuenta: el agua de refrigeración, más el agua consumida al generar la electricidad con la que funciona el centro de datos.
Las centrales eléctricas tienen sed. Las termoeléctricas evaporan agua de refrigeración; los embalses hidroeléctricos pierden agua por evaporación. En la red media de EE. UU., generar un kilovatio-hora consume unos 4,5 litros de agua en algún punto aguas arriba (Siddik et al. 2021), varias veces lo que evapora el propio centro de datos. Suma la parte in situ y el escenario Medio da 5 L/kWh, o unos 2,8 mL para un intercambio típico de chat con un modelo de clase estándar.
Tratamos Medio como el límite más útil para decidir: cuenta todo lo que ocurre porque hiciste la consulta, mientras la hacías, sin remontarse a la construcción y la fabricación. Es la vista por defecto de la calculadora.
Alto: ciclo de vida completo
Qué cuenta: todo lo de Medio, más una parte por consulta del agua usada para entrenar el modelo y para fabricar el hardware en el que corre.
Entrenar un modelo de frontera consume agua durante meses antes de que llegue el primer usuario, y fabricar chips es de las manufacturas que más agua usan en el planeta. Los estudios de ciclo de vida reparten esos costos previos entre las consultas que el modelo acaba atendiendo. El análisis de ciclo de vida de Mistral, el primero de un desarrollador de modelos y con revisión externa, halló 45 mL de agua y 1,14 gCO₂e por respuesta de 400 tokens con este límite. Mistral no publicó ninguna cifra de energía; con los ~1,5 Wh que este sitio supone para una respuesta así, eso implica unos 30 L/kWh. Los muy citados ~519 mL por correo de 100 palabras (Washington Post con UC Riverside, 2024) suelen archivarse aquí, pero cuentan la refrigeración más la electricidad con una estimación de energía alta de 2024 para GPT-4, no el entrenamiento ni la fabricación.
Alto es el límite que buscas si tu pregunta es «¿cuánta agua cuesta la IA como sistema?» y no «¿cuánto añade mi consulta en el margen?».
Un matiz: extracción frente a consumo
En todo este sitio, «uso de agua» significa consumo (agua evaporada o que deja de estar disponible para la cuenca de la que salió), no extracción, que es agua que se toma prestada y se devuelve (como hace la refrigeración de paso único). Los estudios y los titulares mezclan ambas cosas sin cuidado, lo que explica algunas de las cifras más disparatadas en circulación. Cuando una fuente reporta extracción, lo decimos.
Cómo se combinan los escenarios con la energía
Un detalle para lectores atentos. Nuestros benchmarks de energía también vienen con un rango bajo/medio/alto, pero ese rango significa otra cosa: refleja la variación entre estudios y modelos, no un límite contable. Para no multiplicar dos tipos de incertidumbre en una sola cifra opaca, el agua y el carbono que mostramos se calculan con la intensidad energética media por el factor de agua o de carbono del escenario. El selector de escenario cambia qué se cuenta, no lo pesimistas que nos sintamos respecto a la literatura sobre energía.
Los coeficientes
Cada cifra que aparece en cualquier parte de este sitio se remonta a las tablas de abajo, que se generan directamente desde el mismo archivo que lee el motor de la calculadora, así que esta página no puede desviarse de las estimaciones. Cada fila lleva su fuente.
Coeficientes versión 1.3.1 · actualizado 2026-09
| Qué cuenta | Factor (L/kWh) | Fuente | |
|---|---|---|---|
| Bajo: solo refrigeración | solo refrigeración | 0,3 | Refrigeración in situ de un operador eficiente: Microsoft declara un WUE medio de flota de ~0,30 L/kWh (frente a ~0,49 en 2021). La flota de Google va más alta: su divulgación de Gemini (0,26 mL por 0,24 Wh) implica ~1,1 L/kWh, y los 0,32 mL a 0,34 Wh de Altman (2025) implican ~0,94 L/kWh, así que las cifras por prompt de ambos operadores quedan por encima de este factor. |
| Medio: + electricidad | refrigeración + generación eléctrica | 5 | ~0,5 L/kWh in situ + ~4,5 L/kWh de agua indirecta consumida al generar la electricidad de la red de EE. UU. (Siddik et al. 2021, Environ. Res. Lett.; intensidad hídrica de la red de EE. UU.). |
| Alto: ciclo de vida completo | ciclo de vida completo: + amortización del entrenamiento + fabricación del hardware | 30 | Derivación del sitio: el LCA de Mistral publica 45 mL de agua por respuesta de 400 tokens (con entrenamiento y hardware amortizados) pero ninguna cifra de energía; con los ~1,5 Wh que este sitio supone para una respuesta así (dentro de la banda estándar de Jegham et al.) salen ~30 L/kWh. |
Intensidad energética por clase de modelo
Watt-hora por 1.000 tokens combinados (o por imagen / clip de 5 segundos en modelos de medios). El rango bajo/medio/alto refleja la variación entre benchmarks, un eje distinto del selector de escenario. El agua y el carbono mostrados usan el valor medio de energía.
| Clase | Bajo | Medio | Alto | Fuente |
|---|---|---|---|---|
| eficienteNivel nano de GPT, Claude Haiku, Gemini Flash, Llama pequeño | 0,1 | 0,3 | 0,6 | Jegham et al. 2025 (v6, nov. 2025): GPT-4.1 nano ~0,52 Wh/1.000 tokens; modelos de clase nano <0,3 Wh por consulta corta. |
| estándarClaude Sonnet, GPT-4.1/4o mini, Mistral Large, Llama 70B+ | 0,4 | 0,8 | 1,5 | Jegham et al. 2025 (v6, nov. 2025): GPT-4.1 mini ~0,450 Wh por intercambio de 400 tokens (~1,13 Wh/1.000 tokens); GPT-4o mini ~1,44 Wh/1.000 tokens. El LCA de Mistral (45 mL y 1,14 gCO2e por respuesta de 400 tokens de Mistral Large) no publica ninguna cifra de energía; los ~1,5 Wh que este sitio asocia a esa respuesta son un supuesto del sitio dentro de esta banda. |
| fronteraClase GPT-4o/4.1/5, Claude Opus, Gemini Pro | 1 | 2 | 3,5 | Jegham et al. 2025 (v6, nov. 2025): GPT-4.1 ~0,871 Wh por intercambio de 400 tokens (~2,2 Wh/1.000 tokens); los 0,34 Wh/consulta de Altman en «The Gentle Singularity» (junio de 2025) reflejan consultas medianas más cortas. |
| razonamientoClase o3, DeepSeek-R1, modos de pensamiento extendido | 3 | 7 | 15 | Jegham et al. 2025 (v6, nov. 2025): DeepSeek-R1 ~19-29 Wh por consulta larga; o3 revisado a la baja hasta ~1,18 Wh por consulta corta en la v6 (unas 6 veces menos que en la v1). La banda es un criterio del sitio para cargas con largas cadenas de razonamiento ocultas, donde los tokens de razonamiento no facturados multiplican la energía por token visible. |
| imagenClase SDXL/Midjourney, una imagen generada | 1,5 | 3 | 6 | Luccioni, Jernite y Strubell, «Power Hungry Processing» (FAccT 2024): media de ~2,9 Wh por imagen generada en modelos de clase SDXL, rango medido ~0,06-11,5 Wh. |
| vídeoClase Gen-3/Sora, un clip de ~5 segundos | 25 | 150 | 1000 | MIT Technology Review (mayo de 2025; mediciones de S. Luccioni): un clip de 5 s de CogVideoX de calidad actual ~3,4 MJ (~940 Wh); un modelo antiguo de baja calidad ~30 Wh. Los modelos comerciales cerrados (Sora, Veo) no publican cifras; la banda abarca las mediciones publicadas, con el valor medio cerca de su media geométrica. |
Asignación de modelos
Cada modelo con nombre se asigna a una clase, con ajustes específicos cuando existe una cifra oficial. Los modelos sin datos de energía publicados aparecen sin clase y no producen estimación. Cuando no sabemos, lo decimos.
| Modelo | Clase | Fuente |
|---|---|---|
| ChatGPT (estándar) | frontera | Ancla de clase: Jegham et al. 2025 (v6) GPT-4.1 ~2,2 Wh/1.000 tokens; Epoch AI GPT-4o ~0,3 Wh/consulta; Altman (2025) 0,34 Wh/consulta. |
| ChatGPT (mini) | estándar | Jegham et al. 2025 (v6): GPT-4.1 mini ~0,450 Wh por intercambio de 400 tokens (~1,13 Wh/1.000 tokens); GPT-4o mini ~1,44 Wh/1.000 tokens; dentro de la banda estándar, no de la eficiente. |
| ChatGPT (nano) | eficiente | Jegham et al. 2025 (v6): GPT-4.1 nano ~0,52 Wh/1.000 tokens, dentro de la banda eficiente. |
| ChatGPT (razonamiento / o3) | razonamiento | Benchmarks de modelos de razonamiento de Jegham et al. 2025; la v6 (nov. 2025) revisó o3 a la baja hasta ~1,18 Wh por consulta corta; la banda refleja cargas con largas cadenas de razonamiento ocultas. |
| Claude Opus | frontera | Asignación a la clase frontera por nivel de parámetros y latencia; sin cifra oficial. Banda de frontera de Jegham et al. 2025. |
| Claude Sonnet | estándar | Asignación a la clase estándar por nivel; banda de tamaño medio de Jegham et al. 2025. |
| Claude Haiku | eficiente | Asignación a la clase eficiente por nivel; banda de modelos pequeños de Jegham et al. 2025. |
| Gemini (app) | estándar | Divulgación técnica de Gemini de Google (2025): 0,24 Wh / 0,26 mL / 0,03 gCO2e por prompt mediano.Divulgación técnica de Gemini de Google (2025): 0,24 Wh por prompt mediano de Gemini Apps; convertido con el supuesto del sitio de 700 tokens combinados por prompt a ~0,34 Wh/1.000 tokens. |
| Gemini Pro | frontera | Asignación a la clase frontera por nivel; la cifra oficial de Google cubre el prompt mediano de la app, no el uso de API del nivel Pro. |
| Gemini Flash | eficiente | Asignación a la clase eficiente por nivel; coherente con la cifra de prompt mediano que Google publicó en 2025. |
| DeepSeek-R1 | razonamiento | Jegham et al. 2025: DeepSeek-R1 está entre los consumos de energía por consulta más altos medidos (largas cadenas de razonamiento). |
| Mistral Large | estándar | LCA de Mistral AI: 45 mL de agua y 1,14 gCO2e por respuesta de 400 tokens (inferencia marginal); sin cifra de energía publicada. La energía viene de la banda de clase estándar; ~1,5 Wh por una respuesta así es un supuesto del sitio. |
| Llama (70B+) | estándar | Banda de modelos de pesos abiertos de clase 70B de Jegham et al. 2025. |
| Llama (pequeño) | eficiente | Banda de modelos pequeños de pesos abiertos de Jegham et al. 2025. |
| Grok | frontera | Asignación a la clase frontera por nivel; sin cifra oficial de xAI. |
| Generación de imágenes | imagen | Luccioni et al. (FAccT 2024): media de ~2,9 Wh por imagen generada, clase SDXL/Midjourney. |
| Generación de vídeo (clip de 5 s) | vídeo | MIT Technology Review (mayo de 2025), mediciones de Luccioni: ~940 Wh por clip de 5 s de calidad actual; sin cifras oficiales de los proveedores de clase Sora/Veo. |
| Claude Fable 5 | sin datos aún | Lanzado en junio de 2026 como un nuevo nivel de Anthropic por encima de Opus. Aún no existen benchmarks de energía independientes (con la metodología de Jegham et al. u otra) ni cifra oficial, así que no tiene clase y no produce estimación. Aparece en la lista para que la ausencia sea deliberada, no un olvido. |
Intensidad de carbono (gCO₂e por kWh)
| Qué cuenta | Factor | Fuente | |
|---|---|---|---|
| Bajo: solo refrigeración | operador con PPA limpios | 50 | Operadores con contratos de compra de energía limpia 24/7; los mixes regionales más limpios de EPA eGRID. |
| Medio: + electricidad | aprox. promedio de la red de EE. UU. | 350 | Un valor redondeado algo por debajo de los promedios recientes de EPA eGRID para EE. UU. (eGRID2022: 823 lb CO2/MWh, unos 373 g/kWh). |
| Alto: ciclo de vida completo | red intensiva en fósiles | 500 | Mixes regionales intensivos en fósiles de EPA eGRID. |
Supuestos
- Tokens por intercambio (modo diario): 700Supuesto del sitio, declarado en la metodología: un intercambio de chat típico (prompt + respuesta) promedia ~700 tokens combinados, en línea con los benchmarks de respuestas de 400 tokens de Jegham et al. 2025 más la longitud típica de un prompt.
- Mezcla entrada/salida por defecto: 30% / 70%Supuesto del sitio, declarado en la metodología: mezcla por defecto de 30/70 entre entrada y salida para las estimaciones en modo tokens.
- Ritmo del contador de portada: 230 L/segundoConstante revisada trimestralmente. Derivación: ~2.500 millones de consultas diarias a ChatGPT (declaradas por OpenAI, 2025) escaladas a ~5.000 millones de consultas de IA al día en total (estimación del sitio) × ~0,8 Wh por consulta × 5 L/kWh del escenario Medio = ~4 mL/consulta = ~20 millones de L/día = ~230 L/segundo. Los ~0,8 Wh son un supuesto combinado del sitio, no un coeficiente por 1.000 tokens: quedan entre los valores de este archivo para un intercambio de ~700 tokens en un modelo de clase estándar (~0,56 Wh) y en uno de frontera como ChatGPT (~1,4 Wh). Las cifras por prompt de los propios operadores son menores (0,24-0,34 Wh); solo con energía de clase estándar el ritmo sería de ~160 L/s. Siempre etiquetado como «estimado».
Biblioteca de equivalentes
| Elemento | Valor | Fuente |
|---|---|---|
| botella de agua | 0,5 L | Botella estándar de 500 mL (definición de unidad). |
| almendra (agua equivalente) | 4 L | ~4 L (1,1 gal) de agua de riego por almendra, media de California. |
| descarga de inodoro | 6 L | Inodoro con el máximo federal de EE. UU. de 1,6 gal (~6 L) por descarga; los modelos con etiqueta WaterSense usan 1,28 gal o menos. |
| ducha | 65 L | Ducha de ~8 minutos a ~2,1 gal/min, EPA WaterSense. |
| taza de café (cultivo incluido) | 130 L | Una taza de café, incluida el agua para cultivar los granos (Water Footprint Network). |
| día de consumo doméstico de una persona en EE. UU. | 310 L | Uso doméstico diario de agua por persona en EE. UU.: 82 gal (EPA WaterSense). |
| hamburguesa (agua equivalente) | 2500 L | Una hamburguesa con 150 g de carne de res, incluida el agua del pienso y del ganado (carne de res ~15.400 L/kg, media global de Water Footprint Network); una de cuarto de libra estricta queda más cerca de ~1.800 L. |
| par de jeans | 7500 L | Un par de jeans de algodón, cadena de producción completa (Water Footprint Network). |
| piscina olímpica | 2.500.000 L | Piscina olímpica, 2,5 millones de litros (dimensiones de World Aquatics/FINA). |
| hora de una bombilla LED | 0,01 kWh | Bombilla LED de 10 W durante una hora (aritmética a partir de la potencia nominal). |
| carga de móvil | 0,012 kWh | Carga completa de un smartphone, batería de ~12 Wh (aritmética a partir de la especificación de la batería). |
| hora de streaming | 0,08 kWh | Una hora de vídeo en streaming, dispositivo + red + centro de datos (IEA/Carbon Trust). |
| hervido de tetera | 0,11 kWh | Hervir una tetera llena (~1 L; aritmética a partir del calor específico). |
| milla en coche eléctrico | 0,3 kWh | Una milla en un coche eléctrico medio (~0,3 kWh/milla, ciclo combinado de la EPA). |
| día de electricidad de un hogar en EE. UU. | 29 kWh | Electricidad media diaria de un hogar de EE. UU. (~10,5 MWh/año, EIA). |
| milla en coche de gasolina | 0,4 kg CO₂e | Una milla en un coche de gasolina medio de EE. UU. (~404 g CO2/milla, EPA). |
| árbol-año de absorción de CO₂ | 21 kg CO₂e | CO2 absorbido por un árbol maduro en un año: una cifra redonda de ~21 kg muy citada; las estimaciones publicadas van aproximadamente de 10 a 40 kg según especie, edad y clima. Un equivalente de orden de magnitud, no un valor medido. |
| vuelo transatlántico | 700 kg CO₂e | Asiento en clase turista, vuelo transatlántico de ida: ~700 kg CO2e, un punto medio del sitio entre las calculadoras que solo cuentan el combustible, como la de la OACI (~350-400 kg), y las que suman efectos de calentamiento distintos del CO2 (~1.000+ kg). |
Clase frontera · 2 Wh por 1.000 tokens (referencia media)
El mismo prompt puede ser «cinco gotas» o «una botella de agua» según qué se cuente: solo la refrigeración del centro de datos (Bajo), el agua detrás de la electricidad (Medio), o también el entrenamiento y el hardware (Alto).
Lee la metodología63,9litros
= 16,9 galones
ChatGPT (estándar), 25 prompts/día · por año, escenario Medio
Energía
12,8 kWh
Carbono
4,5 kg CO₂e
Lo que no contamos, y otras limitaciones honestas
- Tu dispositivo y la red. El teléfono que tienes en la mano y la fibra entre tú y el centro de datos también usan energía. Es poco por consulta y queda fuera de los tres escenarios.
- La ubicación. Un litro evaporado en Phoenix no es un litro evaporado en Oslo. Nuestros factores son promedios de la red de EE. UU.; la realidad local varía un orden de magnitud en ambas direcciones.
- Agua reciclada y no potable. Algunos operadores refrigeran con aguas residuales regeneradas o con agua de mar. Nuestros factores no distinguen la calidad del agua, una limitación real de los datos disponibles.
- La obsolescencia. Los modelos, el hardware y las redes cambian más rápido que la literatura. El archivo de coeficientes tiene versión y fecha, y lo actualizamos cuando se publican cifras mejores, no cuando cambia la conversación.
Cómo discrepar con nosotros
De forma productiva, esperamos. Cada coeficiente vive en un único archivo versionado con su fuente adjunta, mostrado arriba sin suavizados editoriales. Si crees que una cifra está mal, puedes identificar exactamente qué coeficiente es, ver exactamente de qué estudio salió y señalarnos uno mejor. Ese es todo el truco: preferimos que nos corrijan a resultar persuasivos.