Monitorización de temperatura en racks por SNMP
Casi todas las herramientas de monitorización te avisan de CPU, RAM y disco. Ninguna te avisa de lo que de verdad mata el hardware: el calor. Esta guía explica qué medir, dónde, con qué umbrales, y con qué OIDs concretos — sin vender sondas.
1. Qué hay que medir realmente
El error más común es monitorizar la temperatura que reporta la CPU y darlo por hecho. Eso mide cómo de caliente está el chip, no cómo de caliente está el aire que le llega. Y el segundo dato es el que anticipa el problema.
- Temperatura de entrada (inlet) — el aire del pasillo frío justo antes de entrar al equipo. Es la métrica que importa. Es la que usan los fabricantes para definir sus límites de garantía y la que sube cuando falla la climatización.
- Temperatura de salida (exhaust) — útil comparada con la de entrada: un salto térmico creciente entre ambas suele significar ventiladores sucios, filtros saturados o un equipo trabajando de más.
- Temperatura interna del equipo — la de CPU o placa. Va bien como confirmación, pero llega tarde: cuando sube, el problema lleva rato ocurriendo.
- Humedad relativa — poco glamurosa y muy importante. Demasiado baja provoca electricidad estática; demasiado alta, condensación.
Coloca al menos dos sondas por rack: una en la parte frontal a media altura (entrada) y otra en la trasera superior (salida), que es donde se acumula el calor.
2. Umbrales sensatos para empezar
ASHRAE recomienda para equipamiento de TI clase A1–A2 un rango de entrada de 18 a 27 °C. Como punto de partida práctico, midiendo en la entrada del rack:
- Hasta 27 °C — normal.
- 28–32 °C — aviso. Todavía no se rompe nada, pero algo ha cambiado: revísalo hoy.
- Más de 32 °C — crítico. Margen real antes de llegar a los límites del fabricante.
Trátalos como punto de partida, no como dogma: consulta los límites de entrada de tus propios fabricantes. Lo importante es alertar sobre la entrada, en el rack, con margen antes del límite del hardware.
3. Por qué SNMP y no otra cosa
SNMP es el idioma común de la infraestructura. Casi todo lo que hay en un rack lo habla ya: los BMC de los servidores (iDRAC, iLO), los conmutadores gestionables, los SAI, las regletas PDU y las sondas de temperatura dedicadas. No hace falta instalar agentes en nada.
- SNMP v2c — sencillo, basado en community string, sin cifrar. Aceptable solo en una VLAN de gestión aislada.
- SNMP v3 — añade autenticación y cifrado (authPriv). Úsalo siempre que la red de gestión no esté completamente separada.
4. Los OIDs que necesitas de verdad
Aquí es donde casi todas las guías te dejan tirado: te dicen «consulta el OID de tu fabricante» y no te dan ninguno. Estos son.
Empieza por el estándar, no por el fabricante. El RFC 3433 define una tabla de sensores independiente del fabricante, y bastante equipamiento moderno la implementa. Si responde, te vale un solo OID para todo el parque:
# todos los valores de sensor que expone el equipo
snmpwalk -v2c -c public 10.0.0.10 1.3.6.1.2.1.99.1.1.1.4
# los nombres legibles, para saber qué índice es la entrada
snmpwalk -v2c -c public 10.0.0.10 1.3.6.1.2.1.47.1.1.1.1.2
Cruza el índice del segundo comando (verás cosas como «Inlet Temp» o «Ambient Zone») con el del primero, y ya tienes tu lectura de entrada.
OIDs por fabricante
| Equipo | OID | Notas |
|---|---|---|
| Cualquiera que implemente el estándar | 1.3.6.1.2.1.99.1.1.1.4ENTITY-SENSOR-MIB · entPhySensorValue |
El primero que hay que probar. Comprueba entPhySensorType para confirmar que la unidad es celsius(8), y entPhySensorScale para escalar bien el entero. |
| Conmutadores y routers Cisco | 1.3.6.1.4.1.9.9.13.1.3.1.3CISCO-ENVMON-MIB |
Grados enteros. IOS-XE reciente también responde al estándar de arriba: si lo hace, mejor ese. |
| Servidores Dell (iDRAC) | 1.3.6.1.4.1.674.10892.5.4.700.20.1.6IDRAC-MIB · temperatureProbeReading |
Devuelve décimas de grado: divide entre 10. El índice 1 suele ser la sonda de entrada, que es la que quieres. |
| Servidores HPE (iLO) | 1.3.6.1.4.1.232.6.2.6.8.1.4CPQHLTH-MIB · cpqHeTemperatureCelsius |
Celsius. Combínalo con cpqHeTemperatureLocale para saber cuál es la sonda ambiente. |
| Juniper | 1.3.6.1.4.1.2636.3.1.13.1.7JUNIPER-MIB · jnxOperatingTemp |
Celsius, indexado por componente (motor de rutado, FPC, chasis). |
| Sondas APC / Schneider (NMC) | 1.3.6.1.4.1.318.1.1.10.2.3.2.1.4PowerNet-MIB · iemStatusProbeCurrentTemp |
Entero, y la unidad depende de cómo esté configurada la tarjeta: comprueba si está en °C o en °F antes de fiarte. |
Verifícalos antes de fiarte de ninguno. Los OIDs cambian entre modelos y versiones de firmware, y los dos fallos que más se repiten son el escalado (un 275 que en realidad son 27,5 °C) y las unidades (una tarjeta reportando °F sin avisar). Haz el snmpwalk en tu propio equipo, compáralo con lo que muestra su interfaz web, y solo entonces conéctalo a las alertas. Un umbral montado sobre una lectura mal escalada es peor que no monitorizar nada, porque te vas a fiar de él.
5. Alertas en las que puedas confiar
Una alerta térmica que da falsos positivos se ignora en dos semanas, y a partir de ahí ya no tienes monitorización: tienes ruido. Tres reglas que marcan la diferencia:
- Ventanas de espera (hold-down) — no dispares al primer sondeo por encima del umbral. Exige que se mantenga varios ciclos seguidos. El calor es una magnitud física lenta; un pico aislado casi siempre es un fallo de lectura.
- Deduplicación — si se cae la climatización, veinte equipos superan el umbral a la vez. Eso es un incidente, no veinte avisos.
- No inventarse recuperaciones — si un sondeo no llega, eso es un dato ausente, no una vuelta a la normalidad. Muchas herramientas marcan «recuperado» cuando en realidad han perdido la visibilidad, que es justo cuando más ciego te deja.
6. Informes: demostrar lo que ha pasado
Si gestionas infraestructura para un cliente, o alojas equipo de terceros en un CPD, tarde o temprano tendrás que demostrar que las condiciones se han mantenido. Guarda el histórico completo, no solo el dato actual, y ten a mano informes de disponibilidad y de temperatura por rack en un formato que puedas enviar sin editar.
El camino corto
Todo lo anterior se puede montar con una pila de monitorización genérica — o con una herramienta ya diseñada para este trabajo concreto. RackMon es un monitor autoalojado de temperatura de racks y SNMP: mapa de calor por U en tiempo real, alertas honestas (ventanas de espera, deduplicación, sin falsos «recuperado»), informes de disponibilidad y SLA, y página de estado pública. Todo en un contenedor Docker, en unos diez minutos. La edición Community es gratuita para siempre, con dispositivos y métricas ilimitados.