RackMon
Guía

Monitorización de temperatura en racks por SNMP

Casi todas las herramientas de monitorización te avisan de CPU, RAM y disco. Ninguna te avisa de lo que de verdad mata el hardware: el calor. Esta guía explica qué medir, dónde, con qué umbrales, y con qué OIDs concretos — sin vender sondas.

1. Qué hay que medir realmente

El error más común es monitorizar la temperatura que reporta la CPU y darlo por hecho. Eso mide cómo de caliente está el chip, no cómo de caliente está el aire que le llega. Y el segundo dato es el que anticipa el problema.

Coloca al menos dos sondas por rack: una en la parte frontal a media altura (entrada) y otra en la trasera superior (salida), que es donde se acumula el calor.

2. Umbrales sensatos para empezar

ASHRAE recomienda para equipamiento de TI clase A1–A2 un rango de entrada de 18 a 27 °C. Como punto de partida práctico, midiendo en la entrada del rack:

Trátalos como punto de partida, no como dogma: consulta los límites de entrada de tus propios fabricantes. Lo importante es alertar sobre la entrada, en el rack, con margen antes del límite del hardware.

3. Por qué SNMP y no otra cosa

SNMP es el idioma común de la infraestructura. Casi todo lo que hay en un rack lo habla ya: los BMC de los servidores (iDRAC, iLO), los conmutadores gestionables, los SAI, las regletas PDU y las sondas de temperatura dedicadas. No hace falta instalar agentes en nada.

4. Los OIDs que necesitas de verdad

Aquí es donde casi todas las guías te dejan tirado: te dicen «consulta el OID de tu fabricante» y no te dan ninguno. Estos son.

Empieza por el estándar, no por el fabricante. El RFC 3433 define una tabla de sensores independiente del fabricante, y bastante equipamiento moderno la implementa. Si responde, te vale un solo OID para todo el parque:

# todos los valores de sensor que expone el equipo snmpwalk -v2c -c public 10.0.0.10 1.3.6.1.2.1.99.1.1.1.4 # los nombres legibles, para saber qué índice es la entrada snmpwalk -v2c -c public 10.0.0.10 1.3.6.1.2.1.47.1.1.1.1.2

Cruza el índice del segundo comando (verás cosas como «Inlet Temp» o «Ambient Zone») con el del primero, y ya tienes tu lectura de entrada.

OIDs por fabricante

Equipo OID Notas
Cualquiera que implemente el estándar 1.3.6.1.2.1.99.1.1.1.4
ENTITY-SENSOR-MIB · entPhySensorValue
El primero que hay que probar. Comprueba entPhySensorType para confirmar que la unidad es celsius(8), y entPhySensorScale para escalar bien el entero.
Conmutadores y routers Cisco 1.3.6.1.4.1.9.9.13.1.3.1.3
CISCO-ENVMON-MIB
Grados enteros. IOS-XE reciente también responde al estándar de arriba: si lo hace, mejor ese.
Servidores Dell (iDRAC) 1.3.6.1.4.1.674.10892.5.4.700.20.1.6
IDRAC-MIB · temperatureProbeReading
Devuelve décimas de grado: divide entre 10. El índice 1 suele ser la sonda de entrada, que es la que quieres.
Servidores HPE (iLO) 1.3.6.1.4.1.232.6.2.6.8.1.4
CPQHLTH-MIB · cpqHeTemperatureCelsius
Celsius. Combínalo con cpqHeTemperatureLocale para saber cuál es la sonda ambiente.
Juniper 1.3.6.1.4.1.2636.3.1.13.1.7
JUNIPER-MIB · jnxOperatingTemp
Celsius, indexado por componente (motor de rutado, FPC, chasis).
Sondas APC / Schneider (NMC) 1.3.6.1.4.1.318.1.1.10.2.3.2.1.4
PowerNet-MIB · iemStatusProbeCurrentTemp
Entero, y la unidad depende de cómo esté configurada la tarjeta: comprueba si está en °C o en °F antes de fiarte.

Verifícalos antes de fiarte de ninguno. Los OIDs cambian entre modelos y versiones de firmware, y los dos fallos que más se repiten son el escalado (un 275 que en realidad son 27,5 °C) y las unidades (una tarjeta reportando °F sin avisar). Haz el snmpwalk en tu propio equipo, compáralo con lo que muestra su interfaz web, y solo entonces conéctalo a las alertas. Un umbral montado sobre una lectura mal escalada es peor que no monitorizar nada, porque te vas a fiar de él.

5. Alertas en las que puedas confiar

Una alerta térmica que da falsos positivos se ignora en dos semanas, y a partir de ahí ya no tienes monitorización: tienes ruido. Tres reglas que marcan la diferencia:

6. Informes: demostrar lo que ha pasado

Si gestionas infraestructura para un cliente, o alojas equipo de terceros en un CPD, tarde o temprano tendrás que demostrar que las condiciones se han mantenido. Guarda el histórico completo, no solo el dato actual, y ten a mano informes de disponibilidad y de temperatura por rack en un formato que puedas enviar sin editar.

El camino corto

Todo lo anterior se puede montar con una pila de monitorización genérica — o con una herramienta ya diseñada para este trabajo concreto. RackMon es un monitor autoalojado de temperatura de racks y SNMP: mapa de calor por U en tiempo real, alertas honestas (ventanas de espera, deduplicación, sin falsos «recuperado»), informes de disponibilidad y SLA, y página de estado pública. Todo en un contenedor Docker, en unos diez minutos. La edición Community es gratuita para siempre, con dispositivos y métricas ilimitados.

Míralo con tus propios ojos: la demo pública de solo lectura funciona con datos reales. También tienes la comparativa con Zabbix, PRTG, LibreNMS y Checkmk y la página de preguntas frecuentes.

Descargar gratis   Ver precios   ← Volver a RackMon