Cómo armé el NOC de mi ISP (y lo empaqueté para que lo tengas en una tarde)

Durante meses fui armando, a los tropezones, el centro de monitoreo de mi propia red: Zabbix, Grafana, la óptica de las OLT, el syslog centralizado, las alertas y hasta un wallboard para la pared. Esto es lo que aprendí en el camino — y por qué terminé empaquetándolo todo para que vos no tengas que empezar de cero.

El dilema del ISP chico: a ciegas o carísimo

Si tenés un ISP pequeño o mediano, conocés el problema: o monitoreás a ciegas (te enterás de que un nodo se cayó porque te llaman los clientes), o te cotizan una plataforma comercial de NOC a un precio que no cierra para tu tamaño. En el medio no hay mucho.

La tercera opción —armarlo vos con herramientas abiertas— es la correcta, pero tiene una trampa: te lleva meses de prueba y error. Yo lo hice. Acá va el resumen honesto de cada parte.

1. La base: Zabbix + Grafana

Arranqué con Zabbix para recolectar por SNMP (tráfico, CPU, memoria, estado de interfaces de los Mikrotik y las OLT) y Grafana para visualizar lindo. La parte tediosa no es instalarlo: es armar las plantillas y mapear cada itemid. Hice plantillas para Mikrotik, para el CCR2216 de core y para las OLT.

Si querés empezar por acá: cómo monitorear un Mikrotik con Zabbix por SNMP.

2. El dolor de cabeza: la óptica de las ZTE C600

Acá me estrellé. La OLT ZTE C600 no expone la potencia óptica por SNMP. Y la potencia óptica es justo lo que te anticipa un problema de fibra antes de que el cliente note el micro-corte. Después de mucho probar, la solución fue scrapear la CLI de la OLT con un colector en Python y empujar los valores a Zabbix.

⚠️ Lección cara

Consultá la óptica del lado de la OLT (show optical-module-info). Pedirle la potencia a la ONU por OMCI en pleno corte puede tirar el PON entero. Lo aprendí por las malas.

El detalle completo: cómo monitorear la óptica de una OLT ZTE C600 (sin SNMP).

3. Ver qué pasó a las 3 AM: syslog central

Los logs de RouterOS viven en RAM y se borran al reiniciar — justo cuando más los necesitás. Centralicé el syslog de todos los routers en PostgreSQL. Eso me cambió la vida para diagnosticar flapping de PPPoE: de repente podía contar caídas por cliente y cruzar localidades.

Los dos que más me sirvieron: centralizar el syslog de tus Mikrotik y diagnosticar flapping de PPPoE.

4. Alertas que avisan antes que el cliente

El monitoreo sin alertas son gráficos lindos que nadie mira. Armé reglas de Grafana a Telegram para lo que duele: nodo caído, uplink saturado, óptica degradada, CPU al palo. La clave que aprendí: alertar sobre lo binario (el equipo no responde) y no sobre cada pico de latencia, o terminás ignorando todo.

5. El wallboard en la pared

Lo último, y lo más vistoso: un panel de pantalla grande para las TVs de operaciones, con el estado de la red en tiempo real — consumo de uplinks, nodos arriba/abajo, vista GPON con la óptica por PON. Es lo que convierte "tengo monitoreo" en "tengo un NOC".

Por qué lo empaqueté

Cuando miré todo junto me di cuenta de dos cosas: (1) me había llevado meses, y (2) cualquier otro ISP chico de LATAM iba a chocarse con los mismos problemas — sobre todo el de la óptica por CLI, que no está resuelto en ningún lado.

Así que lo armé como Kit: las plantillas de Zabbix, los dashboards de Grafana, el colector de óptica, el pipeline de syslog, las alertas y el wallboard — todo con una guía maestra paso a paso. Pago único, es tuyo, y lo tenés andando en una tarde en vez de en meses.

Sé tu propio NOC

Todo lo que me llevó meses armar, empaquetado y listo para tu red. Plantillas, dashboards, óptica por CLI, syslog, alertas y el wallboard — con la guía maestra. Precio de lanzamiento.

Ver el Kit NOC Completo →