NOC / Operação

O NOC — Network Operations Center, ou Centro de Operações de Rede — é o ambiente responsável pelo monitoramento, supervisão e operação de redes e serviços de telecomunicações.
Em uma operação de Telecom, o NOC acompanha equipamentos, enlaces, serviços, alarmes, desempenho, capacidade e disponibilidade da rede. Quando ocorre uma anormalidade, a equipe analisa os eventos, identifica o impacto, investiga a causa e coordena as ações necessárias para restabelecer o serviço.

01 – NOC

Nome: Network Operations Center
Sigla: NOC
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
NOC significa Network Operations Center, ou Centro de Operações de Rede.
É o ambiente responsável por acompanhar e operar uma rede de telecomunicações, normalmente utilizando sistemas de monitoração, alarmes, indicadores de desempenho e ferramentas de diagnóstico.

Na prática

O NOC pode acompanhar:

equipamentos;
enlaces;
centrais;
servidores;
plataformas de voz;
redes IP;
sistemas móveis;
serviços;
alarmes;
desempenho;
disponibilidade;
capacidade;
incidentes.

Exemplo:

Um equipamento de Telecom perde comunicação com o sistema de gerenciamento.
O NOC pode receber um alarme, verificar o equipamento afetado, analisar o histórico e iniciar o troubleshooting.

02 – Monitoramento

Nome: Network Monitoring
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo de acompanhar continuamente o estado e o comportamento de equipamentos, redes e serviços.

Na prática

O monitoramento pode verificar:

disponibilidade;
interfaces;
CPU;
memória;
tráfego;
temperatura;
perda de pacotes;
latência;
alarmes;
sessões;
chamadas;
capacidade.

Exemplo:

Um sistema de monitoração detecta que uma interface deixou de responder e gera uma notificação para o NOC.

03 – Alarme

Nome: Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
Um alarme é uma indicação de que determinada condição anormal foi detectada em um elemento ou serviço da rede e requer atenção.
Em modelos de gerenciamento de Telecom, o alarme representa uma condição de falha, erro ou outra situação que pode exigir ação do operador.

Na prática

Um equipamento pode gerar alarmes como:

perda de sinal;
perda de sincronismo;
falha de hardware;
temperatura elevada;
interface down;
perda de comunicação;
falta de energia;
congestionamento.

Exemplo:

EQUIPAMENTO
↓
Detecta anormalidade
↓
Gera ALARME
↓
NMS / EMS
↓ NOC

04 – Alarme Ativo

Nome: Active Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É um alarme cuja condição de origem ainda não foi eliminada.
Em documentação 3GPP de gerenciamento de falhas, um active alarm é aquele que ainda não foi cleared e permanece ativo até que a condição causadora seja corrigida e um clear alarm seja gerado.

Na prática

Se uma interface continua sem sinal:

LOS
↓
ALARME ATIVO
↓
Problema permanece
↓
Reparo
↓
Sinal retorna
↓
CLEAR

05 – Clear Alarm

Nome: Clear Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É a indicação de que a condição que provocou determinado alarme deixou de existir.

Na prática

Um equipamento pode apresentar:

14:32:10 — LOS ALARM
14:48:21 — LOS CLEAR

O primeiro evento indica o início da condição e o segundo indica sua normalização.

Atenção!!!
Um alarme ter sido cleared significa que a condição monitorada deixou de estar ativa. Isso não significa necessariamente que toda a causa-raiz ou impacto associado foi resolvido.

06 – Evento

Nome: Event
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Evento é qualquer ocorrência registrada por um elemento de rede ou sistema de gerenciamento.
3GPP utiliza “event” como termo genérico para uma ocorrência em uma entidade de rede.

Na prática

Um evento pode ser:

alteração de estado;
login;
logout;
mudança de configuração;
início de alarme;
fim de alarme;
reinicialização;
mudança de rota;
alteração de capacidade.

Diferença entre evento e alarme

Evento: algo aconteceu.
Alarme: algo aconteceu e a condição é tratada como uma situação que requer atenção ou reação.

07 – Falha

Nome: Fault
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É uma condição de desvio do funcionamento esperado de um sistema ou recurso.
3GPP diferencia fault, error e failure: uma falha de funcionamento pode produzir um estado incorreto; esse estado pode resultar em uma failure, que é observável como incapacidade de entregar o serviço conforme especificado.

Exemplo:

Fonte de alimentação apresenta defeito
↓
FAULT
↓
Equipamento perde recurso
↓
Possível FAILURE
↓
Serviço afetado

08 – Failure

Nome: Failure
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟡 Intermediário
O que é?
É a incapacidade de um sistema ou serviço de entregar corretamente a função esperada.

Diferença importante

Uma maneira simples de entender:

FAULT
Problema ou condição anormal
↓
ERROR
Estado incorreto
↓
FAILURE
Função/serviço não consegue operar corretamente

Essa distinção é utilizada em modelos de gerenciamento de falhas de 3GPP.

09 – Severidade

Nome: Alarm Severity
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É a classificação atribuída a uma condição ou alarme para indicar sua importância operacional.

Exemplos comuns:

Critical
Major
Minor
Warning
Cleared
Indeterminate

Na prática

A severidade ajuda o NOC a determinar quais ocorrências precisam de atenção prioritária.

Atenção!!!
Severidade técnica não é necessariamente igual ao impacto no serviço.

Um equipamento pode gerar um alarme “Critical” relacionado a um recurso específico sem que isso represente, sozinho, uma interrupção crítica para todos os clientes.

Modelos 3GPP inclusive tratam da necessidade de enriquecer a visão de severidade do elemento de rede com uma visão orientada ao impacto do serviço.

10 – Fault Management

Nome: Fault Management
Sigla: FM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o conjunto de processos utilizados para detectar, registrar, analisar, localizar, tratar e acompanhar falhas de uma rede.

Principais atividades

DETECÇÃO
↓
NOTIFICAÇÃO
↓
ANÁLISE
↓
LOCALIZAÇÃO
↓
CORREÇÃO
↓
REPARO
↓
VALIDAÇÃO
↓
ENCERRAMENTO

A documentação 3GPP descreve Fault Management incluindo processos como detecção, localização, reporte, correção e reparo.

11 – Alarm Management

Nome: Alarm Management
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o gerenciamento estruturado dos alarmes produzidos pela infraestrutura de rede.

Inclui atividades como:

recebimento;
classificação;
priorização;
correlação;
reconhecimento;
investigação;
escalonamento;
tratamento;
encerramento.

Em 3GPP, Fault Management é também tratado como Alarm Management em determinados contextos.

12 – Alarm Correlation

Nome: Alarm Correlation
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
É o processo de relacionar diferentes alarmes e eventos que provavelmente possuem uma mesma origem.

Exemplo

Imagine:

Enlace óptico principal cai
↓
ALARME A
↓
Equipamento perde comunicação
↓
ALARME B
↓
Interfaces ficam indisponíveis
↓
ALARME C
↓
Serviços são afetados
↓
ALARME D

Sem correlação, o NOC pode enxergar quatro problemas.

Com correlação, pode identificar:

ALARME A = possível causa-raiz

e os demais como consequências.

3GPP descreve justamente a correlação de alarmes e eventos para identificar ocorrências que provavelmente estão relacionadas à mesma falha.

13 – Root Cause Analysis

Nome: Root Cause Analysis
Sigla: RCA
Categoria: NOC / Troubleshooting
Nível: 🟡 Intermediário
O que é?
É o processo de identificar a causa fundamental de um problema, em vez de tratar somente seus sintomas.

Exemplo:

Cliente sem serviço
↓
SBC sem comunicação
↓
Interface IP down
↓
Switch sem energia
↓
Falha na alimentação

Nesse exemplo, “cliente sem serviço” é o sintoma.
A causa-raiz pode estar muito mais abaixo na cadeia.
3GPP descreve Root Cause Analysis como um processo para determinar a condição de rede responsável pelos alarmes, utilizando informações de alarmes, correlação, notificações, configuração e conhecimento operacional.

14 – Troubleshooting

Nome: Troubleshooting
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo estruturado de investigação de um problema para determinar sua causa e encontrar uma solução.

Na prática

Um bom troubleshooting não significa simplesmente “testar coisas”.

Ele normalmente segue uma sequência:

1. Identificar o problema
2. Confirmar o sintoma
3. Determinar o escopo
4. Coletar evidências
5. Formular hipóteses
6. Testar hipóteses
7. Localizar a causa
8. Aplicar correção
9. Validar o serviço
10. Registrar o resultado

15 – Incident

Nome: Incident
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Um incidente é uma ocorrência que causa ou pode causar interrupção ou degradação de um serviço.

Exemplo:

Clientes não conseguem originar chamadas
↓
INCIDENTE
↓
NOC investiga
↓
Identifica falha em plataforma
↓
Correção
↓
Serviço normalizado

Importante!

Incidente descreve o que está acontecendo com o serviço.
Não necessariamente identifica sua causa.

16 – Problem

Nome: Problem
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É uma condição ou causa subjacente relacionada a um ou mais incidentes.

Exemplo

Vários incidentes diferentes podem estar relacionados ao mesmo problema:

INCIDENTE 1 ─┐
INCIDENTE 2 ─┼──→ PROBLEM
INCIDENTE 3 ─┘

O objetivo da análise de problema é compreender a causa e evitar recorrências.

17 – Escalonamento

Nome: Escalation
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo de encaminhar uma ocorrência para uma equipe ou nível de suporte com conhecimento ou autoridade necessários para tratá-la.

Exemplos:

NOC
↓
Equipe de Voz
↓
Engenharia
↓
Fornecedor

ou:

Nível 1
↓
Nível 2
↓
Nível 3

18 – Ticket

Nome: Trouble Ticket / Ticket
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Registro formal utilizado para acompanhar uma ocorrência, solicitação, incidente ou problema.

Um bom ticket deve conter:

data/hora;
serviço afetado;
equipamento;
identificação;
sintomas;
alarmes;
testes realizados;
evidências;
ações executadas;
equipes envolvidas;
impacto;
conclusão.

19 – KPI

Nome: Key Performance Indicator
Sigla: KPI
Categoria: Performance
Nível: 🟢 Básico
O que é?
Indicador utilizado para acompanhar o desempenho de determinado processo, serviço ou componente da operação.

Exemplos em Telecom:

disponibilidade;
taxa de chamadas completadas;
taxa de queda;
utilização de CPU;
utilização de enlace;
perda de pacotes;
latência;
volume de tráfego.

Importante
Um KPI deve estar associado a um objetivo ou contexto de medição. Um número isolado não explica necessariamente a saúde de um serviço.

20 – KQI

Nome: Key Quality Indicator
Sigla: KQI
Categoria: Performance / Qualidade
Nível: 🟡 Intermediário
O que é?
Indicador utilizado para representar a qualidade percebida ou observada de um serviço.

Diferença simplificada:

KPI
↓
mede determinado aspecto técnico KQI
↓
relaciona-se à qualidade do serviço

Exemplo:

Um KPI pode medir perda de pacotes.
Um KQI pode representar a qualidade percebida de uma chamada de voz.

21 – QoS

Nome: Quality of Service
Sigla: QoS
Categoria: Performance
Nível: 🟢 Básico
O que é?
Conjunto de mecanismos e métricas utilizados para controlar e avaliar características de transporte de tráfego na rede.

Em voz

Os principais fatores observados incluem:

latência;
jitter;
perda de pacotes;
disponibilidade;
capacidade.

22 – QoE

Nome: Quality of Experience
Sigla: QoE
Categoria: Performance
Nível: 🟡 Intermediário
O que é?
É a avaliação da experiência percebida pelo usuário ao utilizar determinado serviço.

Exemplo

A rede pode apresentar bons indicadores técnicos, mas o usuário ainda perceber:

áudio ruim;
chamadas caindo;
demora;
interrupções;
vídeo travando.

Por isso, QoS e QoE não são necessariamente a mesma coisa.

23 – SLA

Nome: Service Level Agreement
Sigla: SLA
Categoria: Operação / Serviços
Nível: 🟢 Básico
O que é?
É um acordo que estabelece níveis de serviço esperados entre as partes.

Pode estabelecer:

disponibilidade;
prazo de atendimento;
prazo de resolução;
desempenho;
suporte;
indicadores;
penalidades ou consequências contratuais, quando aplicáveis.

Exemplo
Um contrato pode estabelecer determinado percentual de disponibilidade mensal para um serviço.

24 – SLO

Nome: Service Level Objective
Sigla: SLO
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
O que é?
É um objetivo específico de nível de serviço utilizado para medir o desempenho esperado.

Relação simplificada:

SLA
↓
acordo de serviço SLO
↓
objetivo mensurável KPI
↓
indicador utilizado para medir

25 – Disponibilidade

Nome: Availability
Sigla: —
Categoria: Performance
Nível: 🟢 Básico
O que é?
É a medida de quanto tempo um equipamento, sistema ou serviço permanece disponível para utilização.

Exemplo:

Se um serviço fica indisponível por determinado período durante um mês, esse tempo pode ser utilizado para calcular sua disponibilidade mensal.

26 – Outage

Nome: Outage
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É uma interrupção ou indisponibilidade de um serviço ou recurso.

Exemplo

Serviço funcionando
↓
Falha
↓
OUTAGE
↓
Correção
↓
Serviço restaurado

27 – Degradação

Nome: Service Degradation
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É uma situação em que o serviço continua disponível, mas apresenta desempenho inferior ao esperado.

Exemplos:

chamadas completando, mas com baixa qualidade;
aumento de latência;
perda de pacotes;
lentidão;
aumento da taxa de chamadas com falha.

Diferença:

Outage: serviço indisponível.
Degradação: serviço disponível, porém com desempenho comprometido.

28 – MTTR

Nome: Mean Time To Repair / Restore
Sigla: MTTR
Categoria: Indicadores
Nível: 🟡 Intermediário
O que é?
É uma métrica relacionada ao tempo médio necessário para reparar ou restaurar um serviço ou recurso após uma falha.
A ITU-T define MTTR como a expectativa de tempo de reparo para um conjunto estatisticamente significativo de reparos, normalmente calculada como média aritmética entre o momento em que a falha é reportada e a restauração do serviço para o cliente.

Exemplo:

Falha detectada
↓
Atendimento
↓
Diagnóstico
↓
Reparo
↓
Serviço restaurado

O intervalo desse processo é utilizado no cálculo do MTTR conforme a definição adotada.

29 – MTBF

Nome: Mean Time Between Failures
Sigla: MTBF
Categoria: Indicadores
Nível: 🟡 Intermediário
O que é?
É uma métrica utilizada para representar o tempo médio entre falhas de um sistema ou componente.

Utilidade

Pode ser utilizada para analisar:

confiabilidade;
recorrência de falhas;
desempenho de equipamentos;
necessidade de manutenção.

30 – LOG

Nome: Log
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
O que é?
Registro produzido por um sistema ou equipamento contendo informações sobre acontecimentos, operações, erros ou estados.

Exemplos:

SIP log
System log
Security log
Authentication log
Application log
Network log

Na prática

Logs são uma das principais fontes de evidência durante um troubleshooting.

31 – Trace

Nome: Trace / Tracing
Sigla: —
Categoria: Troubleshooting
Nível: 🟡 Intermediário
O que é?
É o acompanhamento detalhado de uma determinada operação, sessão ou fluxo através de um sistema.

Em Telecom

Pode ser utilizado para acompanhar:

chamadas;
mensagens SIP;
sinalização;
transações;
sessões;
pacotes;
eventos.

Exemplo:

Número A
↓
SBC
↓
Core
↓
TAS
↓
Interconexão
↓
Número B

Um trace pode permitir acompanhar a chamada ao longo desses elementos.

32 – NMS

Nome: Network Management System
Sigla: NMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
O que é?
Sistema utilizado para monitorar e gerenciar elementos de uma rede.

Pode fornecer:

alarmes;
topologia;
desempenho;
inventário;
estado dos equipamentos;
histórico;
indicadores.

33 – EMS

Nome: Element Management System
Sigla: EMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
O que é?
Sistema especializado no gerenciamento de determinados tipos ou famílias de elementos de rede.

Diferença simplificada:

NE
↓
EMS
↓
NMS
↓
NOC

Um EMS normalmente possui conhecimento mais específico sobre determinados equipamentos, enquanto um NMS pode fornecer uma visão mais ampla da rede.

34 – OSS

Nome: Operations Support Systems
Sigla: OSS
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de sistemas utilizados para apoiar operações de redes e serviços de telecomunicações.

Pode envolver:

inventário;
provisionamento;
monitoração;
gerenciamento de falhas;
desempenho;
configuração;
ativação;
manutenção.

35 – BSS

Nome: Business Support Systems
Sigla: BSS
Categoria: Operação / Negócios
Nível: 🟡 Intermediário
O que é?
Conjunto de sistemas voltados ao suporte dos processos de negócio de uma operadora ou provedor.

Exemplos de funções:

clientes;
produtos;
cobrança;
pedidos;
faturamento;
relacionamento;
catálogo.

Diferença simplificada:

OSS → suporte à operação
BSS → suporte ao negócio

36 – Network Element

Nome: Network Element
Sigla: NE
Categoria: Infraestrutura
Nível: 🟡 Intermediário
O que é?
Elemento de rede gerenciado ou monitorado dentro de uma infraestrutura de Telecom.

Exemplos:

router;
switch;
SBC;
TAS;
MGW;
OLT;
eNodeB;
gNodeB;
servidor;
equipamento de transmissão.

37 – Performance Management

Nome: Performance Management
Sigla: PM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de processos destinados a coletar, analisar e acompanhar indicadores de desempenho da rede.

Exemplos:

utilização;
tráfego;
capacidade;
latência;
perda;
chamadas;
CPU;
memória;
throughput.

A gestão de desempenho é tratada, juntamente com gestão de falhas e configuração, como uma função de gerenciamento de redes em referências de Telecom.

38 – Configuration Management

Nome: Configuration Management
Sigla: CM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de atividades relacionadas ao gerenciamento da configuração dos elementos e serviços da rede.

Exemplos:

alteração de IP;
criação de rota;
alteração de parâmetros SIP;
configuração de interface;
alteração de VLAN;
ativação/desativação de recurso.

39 – Inventory Management

Nome: Inventory Management
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Gerenciamento das informações sobre recursos físicos e lógicos da rede.

Pode incluir:

equipamentos;
placas;
interfaces;
portas;
IPs;
circuitos;
enlaces;
software;
versões;
localização;
capacidade.

40 – Change Management

Nome: Change Management
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Processo utilizado para planejar, avaliar, aprovar, executar e acompanhar alterações em uma infraestrutura ou serviço.

Exemplo

Uma mudança em um SBC:

Planejamento
↓
Análise de impacto
↓
Aprovação
↓
Janela de manutenção
↓
Execução
↓
Teste
↓
Validação
↓
Encerramento

41 – Maintenance Window

Nome: Maintenance Window
Sigla: —
Categoria: Operação
Nível: 🟢 Básico
O que é?
Período previamente definido para execução de atividades de manutenção que podem afetar equipamentos ou serviços.

Exemplos:

atualização de software;
troca de equipamento;
alteração de configuração;
migração;
manutenção preventiva.

42 – Rollback

Nome: Rollback
Sigla: —
Categoria: Operação / Change Management
Nível: 🟢 Básico
O que é?
Processo de retornar uma alteração para um estado anterior quando a mudança executada não produz o resultado esperado.

Exemplo:

CONFIGURAÇÃO A
↓
CHANGE
↓
CONFIGURAÇÃO B
↓
Problema
↓
ROLLBACK
↓
CONFIGURAÇÃO A

43 – Escopo de impacto

Nome: Impact Scope
Sigla: —
Categoria: Incident Management
Nível: 🟡 Intermediário
O que é?
Determinação de quais elementos, serviços, clientes, regiões ou plataformas são afetados por uma ocorrência.

Exemplo

Uma falha pode afetar:

1 cliente
↓
100 clientes
↓
uma célula
↓
uma região
↓
uma plataforma
↓
toda a rede

Determinar o escopo é uma das primeiras etapas importantes de um troubleshooting.

44 – Recorrêcia

Nome: Recurring Fault / Recurrence
Sigla: —
Categoria: NOC / Problemas
Nível: 🟡 Intermediário
O que é?
Situação em que determinada falha ou sintoma ocorre repetidamente.

Exemplo

Segunda → falha
Terça → normal
Quarta → falha
Quinta → normal
Sexta → falha

A recorrência é importante porque pode indicar que uma correção anterior tratou o sintoma, mas não eliminou a causa-raiz.

45 – Histórico de alarmes

Nome: Alarm History
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
O que é?
Registro histórico dos alarmes e eventos ocorridos em determinado equipamento ou serviço.

Na prática

O histórico permite responder perguntas como:

Quando começou?
Já aconteceu antes?
Quanto tempo durou?
Qual alarme apareceu primeiro?
Qual equipamento apresentou o primeiro evento?
O problema é recorrente?
O alarme foi automaticamente limpo?

O gerenciamento de alarmes e eventos normalmente mantém registros de início, limpeza e histórico das ocorrências.

46 – Alarm Acknowledgement

Nome: Alarm Acknowledgement
Sigla: ACK
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o reconhecimento de que determinado alarme foi recebido ou identificado pelo operador/sistema.

Atenção!!!
Reconhecer um alarme não significa necessariamente que a falha foi resolvida.

Exemplo:

ALARME
↓
ACKNOWLEDGE
↓
Operador assumiu conhecimento
↓
INVESTIGAÇÃO
↓
CORREÇÃO
↓
CLEAR

47 – Alarm Suppression

Nome: Alarm Suppression
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
Mecanismo utilizado para evitar que determinados alarmes sejam apresentados ou tratados repetidamente quando já se sabe que estão relacionados a outra condição.

Exemplo:

Uma falha de alimentação pode provocar dezenas de alarmes secundários.
O sistema pode suprimir ou relacionar determinados eventos para evitar uma “tempestade” de alarmes.

48 – Alarm Flood

Nome: Alarm Flood
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
Situação em que uma grande quantidade de alarmes é gerada em curto período.

Problema

O excesso de alarmes pode dificultar a identificação da causa-raiz.

Exemplo:

Falha principal
↓
100 equipamentos afetados
↓
1.000 alarmes
↓
ALARM FLOOD
↓
Necessidade de correlação

49 – Topologia

Nome: Network Topology
Sigla: —
Categoria: Redes / NOC
Nível: 🟢 Básico
O que é?
É a representação da forma como os elementos de uma rede estão conectados.

Exemplos:

estrela;
anel;
malha;
árvore;
hierárquica.

Em NOC

A topologia ajuda a entender:

dependências;
caminhos;
redundâncias;
impacto de falhas;
possíveis causas.

50 – Redundância

Nome: Redundancy
Sigla: —
Categoria: Disponibilidade
Nível: 🟢 Básico
O que é?
Utilização de recursos alternativos para manter a operação quando um componente principal falha.

Exemplo:

┌── Link A ──┐
Equipamento Rede
└── Link B ──┘

Se o Link A falhar, o Link B pode assumir, dependendo da arquitetura.

51 – Failover

Nome: Failover
Sigla: —
Categoria: Disponibilidade
Nível: 🟡 Intermediário
O que é?
Processo de transferência de uma função ou serviço de um recurso primário para um recurso alternativo após uma falha.

Exemplo:

Servidor A
↓
X
↓
Servidor B
↓
Serviço continua

52 – Self-Healing

Nome: Self-Healing
Sigla: —
Categoria: Automação / Operação
Nível: 🔴 Avançado
O que é?
Capacidade de uma rede ou sistema detectar determinadas condições e executar ações automáticas para restaurar ou preservar seu funcionamento.

Exemplo:

Falha detectada
↓
Sistema identifica condição
↓
Ativação automática de recurso alternativo
↓
Serviço restaurado

53 – SLA Breach

Nome: SLA Breach
Sigla: —
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
O que é?
Situação em que determinado requisito estabelecido em um SLA não é atendido.

Exemplo:

Se um acordo estabelece determinado tempo máximo de atendimento ou disponibilidade e esse objetivo não é alcançado, pode ocorrer um SLA breach.

54 – Post-Mortem

Nome: Post-Mortem / Incident Review
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Análise realizada após um incidente significativo para entender:

o que aconteceu;
quando aconteceu;
qual foi o impacto;
qual foi a causa;
como foi resolvido;
o que poderia ter sido feito diferente;
quais ações devem evitar recorrência.

Estrutura recomendada:

1. Resumo
2. Impacto
3. Linha do tempo
4. Detecção
5. Diagnóstico
6. Causa-raiz
7. Correção
8. Recuperação
9. Lições aprendidas
10. Ações preventivas

55 – Runbook

Nome: Runbook
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Documento ou procedimento estruturado que orienta uma equipe sobre como executar determinada atividade operacional.

Exemplo:

Runbook — SIP 503

1. Confirmar ocorrência
2. Identificar origem
3. Consultar trace SIP
4. Identificar elemento que gerou 503
5. Verificar alarmes
6. Verificar conectividade
7. Verificar capacidade
8. Escalonar se necessário
9. Validar normalização
10. Registrar resultado

56 – Escopo x causa x impacto

O que é?
Um conceito importante para quem está começando:

Sintoma
O que está sendo observado.

Impacto
Quem ou o que está sendo afetado.

Causa
Por que está acontecendo.

Causa-raiz
Por que a condição original aconteceu.

Exemplo

SINTOMA
Chamadas não completam
↓
IMPACTO
Clientes de determinada região
↓
CAUSA SBC
rejeitando sessões
↓
CAUSA-RAIZ
Alteração de configuração
Rolar para cima