01 – NOC
Nome: Network Operations Center
Sigla: NOC
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: NOC
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
NOC significa Network Operations Center, ou Centro de Operações de Rede.
É o ambiente responsável por acompanhar e operar uma rede de telecomunicações, normalmente utilizando sistemas de monitoração, alarmes, indicadores de desempenho e ferramentas de diagnóstico.
Na prática
O NOC pode acompanhar:
equipamentos;
enlaces;
centrais;
servidores;
plataformas de voz;
redes IP;
sistemas móveis;
serviços;
alarmes;
desempenho;
disponibilidade;
capacidade;
incidentes.
Exemplo:
Um equipamento de Telecom perde comunicação com o sistema de gerenciamento.
O NOC pode receber um alarme, verificar o equipamento afetado, analisar o histórico e iniciar o troubleshooting.
É o ambiente responsável por acompanhar e operar uma rede de telecomunicações, normalmente utilizando sistemas de monitoração, alarmes, indicadores de desempenho e ferramentas de diagnóstico.
Na prática
O NOC pode acompanhar:
equipamentos;
enlaces;
centrais;
servidores;
plataformas de voz;
redes IP;
sistemas móveis;
serviços;
alarmes;
desempenho;
disponibilidade;
capacidade;
incidentes.
Exemplo:
Um equipamento de Telecom perde comunicação com o sistema de gerenciamento.
O NOC pode receber um alarme, verificar o equipamento afetado, analisar o histórico e iniciar o troubleshooting.
02 – Monitoramento
Nome: Network Monitoring
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo de acompanhar continuamente o estado e o comportamento de equipamentos, redes e serviços.
Na prática
O monitoramento pode verificar:
disponibilidade;
interfaces;
CPU;
memória;
tráfego;
temperatura;
perda de pacotes;
latência;
alarmes;
sessões;
chamadas;
capacidade.
Exemplo:
Um sistema de monitoração detecta que uma interface deixou de responder e gera uma notificação para o NOC.
Na prática
O monitoramento pode verificar:
disponibilidade;
interfaces;
CPU;
memória;
tráfego;
temperatura;
perda de pacotes;
latência;
alarmes;
sessões;
chamadas;
capacidade.
Exemplo:
Um sistema de monitoração detecta que uma interface deixou de responder e gera uma notificação para o NOC.
03 – Alarme
Nome: Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
Um alarme é uma indicação de que determinada condição anormal foi detectada em um elemento ou serviço da rede e requer atenção.
Em modelos de gerenciamento de Telecom, o alarme representa uma condição de falha, erro ou outra situação que pode exigir ação do operador.
Na prática
Um equipamento pode gerar alarmes como:
perda de sinal;
perda de sincronismo;
falha de hardware;
temperatura elevada;
interface down;
perda de comunicação;
falta de energia;
congestionamento.
Exemplo:
Em modelos de gerenciamento de Telecom, o alarme representa uma condição de falha, erro ou outra situação que pode exigir ação do operador.
Na prática
Um equipamento pode gerar alarmes como:
perda de sinal;
perda de sincronismo;
falha de hardware;
temperatura elevada;
interface down;
perda de comunicação;
falta de energia;
congestionamento.
Exemplo:
EQUIPAMENTO ↓ Detecta anormalidade ↓ Gera ALARME ↓ NMS / EMS ↓ NOC04 – Alarme Ativo
Nome: Active Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É um alarme cuja condição de origem ainda não foi eliminada.
Em documentação 3GPP de gerenciamento de falhas, um active alarm é aquele que ainda não foi cleared e permanece ativo até que a condição causadora seja corrigida e um clear alarm seja gerado.
Na prática
Se uma interface continua sem sinal:
Em documentação 3GPP de gerenciamento de falhas, um active alarm é aquele que ainda não foi cleared e permanece ativo até que a condição causadora seja corrigida e um clear alarm seja gerado.
Na prática
Se uma interface continua sem sinal:
LOS ↓ ALARME ATIVO ↓ Problema permanece ↓ Reparo ↓ Sinal retorna ↓ CLEAR05 – Clear Alarm
Nome: Clear Alarm
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É a indicação de que a condição que provocou determinado alarme deixou de existir.
Na prática
Um equipamento pode apresentar:
O primeiro evento indica o início da condição e o segundo indica sua normalização.
Atenção!!!
Um alarme ter sido cleared significa que a condição monitorada deixou de estar ativa. Isso não significa necessariamente que toda a causa-raiz ou impacto associado foi resolvido.
Na prática
Um equipamento pode apresentar:
14:32:10 — LOS ALARM 14:48:21 — LOS CLEARO primeiro evento indica o início da condição e o segundo indica sua normalização.
Atenção!!!
Um alarme ter sido cleared significa que a condição monitorada deixou de estar ativa. Isso não significa necessariamente que toda a causa-raiz ou impacto associado foi resolvido.
06 – Evento
Nome: Event
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Evento é qualquer ocorrência registrada por um elemento de rede ou sistema de gerenciamento.
3GPP utiliza “event” como termo genérico para uma ocorrência em uma entidade de rede.
Na prática
Um evento pode ser:
alteração de estado;
login;
logout;
mudança de configuração;
início de alarme;
fim de alarme;
reinicialização;
mudança de rota;
alteração de capacidade.
Diferença entre evento e alarme
Evento: algo aconteceu.
Alarme: algo aconteceu e a condição é tratada como uma situação que requer atenção ou reação.
3GPP utiliza “event” como termo genérico para uma ocorrência em uma entidade de rede.
Na prática
Um evento pode ser:
alteração de estado;
login;
logout;
mudança de configuração;
início de alarme;
fim de alarme;
reinicialização;
mudança de rota;
alteração de capacidade.
Diferença entre evento e alarme
Evento: algo aconteceu.
Alarme: algo aconteceu e a condição é tratada como uma situação que requer atenção ou reação.
07 – Falha
Nome: Fault
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É uma condição de desvio do funcionamento esperado de um sistema ou recurso.
3GPP diferencia fault, error e failure: uma falha de funcionamento pode produzir um estado incorreto; esse estado pode resultar em uma failure, que é observável como incapacidade de entregar o serviço conforme especificado.
Exemplo:
3GPP diferencia fault, error e failure: uma falha de funcionamento pode produzir um estado incorreto; esse estado pode resultar em uma failure, que é observável como incapacidade de entregar o serviço conforme especificado.
Exemplo:
Fonte de alimentação apresenta defeito ↓ FAULT ↓ Equipamento perde recurso ↓ Possível FAILURE ↓ Serviço afetado08 – Failure
Nome: Failure
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟡 Intermediário
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟡 Intermediário
O que é?
É a incapacidade de um sistema ou serviço de entregar corretamente a função esperada.
Diferença importante
Uma maneira simples de entender:
Essa distinção é utilizada em modelos de gerenciamento de falhas de 3GPP.
Diferença importante
Uma maneira simples de entender:
FAULT Problema ou condição anormal ↓ ERROR Estado incorreto ↓ FAILURE Função/serviço não consegue operar corretamenteEssa distinção é utilizada em modelos de gerenciamento de falhas de 3GPP.
09 – Severidade
Nome: Alarm Severity
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Fault Management
Nível: 🟢 Básico
O que é?
É a classificação atribuída a uma condição ou alarme para indicar sua importância operacional.
Exemplos comuns:
Critical
Major
Minor
Warning
Cleared
Indeterminate
Na prática
A severidade ajuda o NOC a determinar quais ocorrências precisam de atenção prioritária.
Atenção!!!
Severidade técnica não é necessariamente igual ao impacto no serviço.
Um equipamento pode gerar um alarme “Critical” relacionado a um recurso específico sem que isso represente, sozinho, uma interrupção crítica para todos os clientes.
Modelos 3GPP inclusive tratam da necessidade de enriquecer a visão de severidade do elemento de rede com uma visão orientada ao impacto do serviço.
Exemplos comuns:
Critical
Major
Minor
Warning
Cleared
Indeterminate
Na prática
A severidade ajuda o NOC a determinar quais ocorrências precisam de atenção prioritária.
Atenção!!!
Severidade técnica não é necessariamente igual ao impacto no serviço.
Um equipamento pode gerar um alarme “Critical” relacionado a um recurso específico sem que isso represente, sozinho, uma interrupção crítica para todos os clientes.
Modelos 3GPP inclusive tratam da necessidade de enriquecer a visão de severidade do elemento de rede com uma visão orientada ao impacto do serviço.
10 – Fault Management
Nome: Fault Management
Sigla: FM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: FM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o conjunto de processos utilizados para detectar, registrar, analisar, localizar, tratar e acompanhar falhas de uma rede.
Principais atividades
A documentação 3GPP descreve Fault Management incluindo processos como detecção, localização, reporte, correção e reparo.
Principais atividades
DETECÇÃO ↓ NOTIFICAÇÃO ↓ ANÁLISE ↓ LOCALIZAÇÃO ↓ CORREÇÃO ↓ REPARO ↓ VALIDAÇÃO ↓ ENCERRAMENTOA documentação 3GPP descreve Fault Management incluindo processos como detecção, localização, reporte, correção e reparo.
11 – Alarm Management
Nome: Alarm Management
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o gerenciamento estruturado dos alarmes produzidos pela infraestrutura de rede.
Inclui atividades como:
recebimento;
classificação;
priorização;
correlação;
reconhecimento;
investigação;
escalonamento;
tratamento;
encerramento.
Em 3GPP, Fault Management é também tratado como Alarm Management em determinados contextos.
Inclui atividades como:
recebimento;
classificação;
priorização;
correlação;
reconhecimento;
investigação;
escalonamento;
tratamento;
encerramento.
Em 3GPP, Fault Management é também tratado como Alarm Management em determinados contextos.
12 – Alarm Correlation
Nome: Alarm Correlation
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
É o processo de relacionar diferentes alarmes e eventos que provavelmente possuem uma mesma origem.
Exemplo
Imagine:
Sem correlação, o NOC pode enxergar quatro problemas.
Com correlação, pode identificar:
ALARME A = possível causa-raiz
e os demais como consequências.
3GPP descreve justamente a correlação de alarmes e eventos para identificar ocorrências que provavelmente estão relacionadas à mesma falha.
Exemplo
Imagine:
Enlace óptico principal cai ↓ ALARME A ↓ Equipamento perde comunicação ↓ ALARME B ↓ Interfaces ficam indisponíveis ↓ ALARME C ↓ Serviços são afetados ↓ ALARME DSem correlação, o NOC pode enxergar quatro problemas.
Com correlação, pode identificar:
ALARME A = possível causa-raiz
e os demais como consequências.
3GPP descreve justamente a correlação de alarmes e eventos para identificar ocorrências que provavelmente estão relacionadas à mesma falha.
13 – Root Cause Analysis
Nome: Root Cause Analysis
Sigla: RCA
Categoria: NOC / Troubleshooting
Nível: 🟡 Intermediário
Sigla: RCA
Categoria: NOC / Troubleshooting
Nível: 🟡 Intermediário
O que é?
É o processo de identificar a causa fundamental de um problema, em vez de tratar somente seus sintomas.
Exemplo:
Nesse exemplo, “cliente sem serviço” é o sintoma.
A causa-raiz pode estar muito mais abaixo na cadeia.
3GPP descreve Root Cause Analysis como um processo para determinar a condição de rede responsável pelos alarmes, utilizando informações de alarmes, correlação, notificações, configuração e conhecimento operacional.
Exemplo:
Cliente sem serviço ↓ SBC sem comunicação↓ Interface IP down ↓ Switch sem energia ↓ Falha na alimentaçãoNesse exemplo, “cliente sem serviço” é o sintoma.
A causa-raiz pode estar muito mais abaixo na cadeia.
3GPP descreve Root Cause Analysis como um processo para determinar a condição de rede responsável pelos alarmes, utilizando informações de alarmes, correlação, notificações, configuração e conhecimento operacional.
14 – Troubleshooting
Nome: Troubleshooting
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo estruturado de investigação de um problema para determinar sua causa e encontrar uma solução.
Na prática
Um bom troubleshooting não significa simplesmente “testar coisas”.
Ele normalmente segue uma sequência:
Na prática
Um bom troubleshooting não significa simplesmente “testar coisas”.
Ele normalmente segue uma sequência:
1. Identificar o problema 2. Confirmar o sintoma 3. Determinar o escopo 4. Coletar evidências 5. Formular hipóteses 6. Testar hipóteses 7. Localizar a causa 8. Aplicar correção 9. Validar o serviço 10. Registrar o resultado15 – Incident
Nome: Incident
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Um incidente é uma ocorrência que causa ou pode causar interrupção ou degradação de um serviço.
Exemplo:
Importante!
Incidente descreve o que está acontecendo com o serviço.
Não necessariamente identifica sua causa.
Exemplo:
Clientes não conseguem originar chamadas ↓ INCIDENTE ↓ NOC investiga ↓ Identifica falha em plataforma ↓ Correção ↓ Serviço normalizadoImportante!
Incidente descreve o que está acontecendo com o serviço.
Não necessariamente identifica sua causa.
16 – Problem
Nome: Problem
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É uma condição ou causa subjacente relacionada a um ou mais incidentes.
Exemplo
Vários incidentes diferentes podem estar relacionados ao mesmo problema:
O objetivo da análise de problema é compreender a causa e evitar recorrências.
Exemplo
Vários incidentes diferentes podem estar relacionados ao mesmo problema:
INCIDENTE 1 ─┐ INCIDENTE 2 ─┼──→ PROBLEM INCIDENTE 3 ─┘O objetivo da análise de problema é compreender a causa e evitar recorrências.
17 – Escalonamento
Nome: Escalation
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É o processo de encaminhar uma ocorrência para uma equipe ou nível de suporte com conhecimento ou autoridade necessários para tratá-la.
Exemplos:
ou:
Exemplos:
NOC ↓ Equipe de Voz ↓ Engenharia ↓ Fornecedorou:
Nível 1 ↓ Nível 2 ↓ Nível 318 – Ticket
Nome: Trouble Ticket / Ticket
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
Registro formal utilizado para acompanhar uma ocorrência, solicitação, incidente ou problema.
Um bom ticket deve conter:
data/hora;
serviço afetado;
equipamento;
identificação;
sintomas;
alarmes;
testes realizados;
evidências;
ações executadas;
equipes envolvidas;
impacto;
conclusão.
Um bom ticket deve conter:
data/hora;
serviço afetado;
equipamento;
identificação;
sintomas;
alarmes;
testes realizados;
evidências;
ações executadas;
equipes envolvidas;
impacto;
conclusão.
19 – KPI
Nome: Key Performance Indicator
Sigla: KPI
Categoria: Performance
Nível: 🟢 Básico
Sigla: KPI
Categoria: Performance
Nível: 🟢 Básico
O que é?
Indicador utilizado para acompanhar o desempenho de determinado processo, serviço ou componente da operação.
Exemplos em Telecom:
disponibilidade;
taxa de chamadas completadas;
taxa de queda;
utilização de CPU;
utilização de enlace;
perda de pacotes;
latência;
volume de tráfego.
Importante
Um KPI deve estar associado a um objetivo ou contexto de medição. Um número isolado não explica necessariamente a saúde de um serviço.
Exemplos em Telecom:
disponibilidade;
taxa de chamadas completadas;
taxa de queda;
utilização de CPU;
utilização de enlace;
perda de pacotes;
latência;
volume de tráfego.
Importante
Um KPI deve estar associado a um objetivo ou contexto de medição. Um número isolado não explica necessariamente a saúde de um serviço.
20 – KQI
Nome: Key Quality Indicator
Sigla: KQI
Categoria: Performance / Qualidade
Nível: 🟡 Intermediário
Sigla: KQI
Categoria: Performance / Qualidade
Nível: 🟡 Intermediário
O que é?
Indicador utilizado para representar a qualidade percebida ou observada de um serviço.
Diferença simplificada:
Exemplo:
Um KPI pode medir perda de pacotes.
Um KQI pode representar a qualidade percebida de uma chamada de voz.
Diferença simplificada:
KPI ↓ mede determinado aspecto técnico KQI ↓ relaciona-se à qualidade do serviçoExemplo:
Um KPI pode medir perda de pacotes.
Um KQI pode representar a qualidade percebida de uma chamada de voz.
21 – QoS
Nome: Quality of Service
Sigla: QoS
Categoria: Performance
Nível: 🟢 Básico
Sigla: QoS
Categoria: Performance
Nível: 🟢 Básico
O que é?
Conjunto de mecanismos e métricas utilizados para controlar e avaliar características de transporte de tráfego na rede.
Em voz
Os principais fatores observados incluem:
latência;
jitter;
perda de pacotes;
disponibilidade;
capacidade.
Em voz
Os principais fatores observados incluem:
latência;
jitter;
perda de pacotes;
disponibilidade;
capacidade.
22 – QoE
Nome: Quality of Experience
Sigla: QoE
Categoria: Performance
Nível: 🟡 Intermediário
Sigla: QoE
Categoria: Performance
Nível: 🟡 Intermediário
O que é?
É a avaliação da experiência percebida pelo usuário ao utilizar determinado serviço.
Exemplo
A rede pode apresentar bons indicadores técnicos, mas o usuário ainda perceber:
áudio ruim;
chamadas caindo;
demora;
interrupções;
vídeo travando.
Por isso, QoS e QoE não são necessariamente a mesma coisa.
Exemplo
A rede pode apresentar bons indicadores técnicos, mas o usuário ainda perceber:
áudio ruim;
chamadas caindo;
demora;
interrupções;
vídeo travando.
Por isso, QoS e QoE não são necessariamente a mesma coisa.
23 – SLA
Nome: Service Level Agreement
Sigla: SLA
Categoria: Operação / Serviços
Nível: 🟢 Básico
Sigla: SLA
Categoria: Operação / Serviços
Nível: 🟢 Básico
O que é?
É um acordo que estabelece níveis de serviço esperados entre as partes.
Pode estabelecer:
disponibilidade;
prazo de atendimento;
prazo de resolução;
desempenho;
suporte;
indicadores;
penalidades ou consequências contratuais, quando aplicáveis.
Exemplo
Um contrato pode estabelecer determinado percentual de disponibilidade mensal para um serviço.
Pode estabelecer:
disponibilidade;
prazo de atendimento;
prazo de resolução;
desempenho;
suporte;
indicadores;
penalidades ou consequências contratuais, quando aplicáveis.
Exemplo
Um contrato pode estabelecer determinado percentual de disponibilidade mensal para um serviço.
24 – SLO
Nome: Service Level Objective
Sigla: SLO
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
Sigla: SLO
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
O que é?
É um objetivo específico de nível de serviço utilizado para medir o desempenho esperado.
Relação simplificada:
Relação simplificada:
SLA ↓ acordo de serviço SLO ↓ objetivo mensurável KPI ↓ indicador utilizado para medir25 – Disponibilidade
Nome: Availability
Sigla: —
Categoria: Performance
Nível: 🟢 Básico
Sigla: —
Categoria: Performance
Nível: 🟢 Básico
O que é?
É a medida de quanto tempo um equipamento, sistema ou serviço permanece disponível para utilização.
Exemplo:
Se um serviço fica indisponível por determinado período durante um mês, esse tempo pode ser utilizado para calcular sua disponibilidade mensal.
Exemplo:
Se um serviço fica indisponível por determinado período durante um mês, esse tempo pode ser utilizado para calcular sua disponibilidade mensal.
26 – Outage
Nome: Outage
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É uma interrupção ou indisponibilidade de um serviço ou recurso.
Exemplo
Exemplo
Serviço funcionando ↓ Falha ↓ OUTAGE ↓ Correção ↓ Serviço restaurado27 – Degradação
Nome: Service Degradation
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Operação
Nível: 🟢 Básico
O que é?
É uma situação em que o serviço continua disponível, mas apresenta desempenho inferior ao esperado.
Exemplos:
chamadas completando, mas com baixa qualidade;
aumento de latência;
perda de pacotes;
lentidão;
aumento da taxa de chamadas com falha.
Diferença:
Outage: serviço indisponível.
Degradação: serviço disponível, porém com desempenho comprometido.
Exemplos:
chamadas completando, mas com baixa qualidade;
aumento de latência;
perda de pacotes;
lentidão;
aumento da taxa de chamadas com falha.
Diferença:
Outage: serviço indisponível.
Degradação: serviço disponível, porém com desempenho comprometido.
28 – MTTR
Nome: Mean Time To Repair / Restore
Sigla: MTTR
Categoria: Indicadores
Nível: 🟡 Intermediário
Sigla: MTTR
Categoria: Indicadores
Nível: 🟡 Intermediário
O que é?
É uma métrica relacionada ao tempo médio necessário para reparar ou restaurar um serviço ou recurso após uma falha.
A ITU-T define MTTR como a expectativa de tempo de reparo para um conjunto estatisticamente significativo de reparos, normalmente calculada como média aritmética entre o momento em que a falha é reportada e a restauração do serviço para o cliente.
Exemplo:
O intervalo desse processo é utilizado no cálculo do MTTR conforme a definição adotada.
A ITU-T define MTTR como a expectativa de tempo de reparo para um conjunto estatisticamente significativo de reparos, normalmente calculada como média aritmética entre o momento em que a falha é reportada e a restauração do serviço para o cliente.
Exemplo:
Falha detectada ↓ Atendimento ↓ Diagnóstico ↓ Reparo ↓ Serviço restauradoO intervalo desse processo é utilizado no cálculo do MTTR conforme a definição adotada.
29 – MTBF
Nome: Mean Time Between Failures
Sigla: MTBF
Categoria: Indicadores
Nível: 🟡 Intermediário
Sigla: MTBF
Categoria: Indicadores
Nível: 🟡 Intermediário
O que é?
É uma métrica utilizada para representar o tempo médio entre falhas de um sistema ou componente.
Utilidade
Pode ser utilizada para analisar:
confiabilidade;
recorrência de falhas;
desempenho de equipamentos;
necessidade de manutenção.
Utilidade
Pode ser utilizada para analisar:
confiabilidade;
recorrência de falhas;
desempenho de equipamentos;
necessidade de manutenção.
30 – LOG
Nome: Log
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
O que é?
Registro produzido por um sistema ou equipamento contendo informações sobre acontecimentos, operações, erros ou estados.
Exemplos:
Na prática
Logs são uma das principais fontes de evidência durante um troubleshooting.
Exemplos:
SIP log System log Security log Authentication log Application log Network logNa prática
Logs são uma das principais fontes de evidência durante um troubleshooting.
31 – Trace
Nome: Trace / Tracing
Sigla: —
Categoria: Troubleshooting
Nível: 🟡 Intermediário
Sigla: —
Categoria: Troubleshooting
Nível: 🟡 Intermediário
O que é?
É o acompanhamento detalhado de uma determinada operação, sessão ou fluxo através de um sistema.
Em Telecom
Pode ser utilizado para acompanhar:
chamadas;
mensagens SIP;
sinalização;
transações;
sessões;
pacotes;
eventos.
Exemplo:
Um trace pode permitir acompanhar a chamada ao longo desses elementos.
Em Telecom
Pode ser utilizado para acompanhar:
chamadas;
mensagens SIP;
sinalização;
transações;
sessões;
pacotes;
eventos.
Exemplo:
Número A ↓ SBC ↓ Core ↓ TAS ↓ Interconexão ↓ Número BUm trace pode permitir acompanhar a chamada ao longo desses elementos.
32 – NMS
Nome: Network Management System
Sigla: NMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
Sigla: NMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
O que é?
Sistema utilizado para monitorar e gerenciar elementos de uma rede.
Pode fornecer:
alarmes;
topologia;
desempenho;
inventário;
estado dos equipamentos;
histórico;
indicadores.
Pode fornecer:
alarmes;
topologia;
desempenho;
inventário;
estado dos equipamentos;
histórico;
indicadores.
33 – EMS
Nome: Element Management System
Sigla: EMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
Sigla: EMS
Categoria: Gerenciamento de Rede
Nível: 🟡 Intermediário
O que é?
Sistema especializado no gerenciamento de determinados tipos ou famílias de elementos de rede.
Diferença simplificada:
Um EMS normalmente possui conhecimento mais específico sobre determinados equipamentos, enquanto um NMS pode fornecer uma visão mais ampla da rede.
Diferença simplificada:
NE ↓ EMS ↓ NMS ↓ NOCUm EMS normalmente possui conhecimento mais específico sobre determinados equipamentos, enquanto um NMS pode fornecer uma visão mais ampla da rede.
34 – OSS
Nome: Operations Support Systems
Sigla: OSS
Categoria: Operação
Nível: 🟡 Intermediário
Sigla: OSS
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de sistemas utilizados para apoiar operações de redes e serviços de telecomunicações.
Pode envolver:
inventário;
provisionamento;
monitoração;
gerenciamento de falhas;
desempenho;
configuração;
ativação;
manutenção.
Pode envolver:
inventário;
provisionamento;
monitoração;
gerenciamento de falhas;
desempenho;
configuração;
ativação;
manutenção.
35 – BSS
Nome: Business Support Systems
Sigla: BSS
Categoria: Operação / Negócios
Nível: 🟡 Intermediário
Sigla: BSS
Categoria: Operação / Negócios
Nível: 🟡 Intermediário
O que é?
Conjunto de sistemas voltados ao suporte dos processos de negócio de uma operadora ou provedor.
Exemplos de funções:
clientes;
produtos;
cobrança;
pedidos;
faturamento;
relacionamento;
catálogo.
Diferença simplificada:
Exemplos de funções:
clientes;
produtos;
cobrança;
pedidos;
faturamento;
relacionamento;
catálogo.
Diferença simplificada:
OSS → suporte à operação BSS → suporte ao negócio36 – Network Element
Nome: Network Element
Sigla: NE
Categoria: Infraestrutura
Nível: 🟡 Intermediário
Sigla: NE
Categoria: Infraestrutura
Nível: 🟡 Intermediário
O que é?
Elemento de rede gerenciado ou monitorado dentro de uma infraestrutura de Telecom.
Exemplos:
router;
switch;
SBC;
TAS;
MGW;
OLT;
eNodeB;
gNodeB;
servidor;
equipamento de transmissão.
Exemplos:
router;
switch;
SBC;
TAS;
MGW;
OLT;
eNodeB;
gNodeB;
servidor;
equipamento de transmissão.
37 – Performance Management
Nome: Performance Management
Sigla: PM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: PM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de processos destinados a coletar, analisar e acompanhar indicadores de desempenho da rede.
Exemplos:
utilização;
tráfego;
capacidade;
latência;
perda;
chamadas;
CPU;
memória;
throughput.
A gestão de desempenho é tratada, juntamente com gestão de falhas e configuração, como uma função de gerenciamento de redes em referências de Telecom.
Exemplos:
utilização;
tráfego;
capacidade;
latência;
perda;
chamadas;
CPU;
memória;
throughput.
A gestão de desempenho é tratada, juntamente com gestão de falhas e configuração, como uma função de gerenciamento de redes em referências de Telecom.
38 – Configuration Management
Nome: Configuration Management
Sigla: CM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: CM
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
Conjunto de atividades relacionadas ao gerenciamento da configuração dos elementos e serviços da rede.
Exemplos:
alteração de IP;
criação de rota;
alteração de parâmetros SIP;
configuração de interface;
alteração de VLAN;
ativação/desativação de recurso.
Exemplos:
alteração de IP;
criação de rota;
alteração de parâmetros SIP;
configuração de interface;
alteração de VLAN;
ativação/desativação de recurso.
39 – Inventory Management
Nome: Inventory Management
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Gerenciamento das informações sobre recursos físicos e lógicos da rede.
Pode incluir:
equipamentos;
placas;
interfaces;
portas;
IPs;
circuitos;
enlaces;
software;
versões;
localização;
capacidade.
Pode incluir:
equipamentos;
placas;
interfaces;
portas;
IPs;
circuitos;
enlaces;
software;
versões;
localização;
capacidade.
40 – Change Management
Nome: Change Management
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Processo utilizado para planejar, avaliar, aprovar, executar e acompanhar alterações em uma infraestrutura ou serviço.
Exemplo
Uma mudança em um SBC:
Exemplo
Uma mudança em um SBC:
Planejamento ↓ Análise de impacto ↓ Aprovação ↓ Janela de manutenção ↓ Execução ↓ Teste ↓Validação ↓ Encerramento41 – Maintenance Window
Nome: Maintenance Window
Sigla: —
Categoria: Operação
Nível: 🟢 Básico
Sigla: —
Categoria: Operação
Nível: 🟢 Básico
O que é?
Período previamente definido para execução de atividades de manutenção que podem afetar equipamentos ou serviços.
Exemplos:
atualização de software;
troca de equipamento;
alteração de configuração;
migração;
manutenção preventiva.
Exemplos:
atualização de software;
troca de equipamento;
alteração de configuração;
migração;
manutenção preventiva.
42 – Rollback
Nome: Rollback
Sigla: —
Categoria: Operação / Change Management
Nível: 🟢 Básico
Sigla: —
Categoria: Operação / Change Management
Nível: 🟢 Básico
O que é?
Processo de retornar uma alteração para um estado anterior quando a mudança executada não produz o resultado esperado.
Exemplo:
Exemplo:
CONFIGURAÇÃO A ↓ CHANGE ↓ CONFIGURAÇÃO B ↓ Problema ↓ ROLLBACK ↓ CONFIGURAÇÃO A43 – Escopo de impacto
Nome: Impact Scope
Sigla: —
Categoria: Incident Management
Nível: 🟡 Intermediário
Sigla: —
Categoria: Incident Management
Nível: 🟡 Intermediário
O que é?
Determinação de quais elementos, serviços, clientes, regiões ou plataformas são afetados por uma ocorrência.
Exemplo
Uma falha pode afetar:
Determinar o escopo é uma das primeiras etapas importantes de um troubleshooting.
Exemplo
Uma falha pode afetar:
1 cliente ↓ 100 clientes ↓ uma célula ↓ uma região ↓ uma plataforma ↓ toda a redeDeterminar o escopo é uma das primeiras etapas importantes de um troubleshooting.
44 – Recorrêcia
Nome: Recurring Fault / Recurrence
Sigla: —
Categoria: NOC / Problemas
Nível: 🟡 Intermediário
Sigla: —
Categoria: NOC / Problemas
Nível: 🟡 Intermediário
O que é?
Situação em que determinada falha ou sintoma ocorre repetidamente.
Exemplo
A recorrência é importante porque pode indicar que uma correção anterior tratou o sintoma, mas não eliminou a causa-raiz.
Exemplo
Segunda → falha Terça → normal Quarta → falha Quinta → normal Sexta → falhaA recorrência é importante porque pode indicar que uma correção anterior tratou o sintoma, mas não eliminou a causa-raiz.
45 – Histórico de alarmes
Nome: Alarm History
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
Sigla: —
Categoria: NOC / Troubleshooting
Nível: 🟢 Básico
O que é?
Registro histórico dos alarmes e eventos ocorridos em determinado equipamento ou serviço.
Na prática
O histórico permite responder perguntas como:
Quando começou?
Já aconteceu antes?
Quanto tempo durou?
Qual alarme apareceu primeiro?
Qual equipamento apresentou o primeiro evento?
O problema é recorrente?
O alarme foi automaticamente limpo?
O gerenciamento de alarmes e eventos normalmente mantém registros de início, limpeza e histórico das ocorrências.
Na prática
O histórico permite responder perguntas como:
Quando começou?
Já aconteceu antes?
Quanto tempo durou?
Qual alarme apareceu primeiro?
Qual equipamento apresentou o primeiro evento?
O problema é recorrente?
O alarme foi automaticamente limpo?
O gerenciamento de alarmes e eventos normalmente mantém registros de início, limpeza e histórico das ocorrências.
46 – Alarm Acknowledgement
Nome: Alarm Acknowledgement
Sigla: ACK
Categoria: NOC / Operação
Nível: 🟡 Intermediário
Sigla: ACK
Categoria: NOC / Operação
Nível: 🟡 Intermediário
O que é?
É o reconhecimento de que determinado alarme foi recebido ou identificado pelo operador/sistema.
Atenção!!!
Reconhecer um alarme não significa necessariamente que a falha foi resolvida.
Exemplo:
Atenção!!!
Reconhecer um alarme não significa necessariamente que a falha foi resolvida.
Exemplo:
ALARME ↓ ACKNOWLEDGE ↓ Operador assumiu conhecimento ↓ INVESTIGAÇÃO ↓CORREÇÃO ↓ CLEAR47 – Alarm Suppression
Nome: Alarm Suppression
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
Mecanismo utilizado para evitar que determinados alarmes sejam apresentados ou tratados repetidamente quando já se sabe que estão relacionados a outra condição.
Exemplo:
Uma falha de alimentação pode provocar dezenas de alarmes secundários.
O sistema pode suprimir ou relacionar determinados eventos para evitar uma “tempestade” de alarmes.
Exemplo:
Uma falha de alimentação pode provocar dezenas de alarmes secundários.
O sistema pode suprimir ou relacionar determinados eventos para evitar uma “tempestade” de alarmes.
48 – Alarm Flood
Nome: Alarm Flood
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
Sigla: —
Categoria: NOC / Operação
Nível: 🔴 Avançado
O que é?
Situação em que uma grande quantidade de alarmes é gerada em curto período.
Problema
O excesso de alarmes pode dificultar a identificação da causa-raiz.
Exemplo:
Problema
O excesso de alarmes pode dificultar a identificação da causa-raiz.
Exemplo:
Falha principal ↓ 100 equipamentos afetados ↓ 1.000 alarmes ↓ ALARM FLOOD ↓ Necessidade de correlação49 – Topologia
Nome: Network Topology
Sigla: —
Categoria: Redes / NOC
Nível: 🟢 Básico
Sigla: —
Categoria: Redes / NOC
Nível: 🟢 Básico
O que é?
É a representação da forma como os elementos de uma rede estão conectados.
Exemplos:
estrela;
anel;
malha;
árvore;
hierárquica.
Em NOC
A topologia ajuda a entender:
dependências;
caminhos;
redundâncias;
impacto de falhas;
possíveis causas.
Exemplos:
estrela;
anel;
malha;
árvore;
hierárquica.
Em NOC
A topologia ajuda a entender:
dependências;
caminhos;
redundâncias;
impacto de falhas;
possíveis causas.
50 – Redundância
Nome: Redundancy
Sigla: —
Categoria: Disponibilidade
Nível: 🟢 Básico
Sigla: —
Categoria: Disponibilidade
Nível: 🟢 Básico
O que é?
Utilização de recursos alternativos para manter a operação quando um componente principal falha.
Exemplo:
Se o Link A falhar, o Link B pode assumir, dependendo da arquitetura.
Exemplo:
┌── Link A ──┐ Equipamento Rede └── Link B ──┘Se o Link A falhar, o Link B pode assumir, dependendo da arquitetura.
51 – Failover
Nome: Failover
Sigla: —
Categoria: Disponibilidade
Nível: 🟡 Intermediário
Sigla: —
Categoria: Disponibilidade
Nível: 🟡 Intermediário
O que é?
Processo de transferência de uma função ou serviço de um recurso primário para um recurso alternativo após uma falha.
Exemplo:
Exemplo:
Servidor A ↓ X ↓ Servidor B ↓ Serviço continua52 – Self-Healing
Nome: Self-Healing
Sigla: —
Categoria: Automação / Operação
Nível: 🔴 Avançado
Sigla: —
Categoria: Automação / Operação
Nível: 🔴 Avançado
O que é?
Capacidade de uma rede ou sistema detectar determinadas condições e executar ações automáticas para restaurar ou preservar seu funcionamento.
Exemplo:
Exemplo:
Falha detectada ↓ Sistema identifica condição ↓ Ativação automática de recurso alternativo ↓ Serviço restaurado53 – SLA Breach
Nome: SLA Breach
Sigla: —
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
Sigla: —
Categoria: Operação / Serviços
Nível: 🟡 Intermediário
O que é?
Situação em que determinado requisito estabelecido em um SLA não é atendido.
Exemplo:
Se um acordo estabelece determinado tempo máximo de atendimento ou disponibilidade e esse objetivo não é alcançado, pode ocorrer um SLA breach.
Exemplo:
Se um acordo estabelece determinado tempo máximo de atendimento ou disponibilidade e esse objetivo não é alcançado, pode ocorrer um SLA breach.
54 – Post-Mortem
Nome: Post-Mortem / Incident Review
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Análise realizada após um incidente significativo para entender:
o que aconteceu;
quando aconteceu;
qual foi o impacto;
qual foi a causa;
como foi resolvido;
o que poderia ter sido feito diferente;
quais ações devem evitar recorrência.
Estrutura recomendada:
o que aconteceu;
quando aconteceu;
qual foi o impacto;
qual foi a causa;
como foi resolvido;
o que poderia ter sido feito diferente;
quais ações devem evitar recorrência.
Estrutura recomendada:
1. Resumo 2. Impacto 3. Linha do tempo 4. Detecção 5. Diagnóstico 6. Causa-raiz 7. Correção 8. Recuperação 9. Lições aprendidas 10. Ações preventivas55 – Runbook
Nome: Runbook
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
Sigla: —
Categoria: Operação
Nível: 🟡 Intermediário
O que é?
Documento ou procedimento estruturado que orienta uma equipe sobre como executar determinada atividade operacional.
Exemplo:
Runbook — SIP 503
Exemplo:
Runbook — SIP 503
1. Confirmar ocorrência 2. Identificar origem 3. Consultar trace SIP 4. Identificar elemento que gerou 503 5. Verificar alarmes 6. Verificar conectividade 7. Verificar capacidade 8. Escalonar se necessário 9. Validar normalização 10. Registrar resultado56 – Escopo x causa x impacto
O que é?
Um conceito importante para quem está começando:
Sintoma
O que está sendo observado.
Impacto
Quem ou o que está sendo afetado.
Causa
Por que está acontecendo.
Causa-raiz
Por que a condição original aconteceu.
Exemplo
Sintoma
O que está sendo observado.
Impacto
Quem ou o que está sendo afetado.
Causa
Por que está acontecendo.
Causa-raiz
Por que a condição original aconteceu.
Exemplo
SINTOMA Chamadas não completam ↓ IMPACTO Clientes de determinada região ↓ CAUSA SBC rejeitando sessões ↓ CAUSA-RAIZ Alteração de configuração