Um computador funciona perfeitamente durante um jogo pesado, passa horas executando tarefas exigentes e não apresenta qualquer sinal de instabilidade. Porém, basta deixá-lo alguns minutos parado para surgir um comportamento estranho:
- SSD NVMe desaparece temporariamente;
- placa de rede perde conexão;
- dispositivo PCIe apresenta falha;
- computador demora para retornar de um estado de economia;
- aparecem erros relacionados a dispositivos;
- o problema acontece depois de suspensão ou retomada;
- a falha desaparece depois de reiniciar.
A primeira reação normalmente é procurar defeito em RAM, fonte, SSD, temperatura ou Windows.
Essas hipóteses são legítimas.
Mas existe outra área do computador que merece atenção quando o defeito parece relacionado às transições entre atividade e repouso:
PCI Express Active State Power Management, ou PCIe ASPM.
ASPM é um mecanismo de gerenciamento de energia do barramento PCI Express.
E entender seu funcionamento ajuda a explicar uma categoria particularmente difícil de defeitos:
problemas que não acontecem necessariamente quando o hardware trabalha muito, mas quando ele entra ou sai de estados de economia de energia.
Isso não significa que ASPM seja automaticamente culpado por qualquer falha de suspensão, NVMe ou PCIe.
Na realidade, esse será um dos pontos mais importantes deste artigo:
desativar ASPM e observar uma melhora é um teste diagnóstico; não é prova automática de que o Windows ou o próprio ASPM possui um defeito.
Precisamos primeiro entender o que está acontecendo.
O que é PCI Express?
Antes de explicar ASPM, precisamos entender onde ele atua.
PCI Express, normalmente abreviado como:
PCIe
é uma das principais interfaces de comunicação de alta velocidade utilizadas em computadores modernos.
Diversos componentes podem utilizar PCIe direta ou indiretamente, como:
- placas de vídeo;
- SSDs NVMe;
- placas de rede;
- controladores USB;
- placas Wi-Fi;
- placas de captura;
- controladores adicionais;
- dispositivos conectados ao chipset.
PCIe não serve apenas para a enorme placa de vídeo instalada no slot x16.
Boa parte da comunicação interna de um PC moderno depende dessa arquitetura.
O que são PCIe lanes?
Uma conexão PCIe utiliza pistas, conhecidas como:
lanes.
Podemos encontrar interfaces como:
PCIe x1
PCIe x2
PCIe x4
PCIe x8
PCIe x16
A quantidade disponível depende da plataforma e da conexão.
Um SSD NVMe, por exemplo, frequentemente utiliza uma conexão PCIe x4.
Uma GPU normalmente utiliza um slot físico x16, embora a quantidade elétrica de lanes disponível possa variar.
CPU e chipset participam dessa topologia
Nem todo dispositivo PCIe está necessariamente ligado diretamente ao processador.
Dependendo da plataforma, podemos ter:
CPU → dispositivo PCIe
ou:
CPU → chipset → dispositivo PCIe
Isso será importante mais adiante porque gerenciamento de energia não envolve apenas o dispositivo isoladamente.
Existe um:
link PCIe
entre componentes.
É justamente nesse link que ASPM entra
ASPM significa:
Active State Power Management.
De forma simplificada, ele permite reduzir o consumo de energia de um link PCI Express durante períodos de baixa atividade.
A lógica é simples.
Se determinado link não está transferindo dados o tempo inteiro, não faz sentido necessariamente mantê-lo continuamente no estado de maior atividade e consumo.
Então PCIe possui mecanismos para colocar o link em estados de menor consumo.
Pense em ASPM como gerenciamento do link
Esse detalhe evita uma confusão muito comum.
ASPM não significa simplesmente:
“desligar o SSD.”
Ele está relacionado ao gerenciamento de energia do link PCI Express.
O dispositivo pode possuir seus próprios estados de energia, mas isso constitui outra camada.
Link e dispositivo não são exatamente a mesma coisa
Imagine um SSD NVMe.
Temos, simplificando:
CPU/chipset
↓
link PCIe
↓
controlador NVMe
↓
memória NAND
ASPM atua no gerenciamento de energia do link PCIe.
O próprio SSD também pode possuir mecanismos internos de economia.
Essas duas coisas podem trabalhar em conjunto, mas não são sinônimos.
Quais são os estados do link PCIe?
Para entender ASPM, precisamos conhecer alguns estados importantes.
Um link PCIe pode operar em diferentes condições.
Entre os conceitos mais conhecidos estão:
L0
L0s
L1
Além deles, versões mais modernas da especificação possuem mecanismos e subestados adicionais relacionados à economia de energia.
O que é L0?
L0 representa o estado normal de operação ativa do link.
É onde esperamos que a comunicação ocorra normalmente.
Podemos pensar:
L0 = link ativo
Isso não significa necessariamente que o dispositivo esteja utilizando 100% de sua capacidade.
Significa que o link está em seu estado operacional ativo.
O que é L0s?
L0s é um estado de economia de energia mais leve.
A ideia é reduzir consumo durante períodos de inatividade relativamente curtos, mantendo uma saída rápida para retornar à atividade.
Quanto mais agressiva a economia, normalmente maior se torna a importância da latência de transição.
O que é L1?
L1 representa um estado de economia mais profundo que L0s.
O link reduz ainda mais sua atividade.
Isso pode proporcionar economia maior, mas a transição de volta ao funcionamento ativo possui requisitos próprios.
Existem subestados de L1
Em plataformas modernas podemos encontrar referências a:
L1.1
L1.2
Esses subestados permitem economias adicionais.
Eles são particularmente relevantes em equipamentos nos quais consumo em idle importa muito, como notebooks.
Quanto mais profundo o estado, maior o desafio da transição
Podemos visualizar conceitualmente:
L0
atividade maior
↓
L0s
economia leve
↓
L1
economia maior
↓
L1.x
possibilidades de economia ainda mais agressiva
O objetivo é reduzir consumo sem prejudicar a experiência.
Por que economizar alguns watts importa?
Em desktop, alguns usuários podem pensar:
“Meu computador está ligado na tomada. Não preciso disso.”
Mas gerenciamento de energia possui impacto em:
- consumo total;
- temperatura;
- eficiência;
- notebooks;
- autonomia de bateria;
- requisitos de plataformas modernas.
Além disso, bilhões de horas de funcionamento acumuladas tornam pequenas economias relevantes em escala.
Em notebook, ASPM é ainda mais importante
Imagine manter vários links PCIe em estado de maior consumo continuamente, mesmo sem tráfego.
Isso reduziria a eficiência energética.
Por isso, sistemas móveis tendem a utilizar mecanismos agressivos de gerenciamento de energia.
Então por que ASPM poderia causar problema?
Em condições normais:
não deveria.
Hardware, firmware e drivers compatíveis devem coordenar corretamente as transições.
O problema aparece quando existe alguma incompatibilidade, falha ou implementação problemática em uma das camadas envolvidas.
O verdadeiro problema pode estar na transição
Essa é a parte interessante.
Um dispositivo pode funcionar perfeitamente enquanto permanece ativo.
O problema aparece quando ocorre:
atividade
↓
economia
↓
retorno à atividade
Se alguma camada não coordena essa transição corretamente, podemos observar falhas aparentemente aleatórias.
Isso explica um comportamento curioso
Imagine:
Durante jogo
GPU, CPU, SSD e outros dispositivos permanecem ativos.
O computador funciona durante três horas.
Usuário fecha o jogo
Sistema entra em idle.
Vários mecanismos de economia começam a atuar.
Alguns minutos depois
Um dispositivo apresenta erro.
A conclusão intuitiva seria:
“Se aguenta jogo pesado, hardware está perfeito.”
Não necessariamente.
Estabilidade sob carga não prova estabilidade em transições de energia
Esse princípio vale além do PCIe.
Um computador moderno muda constantemente:
- frequência;
- tensão;
- estados de CPU;
- estados de GPU;
- estados PCIe;
- estados de dispositivos.
O sistema não trabalha em uma condição fixa.
Por isso alguns defeitos aparecem apenas em idle
Uma máquina pode suportar:
CPU 100%
GPU 100%
e falhar quando:
CPU 2%
GPU idle
PCIe em economia
Isso parece contraditório, mas eletronicamente não é impossível.
ASPM não é C-State da CPU
Essa confusão aparece frequentemente.
ASPM
Gerencia estados de energia do link PCI Express.
C-States
Relacionam-se aos estados de inatividade da CPU.
São mecanismos diferentes.
ASPM também não é simplesmente “plano de energia”
O plano de energia do Windows pode influenciar políticas relacionadas ao gerenciamento de energia, mas ele representa uma camada de controle mais ampla.
Não confunda:
plano de energia
com:
estado físico do link PCIe.
O Windows possui uma configuração relacionada
Nas opções avançadas de energia do Windows, dependendo da plataforma e configuração, podemos encontrar:
PCI Express → Gerenciamento de energia do estado do link
Em inglês:
Link State Power Management.
Podem existir opções como:
- Desativado;
- Economia de energia moderada;
- Economia máxima.
A disponibilidade e o comportamento podem variar conforme a plataforma.
O que “Desativado” significa?
De forma geral, reduz ou desabilita o uso da política de economia de energia do estado do link controlada por essa configuração.
Isso pode ser útil como teste.
Por exemplo:
problema acontece
↓
desabilita Link State Power Management
↓
problema desaparece
Isso cria uma pista importante.
Mas ainda não prova a causa
Talvez a falha envolva:
- firmware do dispositivo;
- firmware da placa-mãe;
- driver;
- controlador;
- chipset;
- estado de energia do próprio dispositivo;
- interação entre várias camadas.
Ao impedir uma transição, podemos apenas ter evitado o cenário que dispara o defeito.
Analogia: porta que emperra
Imagine uma porta que abre normalmente, mas emperra sempre que é fechada completamente.
Manter a porta aberta evita o problema.
Mas isso não prova que:
“fechar portas é uma tecnologia defeituosa.”
O defeito pode estar:
- na dobradiça;
- na fechadura;
- no alinhamento;
- na instalação.
Com ASPM, o raciocínio é semelhante.
ASPM pode afetar desempenho?
Em uma implementação funcionando corretamente, o sistema tenta equilibrar:
- economia;
- latência de retorno;
- desempenho.
Em determinadas cargas extremamente sensíveis a latência, políticas de energia podem influenciar comportamento.
Mas não devemos assumir que desativar ASPM gera automaticamente mais FPS ou torna todo computador mais rápido.
ASPM não é “modo lento do PCIe”
Esse é outro erro.
Quando o link precisa trabalhar, ele deve retornar ao estado operacional apropriado.
O mecanismo existe justamente para economizar durante inatividade.
Onde o NVMe entra nessa história?
SSDs NVMe utilizam PCI Express.
Isso faz com que existam pelo menos duas áreas de gerenciamento de energia relevantes:
- gerenciamento do link PCIe;
- gerenciamento de energia do próprio dispositivo NVMe.
Misturar essas duas áreas produz diagnósticos incorretos.
NVMe possui estados próprios de energia
Um controlador NVMe pode oferecer diferentes estados de potência.
Dependendo do SSD, alguns estados priorizam:
- desempenho;
- baixo consumo;
- idle profundo.
O controlador precisa retornar desses estados quando recebe trabalho novamente.
APST é outro conceito
Em NVMe existe:
Autonomous Power State Transition — APST.
Ele está relacionado às transições de estados de energia do próprio dispositivo NVMe.
Isso não é exatamente ASPM.
ASPM versus APST
Uma comparação simples:
ASPM
link PCIe
APST
estado de energia do dispositivo NVMe
Um SSD pode participar de ambos.
Isso explica por que “desativar economia PCIe” nem sempre resolve NVMe
O problema pode estar no estado interno do SSD.
Ou o contrário.
Pode estar no link.
Ou na interação entre:
ASPM + APST + firmware + driver + plataforma
Diagnóstico exige separar as camadas.
Sintomas que justificam investigar gerenciamento de energia
Não são provas, mas pistas:
- NVMe some depois de idle;
- dispositivo volta apenas após reiniciar;
- problema depois de suspensão;
- falha durante retomada;
- placa de rede PCIe perde comunicação;
- erros surgem quando computador fica parado;
- sistema é estável sob carga, mas não em idle.
Também existem muitas outras causas
Um SSD que desaparece pode ter:
- defeito;
- superaquecimento;
- firmware problemático;
- mau contato;
- alimentação;
- slot;
- placa-mãe;
- driver.
Não culpe ASPM antes de investigar.
Event Viewer pode fornecer pistas
O Visualizador de Eventos do Windows pode registrar erros relacionados a:
- armazenamento;
- controladores;
- PCIe;
- WHEA;
- reinicializações.
Mas um evento isolado não deve ser interpretado sem contexto.
WHEA merece atenção especial
WHEA significa:
Windows Hardware Error Architecture.
Ela permite ao Windows trabalhar com informações relacionadas a erros de hardware reportados pela plataforma.
Dependendo do problema, podemos encontrar eventos relacionados a componentes PCI Express.
WHEA não significa automaticamente CPU quebrada
Muitas pessoas veem:
WHEA
e imediatamente concluem:
“processador com defeito.”
WHEA cobre diferentes classes de erros de hardware.
Precisamos analisar o conteúdo específico do evento.
PCI Express Root Port pode aparecer
Em alguns erros relacionados à hierarquia PCIe, podemos encontrar referências a:
PCI Express Root Port
Isso aponta para a topologia PCIe, mas ainda precisamos descobrir qual dispositivo e qual condição estão envolvidos.
Root Port não é necessariamente o dispositivo defeituoso
Imagine:
CPU/chipset
↓
Root Port
↓
dispositivo
O erro pode aparecer associado ao caminho de comunicação.
Isso não prova que o Root Port físico está quebrado.
AER é outro conceito importante
PCI Express possui mecanismos de relatório de erros, como:
Advanced Error Reporting — AER.
Eles ajudam a identificar determinadas condições de erro no barramento.
Essa área pode aparecer em diagnósticos avançados de problemas PCIe.
Erro corrigido é diferente de erro fatal
Algumas condições podem ser corrigidas ou recuperadas sem derrubar o sistema.
Outras podem provocar consequências maiores.
Portanto, apenas contar eventos não basta.
Precisamos saber:
- tipo;
- frequência;
- dispositivo;
- momento;
- impacto.
Correlação temporal ajuda novamente
Imagine:
14:02 → computador entra em idle
14:07 → dispositivo falha
14:07 → evento PCIe
14:08 → NVMe desaparece
Isso é muito mais interessante do que encontrar um evento isolado de três meses atrás.
Reliability Monitor também pode ajudar
Abra:
perfmon /rel
O Monitor de Confiabilidade organiza falhas ao longo do tempo.
Ele pode ajudar a correlacionar:
- travamentos;
- falhas de hardware;
- atualizações;
- drivers;
- aplicativos.
Device Manager pode mostrar estado do dispositivo
No Gerenciador de Dispositivos podemos investigar:
- dispositivo;
- driver;
- versão;
- eventos;
- propriedades.
Mas a ausência de um triângulo amarelo não garante que nunca houve falha transitória.
Driver de chipset merece atenção
O sistema operacional precisa compreender corretamente a plataforma.
Drivers e componentes relacionados ao chipset podem participar do gerenciamento de energia e da comunicação com dispositivos.
Use pacotes apropriados ao fabricante da plataforma e do equipamento.
Firmware da placa-mãe também importa
UEFI pode conter:
- correções;
- compatibilidade;
- inicialização PCIe;
- gerenciamento de energia;
- ajustes para dispositivos.
Se existe um problema conhecido corrigido por uma atualização, firmware pode ser relevante.
Mas novamente:
não atualize BIOS aleatoriamente.
Firmware do SSD também pode importar
Controladores NVMe possuem firmware próprio.
Fabricantes podem corrigir:
- compatibilidade;
- gerenciamento de energia;
- estabilidade;
- comportamento térmico;
- bugs específicos.
Por isso, dois SSDs NVMe diferentes no mesmo slot podem se comportar de maneira diferente.
Um teste A/B é extremamente útil
Imagine:
Configuração A
Link State Power Management habilitado.
Problema ocorre repetidamente.
Configuração B
Link State Power Management desabilitado.
Problema não ocorre durante o mesmo tipo de uso.
Isso cria evidência.
Depois precisamos confirmar
Não basta testar por dez minutos.
Se o problema acontecia uma vez por semana, ficar quinze minutos sem erro não prova nada.
O período de teste precisa ser compatível com a frequência histórica da falha.
Controle outras variáveis
Durante o teste, evite simultaneamente:
- atualizar driver;
- atualizar BIOS;
- trocar SSD;
- mudar plano de energia;
- trocar RAM.
Caso contrário, você não saberá qual mudança alterou o comportamento.
Uma variável por vez
Esse princípio apareceu no nosso artigo sobre BIOS e vale perfeitamente aqui.
alteração
↓
observação
↓
resultado
↓
comparação
Diagnóstico técnico depende disso.
Desabilitar ASPM permanentemente é solução?
Depende do diagnóstico.
Se uma incompatibilidade específica foi confirmada e não existe correção melhor disponível, uma alteração de política pode ser utilizada como workaround em alguns cenários.
Mas primeiro procure a causa.
Talvez exista:
- firmware corrigido;
- driver atualizado;
- BIOS corrigida;
- problema físico;
- SSD defeituoso.
Em notebook existe uma desvantagem evidente
Desativar mecanismos de economia pode aumentar:
- consumo;
- temperatura em idle;
- uso da bateria.
Por isso, uma configuração aceitável em desktop pode ser ruim para notebook.
“Economia máxima” também não é automaticamente melhor
Mais economia pode significar transições mais profundas ou políticas mais agressivas.
Em hardware corretamente implementado isso deve funcionar.
Mas em diagnóstico de incompatibilidade, comparar políticas pode fornecer pistas.
Não copie ajustes de “otimização gamer”
Existem muitos guias recomendando desativar:
- ASPM;
- C-States;
- suspensão;
- economia USB;
- gerenciamento de energia;
- vários serviços;
para supostamente aumentar FPS.
Esse tipo de alteração em massa destrói a capacidade de diagnosticar.
O computador moderno foi projetado para mudar de estado
Economia de energia não é um defeito.
O desafio aparece quando uma combinação específica apresenta incompatibilidade ou falha.
O objetivo não deve ser:
“desativar toda economia possível.”
O objetivo deve ser:
“descobrir qual transição provoca a falha.”
ASPM e suspensão são a mesma coisa?
Não.
Suspensão é um estado mais amplo do sistema.
ASPM trabalha com links PCI Express.
Mas durante mudanças de estado do sistema, vários dispositivos também alteram suas condições de energia.
Por isso os dois assuntos podem aparecer juntos no diagnóstico.
E Modern Standby?
Modern Standby envolve outra arquitetura de gerenciamento de energia do sistema.
Não é sinônimo de ASPM.
Uma máquina pode possuir vários mecanismos simultâneos:
estado do sistema
estado da CPU
estado do link PCIe
estado do dispositivo
Entender essas camadas é essencial.
Um mapa simplificado
Podemos pensar:
Sistema
Suspensão / Modern Standby
CPU
C-States e outros mecanismos
PCI Express
ASPM
NVMe
Estados de energia / APST
Dispositivo
Firmware e gerenciamento próprio
Uma falha de retomada pode envolver interação entre várias dessas camadas.
Por que isso torna o diagnóstico difícil?
Porque alterar uma camada pode mascarar problema de outra.
Por exemplo:
desativar ASPM mantém o link mais ativo.
O SSD deixa de apresentar falha.
Mas isso ainda não nos diz se a origem era:
- link;
- firmware do SSD;
- driver;
- plataforma.
Precisamos continuar investigando.
O erro pode desaparecer após reiniciar
Isso também faz sentido.
Uma reinicialização pode:
- reinicializar dispositivo;
- reconstruir estado do driver;
- restabelecer link;
- limpar condição transitória.
Por isso, “voltou depois de reiniciar” não significa necessariamente problema do Windows.
Desligar completamente pode produzir resultado diferente
Em alguns casos, um desligamento completo e nova energização pode reinicializar hardware de maneira diferente de uma simples retomada.
Essa comparação também pode fornecer pistas.
E o Fast Startup?
Inicialização Rápida do Windows adiciona outra variável ao diagnóstico de desligamento/inicialização.
Se um problema só desaparece depois de uma reinicialização, mas não depois de desligar e ligar, vale investigar a diferença entre esses caminhos.
Mas isso é outro mecanismo e não deve ser confundido diretamente com ASPM.
O grande ensinamento
ASPM mostra uma característica importante dos computadores modernos:
um hardware pode falhar não apenas quando trabalha demais, mas também quando tenta trabalhar menos.
O desafio está nas transições.
Um computador que passa em stress test não está automaticamente livre de problemas relacionados a:
- idle;
- suspensão;
- retomada;
- estados de energia;
- gerenciamento PCIe.
Como diagnosticar ASPM no Windows 11: energia do PCIe, WHEA, NVMe e testes A/B
Na primeira parte entendemos que ASPM não é simplesmente um recurso que “desliga dispositivos”.
Ele gerencia estados de energia do link PCI Express.
Também vimos uma distinção essencial:
ASPM → link PCIe
enquanto:
APST → estados de energia do dispositivo NVMe
Agora podemos partir para uma pergunta prática:
como investigar se uma falha realmente possui alguma relação com as transições de energia do PCIe?
O objetivo não é encontrar a configuração ASPM e simplesmente desativá-la.
O objetivo é construir evidências.
Primeiro: descreva exatamente o defeito
Evite começar com:
“meu PCIe está com problema.”
Registre o comportamento real.
Por exemplo:
O computador funciona normalmente durante uso intenso, mas depois de aproximadamente 20 minutos parado o SSD secundário deixa de responder. Depois de reiniciar, ele volta.
Essa descrição é muito mais útil.
Ela contém:
- condição anterior;
- período;
- carga;
- dispositivo;
- sintoma;
- método de recuperação.
Outro exemplo
A placa de rede funciona normalmente enquanto existe tráfego, mas ocasionalmente perde comunicação depois de longos períodos de idle.
Isso não prova ASPM.
Mas justifica investigar gerenciamento de energia.
Monte uma linha do tempo
Um diagnóstico pode começar assim:
18:30 — computador iniciado
18:40 — teste de carga normal
19:10 — sistema deixado parado
19:35 — dispositivo deixa de responder
19:36 — evento registrado
19:40 — reinicialização
19:42 — dispositivo volta
Agora temos algo que podemos comparar com os logs.
O horário exato é extremamente importante
Visualizador de Eventos e Monitor de Confiabilidade armazenam grande quantidade de informação.
Sem saber quando o problema aconteceu, podemos encontrar dezenas de eventos irrelevantes.
Sempre registre aproximadamente:
quando ocorreu a falha.
Comece pelo Monitor de Confiabilidade
No Windows 11, pressione:
Win + R
e execute:
perfmon /rel
O Monitor de Confiabilidade mostra uma linha do tempo visual.
Procure eventos próximos do horário da falha.
Podemos encontrar:
- falhas do Windows;
- falhas de aplicativos;
- falhas de hardware;
- instalações;
- atualizações.
O Monitor de Confiabilidade não substitui o Event Viewer
Ele serve como excelente ponto de partida.
Depois podemos aprofundar no:
Visualizador de Eventos.
Abrindo o Visualizador de Eventos
Pressione:
Win + R
e execute:
eventvwr.msc
Um dos locais mais importantes para começar é:
Logs do Windows
↓
Sistema
Ali encontramos eventos de diversos componentes.
Não filtre apenas por “Erro”
Esse é um erro comum.
Informações relevantes podem aparecer como:
- Crítico;
- Erro;
- Aviso;
- Informação.
O contexto temporal costuma ser mais importante do que simplesmente procurar tudo que está vermelho.
Procure o conjunto de eventos ao redor da falha
Se o problema ocorreu às:
19:35
analise alguns minutos antes e depois.
Talvez encontremos uma sequência:
19:34 — dispositivo apresenta timeout
19:35 — controlador registra erro
19:35 — dispositivo é reinicializado
19:36 — aplicativo falha
Isso conta uma história.
WHEA pode aparecer
WHEA significa:
Windows Hardware Error Architecture.
No Event Viewer, eventos relacionados podem aparecer através do:
WHEA-Logger
Eles merecem investigação quando o problema envolve hardware ou comunicação PCIe.
Mas não diagnostique apenas pelo nome WHEA
O evento precisa ser aberto.
Observe informações como:
- tipo de erro;
- componente;
- origem;
- dispositivo;
- barramento;
- severidade.
Dependendo do evento, os campos disponíveis podem variar.
“PCI Express Root Port” é uma pista
Em alguns eventos podemos encontrar referência a um componente semelhante a:
PCI Express Root Port
Isso indica que a hierarquia PCIe participa do erro reportado.
Mas ainda não sabemos automaticamente qual peça trocar.
O que é Root Port?
Podemos simplificar assim:
CPU ou chipset
↓
PCIe Root Port
↓
link PCIe
↓
dispositivo
O Root Port funciona como parte da estrutura que conecta o dispositivo ao restante da plataforma.
Um erro no Root Port não significa necessariamente placa-mãe defeituosa
O evento pode refletir uma condição observada naquele caminho.
Precisamos descobrir o dispositivo abaixo daquele Root Port.
Pode ser:
- SSD NVMe;
- placa Wi-Fi;
- placa de rede;
- outro controlador.
Como descobrir qual dispositivo está ligado ali?
O Gerenciador de Dispositivos ajuda a visualizar relações de hardware.
Abra:
devmgmt.msc
Depois utilize:
Exibir
↓
Dispositivos por conexão
Essa visualização pode ajudar a entender a hierarquia.
“Dispositivos por conexão” é subestimado
Normalmente usamos o Gerenciador de Dispositivos por categoria:
Adaptadores de vídeo
Adaptadores de rede
Unidades de disco
Mas a visualização por conexão ajuda a enxergar:
Root
↓
PCI Express
↓
controlador
↓
dispositivo
Isso pode ser muito útil.
Hardware IDs também ajudam
Nas propriedades de um dispositivo:
Detalhes
↓
IDs de Hardware
podemos encontrar identificadores PCI.
Eles podem incluir informações como:
VEN
e:
DEV
que representam fornecedor e dispositivo.
Não altere IDs
Eles servem para identificação.
Não tente modificar entradas do Registro ou INF apenas porque encontrou um identificador.
O objetivo agora é mapear hardware.
PowerShell também pode ajudar na identificação
Para listar dispositivos Plug and Play, podemos utilizar:
Get-PnpDevice
Por exemplo:
Get-PnpDevice -PresentOnly
Isso ajuda a observar os dispositivos atualmente presentes.
PnPUtil também é útil
O Windows oferece:
pnputil
que pode fornecer informações sobre dispositivos e drivers.
Dependendo da versão do Windows 11, os parâmetros disponíveis podem variar.
Use:
pnputil /?
para verificar as opções presentes naquele sistema.
Não precisamos instalar ferramenta para tudo
Antes de baixar utilitários aleatórios, explore:
- Device Manager;
- Event Viewer;
- Reliability Monitor;
- PowerShell;
- PnPUtil.
O próprio Windows oferece bastante informação.
Agora vamos ao plano de energia
Dependendo da configuração do Windows e do hardware, as opções avançadas de energia podem apresentar:
PCI Express
↓
Gerenciamento de energia do estado do link
Essa configuração controla a política relacionada à economia de energia do link PCI Express.
Onde encontrar?
Uma forma tradicional é acessar:
Painel de Controle
↓
Opções de Energia
↓
Alterar configurações do plano
↓
Alterar configurações de energia avançadas
Depois procure:
PCI Express
A opção pode não aparecer
Nem toda instalação, plataforma ou configuração expõe exatamente as mesmas opções na interface.
Isso é especialmente importante em notebooks modernos.
Não conclua que o Windows está corrompido simplesmente porque determinada opção de um tutorial não aparece.
Existem diferentes políticas
Quando disponíveis, normalmente encontramos conceitos equivalentes a:
Desativado
Economia de energia moderada
Economia máxima
Os nomes podem variar conforme idioma e versão.
Como usar isso como teste?
Suponha que o computador apresente uma falha reproduzível depois de idle.
Primeiro registre a configuração atual.
Por exemplo:
Estado inicial: Economia máxima
Depois altere apenas:
Link State Power Management → Desativado
E repita o mesmo cenário.
Não mude mais nada
Durante esse teste, evite:
- atualizar BIOS;
- trocar driver;
- trocar SSD;
- alterar C-States;
- desativar suspensão;
- mudar Fast Startup.
Queremos saber o efeito de uma variável.
Teste A/B
Podemos montar:
| Teste | Link State | Resultado |
|---|---|---|
| A | Economia máxima | Falhou após idle |
| B | Desativado | Não falhou |
| A2 | Economia máxima | Falhou novamente |
Esse padrão é muito mais convincente.
Repetir o teste aumenta a confiança
Se:
A falha
B funciona
A falha novamente
temos uma correlação forte.
Ainda não temos necessariamente a causa física exata.
Mas temos uma excelente pista.
O teste precisa durar tempo suficiente
Se a falha acontece uma vez a cada dois dias, um teste de dez minutos não serve.
Registre:
- tempo médio até falha;
- quantidade de ocorrências;
- condição do computador.
Compare energia AC e bateria em notebooks
Notebooks podem utilizar políticas diferentes:
Na bateria
e:
Conectado à tomada
Isso cria um experimento interessante.
Se a falha acontece somente na bateria, políticas de economia mais agressivas ganham relevância.
Mas bateria também muda outras coisas
Um notebook pode reduzir:
- potência da CPU;
- potência da GPU;
- brilho;
- atividade em segundo plano;
- políticas de dispositivo.
Portanto:
falha somente na bateria
não prova ASPM.
É apenas mais uma pista.
Use powercfg para investigar energia
O Windows possui a ferramenta:
powercfg
Ela oferece vários recursos relacionados ao gerenciamento de energia.
Para consultar os comandos disponíveis na instalação:
powercfg /?
powercfg /a
Um comando útil é:
powercfg /a
Ele mostra os estados de suspensão disponíveis naquele computador.
Isso ajuda a entender a arquitetura de energia do sistema.
Por que isso importa?
Porque dois computadores com Windows 11 podem utilizar modelos de suspensão diferentes.
Então um procedimento que funciona em um desktop tradicional pode não se aplicar exatamente da mesma forma a um notebook com Modern Standby.
powercfg /sleepstudy
Em sistemas compatíveis com Modern Standby, o Windows pode oferecer:
powercfg /sleepstudy
Esse relatório é voltado para análise do comportamento durante Modern Standby.
Não é um “detector de ASPM”, mas pode fornecer contexto importante em problemas relacionados à suspensão e consumo.
powercfg /systemsleepdiagnostics
Outra ferramenta disponível em determinadas versões/configurações é:
powercfg /systemsleepdiagnostics
Ela pode gerar informações relacionadas às transições de suspensão do sistema.
Novamente:
isso analisa um cenário mais amplo que ASPM.
Não confunda relatório de energia com prova
Um relatório pode mostrar comportamento anormal, mas ainda precisamos correlacioná-lo com:
- dispositivo;
- horário;
- driver;
- eventos;
- sintomas.
Agora vamos separar ASPM de NVMe APST
Esse é um dos pontos mais importantes do diagnóstico.
Imagine um SSD NVMe que desaparece depois de idle.
Existem pelo menos duas transições relevantes:
Link
PCIe ASPM
Dispositivo
NVMe Power States / APST
Se alterarmos apenas a política PCIe e o problema muda, aprendemos algo.
Mas ainda pode existir interação com o firmware do SSD.
O que é APST novamente?
Autonomous Power State Transition
permite que um dispositivo NVMe faça transições entre estados de energia conforme políticas apropriadas.
Esses estados pertencem ao controlador NVMe.
Um SSD pode possuir vários estados
Conceitualmente:
PS0
PS1
PS2
PS3
PS4
A quantidade e características dependem do dispositivo.
Estados mais profundos podem consumir menos energia e apresentar maior latência de retorno.
Nem todo estado é necessariamente operacional
A especificação NVMe diferencia características dos estados de potência.
Alguns podem ser adequados para operação, enquanto outros representam condições de baixo consumo mais profundas.
O firmware do SSD define suas capacidades.
Por que firmware ruim pode causar problemas?
Se o controlador entra em um estado profundo e não retorna corretamente, podemos observar sintomas como:
- timeout;
- dispositivo indisponível;
- congelamento;
- recuperação do controlador.
Isso é apenas um exemplo conceitual.
Não conclua que qualquer timeout significa firmware ruim.
Atualização de firmware do SSD pode ser relevante
Fabricantes de SSDs podem disponibilizar utilitários oficiais para:
- verificar firmware;
- atualizar firmware;
- visualizar saúde;
- executar diagnósticos.
Se existe correção documentada para estabilidade ou energia, isso merece atenção.
Use somente firmware correto
Nunca tente instalar firmware de:
- outro modelo;
- outra revisão;
- outro fabricante.
Firmware incorreto pode inutilizar o dispositivo.
Faça backup antes de intervenções importantes
Se o SSD apresenta instabilidade, trate os dados como prioridade.
Antes de testes agressivos ou atualizações:
garanta backup dos arquivos importantes.
Diagnóstico nunca deve colocar os dados em segundo plano.
SMART pode estar perfeito e ainda existir problema
Um SSD pode apresentar indicadores SMART aparentemente normais e ainda ter:
- bug de firmware;
- incompatibilidade;
- problema de controlador;
- timeout PCIe;
- falha intermitente.
SMART é uma fonte de informação, não um certificado absoluto.
Temperatura também precisa ser descartada
Imagine:
SSD some depois de 30 minutos
Pode parecer gerenciamento de energia.
Mas talvez ele esteja aquecendo.
Registre temperatura antes da falha.
Porém idle e temperatura contam histórias diferentes
Se o problema ocorre apenas depois que o SSD esfria e entra em baixo consumo, gerenciamento de energia fica mais interessante.
Se ocorre apenas durante cópia pesada e alta temperatura, investigamos outra direção.
Teste de carga versus idle
Um experimento útil:
Teste 1
Carga contínua no dispositivo.
Teste 2
Longo período de idle.
Se:
carga → estável
idle → falha
isso merece investigação de transições.
Mas não force carga só para impedir economia permanentemente
Usar um programa para manter SSD ou GPU ocupados continuamente não é solução.
Serve, no máximo, como experimento controlado.
PCIe possui gerações diferentes
Também podemos ter:
PCIe 3.0
PCIe 4.0
PCIe 5.0
Problemas de integridade de sinal podem aparecer em determinadas combinações de geração, placa e dispositivo.
Isso constitui outra variável.
Forçar uma geração PCIe inferior pode ser teste?
Em algumas placas, a UEFI permite escolher a geração do link.
Por exemplo:
Auto
Gen4
Gen3
Isso pode ser útil em diagnósticos específicos.
Mas não mude junto com ASPM no mesmo teste.
Exemplo de diagnóstico ruim
Usuário faz:
ASPM OFF
Gen4 → Gen3
BIOS update
driver update
Tudo simultaneamente.
Problema desaparece.
Conclusão:
“ASPM era o defeito.”
Não podemos concluir isso.
Exemplo de diagnóstico melhor
Primeiro:
ASPM OFF
Teste.
Depois, se necessário:
ASPM volta ao original
Gen4 → Gen3
Novo teste.
Agora conseguimos comparar.
Se Gen3 resolve e Gen4 falha
A investigação muda.
Podemos estar diante de:
- integridade de sinal;
- riser;
- slot;
- placa;
- dispositivo;
- firmware;
- compatibilidade.
Isso não é automaticamente ASPM.
Riser PCIe merece atenção
Computadores com montagem vertical de GPU podem utilizar riser.
Um riser inadequado ou problemático pode gerar erros que parecem software.
Especialmente quando:
placa PCIe 4.0
riser inadequado
entram na combinação.
SSD M.2 também depende do contato físico
Um NVMe instável pode ter:
- encaixe incorreto;
- parafuso inadequado;
- flexão;
- contato ruim;
- slot problemático.
Antes de culpar gerenciamento de energia, verifique o básico.
Chipset pode estar no caminho
Um SSD ligado ao chipset possui uma topologia diferente de um SSD diretamente ligado às lanes da CPU.
Se a placa possui vários slots M.2, testar outro slot pode fornecer evidência.
Mas trocar slot também muda a topologia
Isso é importante.
Se o problema desaparece no segundo slot, não significa automaticamente que o primeiro está quebrado.
Talvez o segundo esteja ligado:
- diretamente à CPU;
- a outro Root Port;
- a outra quantidade de lanes.
Consulte o diagrama da placa.
O manual da placa-mãe volta a ser essencial
Procure informações como:
- M.2_1;
- M.2_2;
- CPU lanes;
- chipset lanes;
- compartilhamento SATA;
- PCIe generation.
O manual frequentemente explica detalhes que o Windows não consegue mostrar de maneira óbvia.
Latência também entra na discussão
Estados mais profundos economizam mais energia, mas podem exigir mais tempo para retorno.
Em hardware funcionando corretamente, isso faz parte do projeto.
Não interprete qualquer microssegundo adicional como “lag”.
Não use DPC latency como prova direta de ASPM
Ferramentas de latência podem ajudar em outros diagnósticos, mas uma leitura alta não prova que ASPM seja culpado.
Precisamos correlacionar a pilha completa.
Drivers podem influenciar o comportamento
Atualizações de:
- chipset;
- armazenamento;
- rede;
- GPU;
podem modificar como dispositivos participam do gerenciamento de energia.
Por isso, registre versões.
Device Manager possui opções de energia em alguns dispositivos
Em determinadas placas de rede, por exemplo, encontramos:
Permitir que o computador desligue este dispositivo para economizar energia.
Isso não é exatamente ASPM.
É outra política de gerenciamento de energia.
Não desative tudo de uma vez
Se você desativa:
- ASPM;
- economia da placa de rede;
- suspensão seletiva USB;
- C-States;
e o problema desaparece, perdeu a oportunidade de descobrir qual mecanismo estava envolvido.
A palavra correta é isolamento
Nosso objetivo é:
isolar a variável.
Esse é o princípio que transforma tentativa e erro em diagnóstico.
Roteiro inicial para suspeita de ASPM
- Defina exatamente o sintoma.
- Registre horário.
- Consulte Reliability Monitor.
- Consulte Event Viewer.
- Procure WHEA e eventos do dispositivo.
- Identifique a topologia no Device Manager.
- Registre driver e firmware.
- Verifique temperatura.
- Registre política de energia atual.
- Altere apenas Link State Power Management.
- Repita o cenário.
- Compare.
Se o problema desaparecer
Não pare imediatamente.
Faça o teste inverso quando for seguro:
ASPM original
↓
problema volta?
Se sim, a correlação fica mais forte.
Se o problema continuar
Isso também é informação.
Podemos reduzir a prioridade de ASPM e investigar:
- APST;
- firmware;
- temperatura;
- hardware;
- driver;
- slot;
- alimentação.
Se o computador reinicia durante o teste
Veja se existe:
- BugCheck;
- WHEA;
- Kernel-Power;
- dump.
Kernel-Power 41 sozinho não identifica a causa.
Ele informa que o Windows detectou uma inicialização após encerramento não esperado.
Se houver tela azul, preserve o dump
Um BSOD pode fornecer informação muito mais útil do que simplesmente desativar recursos.
Arquivos de dump podem apontar para:
- driver;
- hardware;
- subsistema;
- código de parada.
Não use limpadores que apagam logs durante o diagnóstico
Event Viewer, dumps e histórico de confiabilidade são evidências.
Apagá-los antes de investigar elimina informações valiosas.
WHEA, AER e erros PCIe: como separar economia de energia de defeito físico
Na parte anterior vimos como criar um teste A/B para ASPM e como correlacionar falhas com Event Viewer, Monitor de Confiabilidade e Gerenciador de Dispositivos.
Agora vamos aprofundar a parte que costuma assustar mais:
eventos WHEA relacionados ao PCI Express.
Muitos usuários encontram algo como:
WHEA-Logger
PCI Express Root Port
Corrected Hardware Error
e concluem imediatamente:
“a placa-mãe está com defeito.”
Essa conclusão pode estar errada.
WHEA é uma camada de relatório de erros de hardware.
Ela informa que a plataforma detectou uma condição anormal, mas precisamos interpretar:
- onde aconteceu;
- qual tipo de erro;
- se foi corrigido;
- se foi recorrente;
- se existe impacto real.
O que é WHEA?
WHEA significa:
Windows Hardware Error Architecture.
Ela fornece uma infraestrutura para o Windows receber e registrar informações de erros reportados pelo hardware e firmware.
Isso pode envolver diferentes componentes.
Por exemplo:
- processador;
- memória;
- PCI Express;
- cache;
- interconexões.
WHEA não é sinônimo de CPU com defeito
Esse é um dos mitos mais comuns.
Existem eventos WHEA relacionados a CPU, mas também existem erros associados a PCIe.
Por isso, precisamos abrir o evento e observar seus detalhes.
O que é AER?
PCI Express possui um mecanismo chamado:
Advanced Error Reporting — AER.
Ele permite reportar diferentes tipos de erros do link PCIe.
Isso ajuda o sistema a distinguir condições que podem ser:
- corrigíveis;
- não fatais;
- fatais.
Erro corrigido não significa necessariamente falha grave
Imagine que o sistema detecte um erro de comunicação e consiga recuperar automaticamente.
O usuário pode nem perceber.
O Windows ainda pode registrar o evento.
Esse tipo de erro pode ser classificado como corrigido dependendo da condição.
Um evento corrigido isolado merece contexto
Se existe:
1 evento em vários meses
e o computador funciona normalmente, isso é diferente de:
milhares de eventos por hora
acompanhados de travamentos.
Frequência importa.
Contagem crescente é uma pista
Se os eventos começam a aparecer repetidamente durante:
- idle;
- suspensão;
- retomada;
isso pode fortalecer uma hipótese ligada a estados de energia.
Se surgem apenas sob carga intensa, a direção pode ser outra.
O que é Bus, Device e Function?
Dispositivos PCIe possuem endereçamento dentro da hierarquia PCI.
Podemos encontrar referências a:
Bus
Device
Function
Esses valores ajudam a identificar onde o dispositivo está conectado.
BDF
Técnicos costumam resumir isso como:
BDF — Bus.Function
Por exemplo, conceitualmente:
03:00.0
Isso pode ajudar a correlacionar o evento com o dispositivo real.
Windows e outras ferramentas podem mostrar esses dados
Dependendo da ferramenta, podemos encontrar:
- localização;
- caminho de instância;
- IDs PCI;
- barramento.
Essas informações ajudam a descobrir se o erro vem de:
- NVMe;
- GPU;
- placa Wi-Fi;
- controladora.
Root Port pode aparecer no evento
Como vimos antes, o Root Port representa parte da hierarquia que conecta o dispositivo ao restante da plataforma.
O evento pode apontar para o Root Port porque foi ali que o erro foi observado.
Isso não significa necessariamente:
“troque a placa-mãe.”
O dispositivo abaixo do Root Port pode ser o verdadeiro interessado
Exemplo:
Root Port
↓
SSD NVMe
Se os erros aparecem apenas quando esse SSD está instalado, ele entra na investigação.
Mas o problema também pode estar no caminho
Outras possibilidades incluem:
- slot;
- sinal;
- riser;
- alimentação;
- firmware;
- compatibilidade.
Por isso, precisamos testar.
PCIe Gen4 e Gen5 aumentam a exigência de integridade de sinal
Quanto maior a velocidade do link, maior a sensibilidade a problemas de sinal.
Isso não significa que PCIe 4.0 ou 5.0 sejam instáveis.
Significa que implementação física importa muito.
O que é integridade de sinal?
Simplificando, é a capacidade de transmitir dados corretamente através do caminho elétrico.
Esse caminho inclui:
- trilhas da placa;
- conectores;
- slot;
- dispositivo;
- riser, se houver.
Um link pode renegociar ou apresentar erros
Se existe problema físico ou elétrico, o sistema pode:
- registrar erros corrigidos;
- reduzir estabilidade;
- perder dispositivo;
- travar.
Isso pode parecer software.
Forçar Gen3 pode ajudar no diagnóstico
Se a placa oferece:
Auto
Gen5
Gen4
Gen3
podemos comparar.
Exemplo:
Gen4 → erros
Gen3 → estável
Isso sugere que velocidade do link participa do problema.
Mas isso não significa ASPM
Esse é o ponto-chave.
Se reduzir a geração resolve, a investigação se desloca para:
- integridade de sinal;
- riser;
- slot;
- dispositivo;
- placa-mãe.
ASPM pode não ser a causa.
ASPM e geração PCIe são variáveis diferentes
Nunca altere:
ASPM
e:
Gen4 → Gen3
ao mesmo tempo durante um teste diagnóstico.
Você perde a capacidade de saber qual alteração importou.
Riser PCIe pode ser um grande vilão
Montagens com GPU vertical frequentemente utilizam cabos riser.
Um riser projetado para uma geração inferior pode apresentar problemas em velocidades superiores.
Sintoma típico
A GPU funciona em:
Gen3
mas apresenta instabilidade em:
Gen4
Isso pode indicar limitação do caminho físico.
SSD M.2 também depende da qualidade do caminho
Embora não use riser na maioria dos casos, um SSD M.2 depende de:
- slot;
- contato;
- trilhas;
- montagem;
- alimentação;
- temperatura.
Parafuso apertado demais também pode ser problema?
Em situações extremas, montagem incorreta pode gerar tensão mecânica.
O SSD deve ficar corretamente assentado e fixado, sem flexão excessiva.
Dissipador também merece atenção
Alguns heatsinks M.2 utilizam thermal pads.
Se mal posicionados, podem:
- pressionar excessivamente;
- deixar controlador sem contato térmico;
- interferir na montagem.
Temperatura pode imitar instabilidade PCIe
Um SSD superaquecendo pode:
- reduzir desempenho;
- aumentar latência;
- eventualmente apresentar comportamento anormal.
Por isso, monitore temperatura.
ASPM costuma estar mais ligado a idle
Uma pista conceitual:
falha em idle
→ energia ganha prioridade.
falha sob carga
→ térmica, sinal, alimentação e estabilidade entram mais forte.
Mas não é uma regra absoluta.
Cenário 1 — NVMe falha apenas depois de 20 minutos parado
Temos:
- carga normal;
- temperatura baixa;
- falha após idle;
- volta depois de reiniciar.
Hipóteses fortes:
- APST;
- ASPM;
- firmware;
- driver.
Cenário 2 — NVMe falha durante benchmark pesado
Agora olhamos mais para:
- temperatura;
- controlador;
- alimentação;
- slot;
- integridade de sinal.
Cenário 3 — erros WHEA aparecem quando ativa Gen4
Se:
Gen3 estável
e:
Gen4 gera eventos
isso aponta mais para caminho PCIe do que para ASPM puro.
Cenário 4 — erros aparecem apenas com Link State Power Management máximo
Agora a relação com estados de energia fica mais interessante.
Um teste A/B pode confirmar a correlação.
Cenário 5 — erro acontece só após suspensão
Nesse caso, precisamos investigar:
- estado do sistema;
- driver;
- ASPM;
- estado do dispositivo;
- firmware.
Retomada envolve várias camadas.
Não confunda suspensão com idle simples
Idle:
computador ligado e ativo
Suspensão:
estado do sistema
São condições diferentes.
Modern Standby pode complicar ainda mais
Em equipamentos compatíveis, Modern Standby mantém uma arquitetura diferente de suspensão tradicional.
Isso pode envolver:
- atividade de rede;
- dispositivos;
- estados de energia sofisticados.
Como saber se o sistema usa Modern Standby?
Execute:
powercfg /a
Observe os estados disponíveis.
Se aparecer algo relacionado a:
Standby (S0 Low Power Idle)
o sistema utiliza arquitetura Modern Standby.
S0 Low Power Idle não é ASPM
Mas ASPM pode participar do funcionamento energético dos dispositivos durante esse estado.
É uma camada dentro de outra.
WHEA pode aparecer como consequência, não causa
Imagine:
dispositivo falha
↓
link registra erro
↓
WHEA grava evento
O WHEA apenas registrou a condição.
Ele não criou o problema.
Kernel-Power também é consequência
Se o computador reinicia depois de uma falha PCIe, podemos encontrar:
Kernel-Power 41
Isso não prova fonte defeituosa.
Ele apenas mostra que o Windows detectou desligamento ou reinicialização inesperada.
O mesmo vale para Event ID isolado
Nunca diagnostique peça usando apenas:
Event ID 17
Event ID 41
ou outro número sem contexto.
O conteúdo completo importa.
Events 17 e 19 podem aparecer em contextos WHEA
Dependendo da versão do Windows e do tipo de erro, determinados IDs podem representar eventos corrigidos ou outras condições.
Não use apenas o número como diagnóstico.
Leia:
- fonte;
- componente;
- texto;
- horário.
Como correlacionar BDF com dispositivo
Uma estratégia:
- abra o evento WHEA;
- anote localização PCI;
- abra Device Manager;
- use Dispositivos por conexão;
- compare IDs de hardware;
- identifique o componente.
HWiNFO pode ajudar em diagnósticos avançados
Ferramentas de inventário podem mostrar a hierarquia PCIe e velocidade negociada.
Elas podem ajudar a confirmar:
- largura x4/x8/x16;
- geração;
- dispositivo;
- temperatura.
Mas não substituem o diagnóstico.
GPU-Z também pode ajudar para GPU
Para placa de vídeo, utilitários apropriados podem mostrar:
- PCIe x16;
- geração;
- link ativo.
Isso ajuda a verificar se o link está negociando como esperado.
Link reduzido em idle pode ser normal
Esse é outro ponto importante.
Uma GPU pode mostrar:
PCIe x16 4.0
sob carga e uma condição reduzida em idle.
Isso pode fazer parte da economia de energia.
Não conclua defeito só porque o valor muda.
Coloque carga antes de comparar
Algumas ferramentas possuem um pequeno teste de renderização justamente para ativar a GPU e observar a negociação real do link.
NVMe também pode negociar geração e largura
Um SSD anunciado como:
PCIe 4.0 x4
pode operar abaixo disso se:
- slot for Gen3;
- slot tiver menos lanes;
- plataforma limitar;
- BIOS configurar diferente.
Isso pode ser normal por projeto
Sempre consulte a especificação da placa-mãe.
Erros corrigidos podem surgir por cabo/riser ruim
Se a GPU usa riser:
GPU direta no slot → sem erro
GPU via riser → erro
essa comparação é poderosa.
Outro teste: mover o SSD
Se a placa possui dois slots M.2:
M2_1 → falha
M2_2 → estável
isso é uma pista.
Mas lembre:
os slots podem usar caminhos diferentes.
Pode haver compartilhamento de lanes
Um slot M.2 pode desabilitar:
- portas SATA;
- outro slot;
- parte de um PCIe.
Isso faz parte da topologia.
Manual é obrigatório
Procure notas como:
When M2_2 is populated...
Essas observações são essenciais.
ASPM pode ser configurado também na UEFI
Algumas placas oferecem opções específicas de PCIe ASPM dentro da BIOS/UEFI.
Os nomes variam.
Não altere sem documentar o estado inicial.
Windows e UEFI podem interagir
Dependendo da plataforma, firmware e sistema operacional participam do gerenciamento de energia.
Então a política final pode resultar da combinação das duas camadas.
Não existe uma chave universal de Registro segura
Evite tutoriais que prometem:
“adicione este DWORD e desative ASPM para sempre.”
Isso pode depender de versão, hardware e implementação.
Prefira configurações documentadas e reversíveis.
powercfg pode mostrar o plano atual
Use:
powercfg /getactivescheme
Isso ajuda a registrar qual plano estava ativo durante os testes.
Também podemos listar esquemas
Use:
powercfg /list
Assim fica mais fácil comparar.
Não troque de plano junto com ASPM
Mudar de:
Equilibrado
para:
Alto desempenho
pode alterar várias políticas simultaneamente.
Se o objetivo é testar ASPM, altere apenas o parâmetro relevante.
Alto desempenho não é ferramenta de diagnóstico perfeita
Ele modifica muito mais que PCIe.
Se o problema some, não sabemos qual política causou a mudança.
Um teste melhor
Mantenha:
plano Equilibrado
e altere apenas:
Link State Power Management
Isso isola melhor a variável.
E se a opção não aparecer?
Não force alterações no Registro imediatamente.
Primeiro investigue:
- plataforma;
- Modern Standby;
- políticas OEM;
- driver;
- BIOS.
Alguns sistemas ocultam certas opções intencionalmente.
Notebooks OEM merecem cuidado
Fabricantes podem aplicar políticas próprias.
Utilitários como:
- Lenovo Vantage;
- Dell Power Manager;
- MyASUS;
- HP Support Assistant;
podem influenciar gerenciamento de energia.
Isso não significa desinstalar tudo
A ideia é entender se o fabricante fornece:
- perfis térmicos;
- energia;
- drivers;
- firmware.
Driver genérico versus OEM
Em alguns notebooks, o driver oficial do fabricante pode incluir ajustes específicos para a plataforma.
Nem sempre o driver mais novo disponível em outro lugar é automaticamente melhor.
Firmware de SSD OEM também pode diferir
Um SSD fornecido pelo fabricante do notebook pode ter firmware personalizado.
Tenha cuidado ao usar ferramentas genéricas.
Cenário realista: notebook com NVMe que some após suspensão
Roteiro:
- verificar backup;
- registrar firmware do SSD;
- registrar BIOS;
- verificar
powercfg /a; - analisar Event Viewer;
- procurar WHEA;
- testar suspensão repetidamente;
- atualizar componentes documentados;
- comparar política de energia;
- confirmar estabilidade.
Cenário realista: desktop com placa Wi-Fi PCIe instável
Se a conexão desaparece depois de idle:
- veja driver;
- política de energia da placa;
- ASPM;
- slot;
- eventos PCIe.
Não culpe o roteador antes de verificar se o adaptador realmente deixou de responder.
Cenário realista: placa de captura desconecta
Placas PCIe especializadas também podem apresentar incompatibilidades de energia.
Nesse caso:
- firmware;
- driver;
- ASPM;
- slot;
- chipset;
podem participar.
Cenário realista: GPU registra erros PCIe
Se existe:
- WHEA;
- riser;
- Gen4;
- montagem vertical;
teste a GPU diretamente no slot.
Isso pode economizar horas.
Re-seat pode fazer parte do diagnóstico
Reinstalar fisicamente o dispositivo pode resolver:
- contato inadequado;
- encaixe parcial.
Mas faça com o equipamento devidamente desligado.
Limpeza de contatos exige cuidado
Não utilize produtos inadequados.
Em muitos casos, apenas remover e reinstalar corretamente já é suficiente para testar contato.
Alimentação também entra na equação
GPU e alguns dispositivos dependem de alimentação adicional.
Problemas de cabo ou conector podem causar sintomas que parecem PCIe.
NVMe recebe energia pelo próprio slot
Isso torna a alimentação mais dependente da placa e do slot.
Problemas na linha de alimentação podem causar instabilidade.
ASPM reduz consumo, mas não conserta alimentação
Se existe falha elétrica real, mudar política pode apenas alterar a frequência do problema.
O teste reversível é essencial
Sempre que possível:
A → falha
B → estável
A novamente → falha
Esse padrão aumenta muito a qualidade do diagnóstico.
Quando parar de testar e trocar hardware?
Quando existem evidências consistentes de defeito físico.
Por exemplo:
- dispositivo falha em várias máquinas;
- outro dispositivo funciona perfeitamente no mesmo slot;
- firmware atualizado;
- políticas testadas;
- erros persistem.
Teste cruzado é poderoso
Se possível:
SSD suspeito em outro PC
ou:
SSD conhecido no mesmo slot
Isso ajuda a separar:
dispositivo
de:
plataforma.
Mas nem todo usuário possui outro PC
Nesse caso, use as evidências disponíveis:
- logs;
- A/B;
- slots;
- firmware;
- estabilidade.
Não descarte dados importantes durante diagnóstico
Se armazenamento é suspeito, backup vem primeiro.
Nunca faça dezenas de testes em SSD instável antes de proteger os arquivos.
O que ASPM realmente nos ensina
Ele mostra que o diagnóstico moderno precisa considerar:
estado.
Não basta perguntar:
“o componente funciona?”
Precisamos perguntar:
“em qual estado ele falha?”
Pode ser:
- carga;
- idle;
- suspensão;
- retomada;
- Gen4;
- Gen3;
- bateria;
- tomada.
Essas condições revelam padrões.
Fluxo completo de diagnóstico, quando desativar ASPM, FAQ e conclusão
Depois de entender como funcionam ASPM, estados L0/L1, APST, WHEA, AER, Root Ports, gerações PCIe e testes A/B, podemos organizar tudo em um procedimento prático.
O objetivo é responder uma pergunta simples:
quando uma falha realmente merece investigação de gerenciamento de energia PCIe?
E, principalmente:
quando é melhor parar de mexer em ASPM e procurar outra causa?
Comece pelo sintoma, não pela configuração
Antes de alterar qualquer política de energia, descreva o defeito.
Exemplo ruim:
“acho que ASPM está bugado.”
Exemplo melhor:
SSD secundário funciona normalmente durante uso intenso, mas desaparece depois de aproximadamente 30 minutos sem atividade e volta após reiniciar o computador.
Esse segundo formato já cria uma hipótese testável.
Passo 1 — Identifique em qual condição a falha aparece
Pergunte:
- acontece sob carga?
- acontece em idle?
- acontece depois de suspensão?
- acontece apenas na bateria?
- acontece apenas conectado à tomada?
- acontece somente em PCIe Gen4 ou Gen5?
- desaparece depois de reiniciar?
Essas condições são extremamente importantes.
Passo 2 — Identifique o dispositivo
Descubra se o problema envolve:
- NVMe;
- GPU;
- Wi-Fi;
- placa de rede;
- controladora;
- placa de captura;
- outro dispositivo PCIe.
Não diagnostique o barramento inteiro quando existe apenas um dispositivo suspeito.
Passo 3 — Registre o horário da falha
Depois consulte:
perfmon /rel
e:
eventvwr.msc
Procure eventos exatamente no período em que o problema aconteceu.
Passo 4 — Procure evidências relacionadas
Observe:
- WHEA-Logger;
- erros de armazenamento;
- timeouts;
- reset de dispositivo;
- eventos PCIe;
- falhas de driver.
Um evento isolado não basta.
Busque uma sequência coerente.
Passo 5 — Verifique o básico antes de ASPM
Antes de entrar em gerenciamento de energia, confira:
- encaixe;
- temperatura;
- firmware;
- driver;
- slot;
- alimentação;
- cabos;
- riser.
Um mau contato pode produzir sintomas tão estranhos quanto uma falha de energia.
Passo 6 — Faça backup se armazenamento estiver envolvido
Se um SSD apresenta desaparecimentos ou timeouts, proteja os arquivos importantes antes de continuar.
Diagnóstico vem depois da segurança dos dados.
Passo 7 — Registre a configuração atual
Anote:
- plano de energia;
- Link State Power Management;
- versão da BIOS;
- driver;
- firmware do dispositivo;
- geração PCIe;
- slot utilizado.
Sem registro, você pode se perder depois de várias alterações.
Passo 8 — Faça um único teste A/B
Mantenha tudo igual e altere apenas:
PCI Express
↓
Gerenciamento de energia do estado do link
↓
Desativado
Depois reproduza o mesmo cenário.
Passo 9 — Compare o resultado
Se o problema continua exatamente igual, ASPM perde prioridade.
Se desaparece, a relação com transições de energia fica mais interessante.
Passo 10 — Faça o teste inverso
Quando for seguro:
ASPM original
↓
falha retorna?
Se sim, a correlação se fortalece.
Quando deixar ASPM desativado pode fazer sentido?
Em determinadas situações, pode funcionar como workaround.
Por exemplo:
- falha reproduzível;
- desativar ASPM elimina o problema;
- firmware e drivers estão atualizados;
- não existe correção melhor disponível;
- impacto energético é aceitável.
Ainda assim, documente a alteração.
Em notebook, pense duas vezes
Desabilitar gerenciamento de energia pode aumentar:
- consumo em idle;
- temperatura;
- drenagem de bateria.
Por isso, o custo pode ser maior em portátil.
Em desktop, o impacto pode ser menos perceptível
Mas isso não significa que devemos desativar sem necessidade.
Mecanismos modernos de energia existem por um motivo.
ASPM desativado não corrige necessariamente o defeito
Pode apenas impedir a condição que o dispara.
A causa real ainda pode estar em:
- firmware;
- driver;
- dispositivo;
- placa-mãe;
- sinal.
Quando procurar atualização de firmware?
Quando existe documentação ou versão mais nova relacionada a:
- compatibilidade;
- estabilidade;
- gerenciamento de energia;
- PCIe;
- NVMe.
Use sempre fonte oficial do fabricante.
Quando procurar driver?
Se a falha envolve:
- rede;
- controladora;
- GPU;
- chipset;
vale comparar a versão instalada com a recomendada para a plataforma.
Quando testar outra geração PCIe?
Se existem erros persistentes e a plataforma permite:
Gen4 → Gen3
ou:
Gen5 → Gen4
faça isso como teste separado.
Nunca junto com ASPM.
Se reduzir geração resolve
A suspeita migra para:
- integridade de sinal;
- riser;
- slot;
- dispositivo;
- placa.
Não conclua que o Windows é o culpado.
Quando testar outro slot?
Se existem vários slots compatíveis.
Isso pode ajudar a separar:
dispositivo
de:
caminho PCIe.
Mas consulte o manual, porque a topologia pode mudar.
Quando testar outro dispositivo?
Se possível:
SSD suspeito → outro PC
ou:
SSD conhecido → mesmo slot
Esse teste cruzado é muito valioso.
Quando suspeitar mais do próprio NVMe?
Quando temos:
- timeouts;
- desaparecimento;
- falha em diferentes slots;
- firmware atualizado;
- comportamento semelhante em outra máquina.
Nesse cenário, o dispositivo ganha prioridade.
Quando suspeitar mais da placa-mãe?
Quando:
- vários dispositivos falham no mesmo slot;
- outro slot funciona;
- eventos apontam repetidamente para aquele caminho;
- problema persiste com dispositivos diferentes.
Quando suspeitar de riser?
Especialmente quando:
GPU direta → funciona
GPU via riser → falha
ou quando Gen3 funciona e Gen4 falha.
Quando ASPM provavelmente não é a causa principal?
Se o defeito acontece:
- apenas sob alta temperatura;
- apenas sob carga máxima;
- em qualquer estado de energia;
- com sinais físicos claros;
- mesmo com ASPM desativado.
Nesse caso, outras hipóteses ficam mais fortes.
Não confunda economia com defeito
ASPM é parte normal do PCI Express.
Não existe motivo para tratar o recurso como algo nocivo por padrão.
O problema está na compatibilidade, não no conceito
Quando existe falha, normalmente investigamos a interação entre:
- hardware;
- firmware;
- driver;
- plataforma.
ASPM melhora FPS?
Não existe regra que diga que desativar ASPM aumenta desempenho perceptivelmente.
Em muitos computadores, a diferença prática é irrelevante para jogos.
Pode aumentar latência?
Estados de economia possuem tempos de transição.
Isso faz parte do projeto.
Em cenários extremamente sensíveis, políticas podem influenciar latência, mas não é correto transformar isso em recomendação universal.
“Alto desempenho” desativa ASPM?
Pode alterar políticas, mas o comportamento depende do plano e da plataforma.
Não use isso como substituto de teste isolado.
O plano Equilibrado é ruim?
Não.
Ele é projetado para equilibrar desempenho e consumo.
Desativar todas as economias deixa o PC mais estável?
Não necessariamente.
Você pode apenas:
- aumentar consumo;
- elevar temperatura;
- mascarar o defeito.
Fluxograma rápido de diagnóstico
Falha PCIe
↓
Acontece só em idle/suspensão?
Se não:
→ investigue carga, temperatura, sinal e hardware.
Se sim:
↓
Existem eventos WHEA ou timeout?
Se sim:
↓
Dispositivo identificado?
↓
Firmware e driver atualizados?
↓
Temperatura normal?
↓
Teste ASPM OFF
↓
Problema continua?
Sim:
→ investigue APST, hardware, slot e firmware.
Não:
→ relação com transição de energia ganha força.
↓
Reativar ASPM reproduz falha?
Sim:
→ correlação forte.
FAQ — dúvidas frequentes sobre PCIe ASPM
1. O que é ASPM?
Active State Power Management é um mecanismo de economia de energia do link PCI Express.
2. ASPM desliga o SSD?
Não exatamente.
Ele atua no link PCIe. O SSD possui também seus próprios estados de energia.
3. O que é L0?
É o estado ativo normal do link PCIe.
4. O que é L1?
É um estado de economia de energia do link.
5. O que são L1.1 e L1.2?
São subestados de economia mais profunda utilizados em plataformas compatíveis.
6. ASPM e APST são a mesma coisa?
Não.
ASPM gerencia o link PCIe. APST está ligado aos estados do dispositivo NVMe.
7. ASPM pode fazer um NVMe desaparecer?
Uma incompatibilidade relacionada a transições de energia pode contribuir para esse tipo de sintoma, mas existem muitas outras causas.
8. Desativar ASPM é seguro?
Como teste diagnóstico, pode ser útil. Pode aumentar consumo, especialmente em notebook.
9. Devo deixar desativado permanentemente?
Somente se houver motivo claro e o workaround for necessário.
10. ASPM reduz desempenho?
Em condições normais, ele foi projetado para economizar energia durante períodos de baixa atividade sem comprometer o funcionamento normal.
11. Desativar ASPM aumenta FPS?
Não é uma regra e normalmente não deve ser usado como “otimização gamer”.
12. ASPM é igual a C-State?
Não.
C-States pertencem à CPU.
13. ASPM é igual à suspensão?
Não.
Suspensão é um estado do sistema.
14. O que é Link State Power Management?
É a configuração do Windows relacionada à política de energia do link PCI Express.
15. Por que essa opção não aparece no meu Windows?
A disponibilidade depende da plataforma, políticas e arquitetura de energia.
16. O que é WHEA?
Windows Hardware Error Architecture é a infraestrutura usada pelo Windows para registrar determinados erros de hardware.
17. WHEA significa CPU ruim?
Não.
Pode envolver vários componentes, inclusive PCIe.
18. O que significa PCI Express Root Port?
É parte da hierarquia que conecta dispositivos PCIe ao restante da plataforma.
19. Root Port com erro significa placa-mãe defeituosa?
Não automaticamente.
Precisamos identificar o dispositivo e o contexto.
20. O que é AER?
Advanced Error Reporting é um mecanismo do PCI Express para reportar erros de comunicação.
21. Erros corrigidos são graves?
Depende da frequência e do impacto. Um evento isolado pode ter significado muito diferente de milhares recorrentes.
22. PCIe Gen4 pode ser menos estável que Gen3?
Hardware compatível deve funcionar corretamente em Gen4. Se Gen3 funciona e Gen4 falha, investigue integridade de sinal e compatibilidade.
23. Um riser pode causar WHEA?
Sim, se introduzir problemas de sinal ou compatibilidade.
24. SSD quente pode parecer problema de ASPM?
Pode gerar sintomas que confundem o diagnóstico.
25. SMART perfeito garante SSD saudável?
Não.
SMART não cobre todas as possíveis falhas.
26. Posso atualizar firmware do SSD?
Sim, quando existe atualização oficial apropriada para o modelo. Faça backup antes.
27. BIOS pode corrigir problemas PCIe?
Pode existir firmware com correções de compatibilidade, mas atualização não deve ser feita aleatoriamente.
28. Posso mudar ASPM pela BIOS?
Algumas placas oferecem opções relacionadas. Depende do modelo.
29. Devo usar hacks de Registro?
Evite alterações não documentadas. Prefira métodos reversíveis e suportados.
30. Como saber se o problema é ASPM?
A melhor evidência vem de um teste reproduzível:
ASPM ativo → falha
ASPM desativado → estável
ASPM ativo novamente → falha
Mesmo assim, ainda investigue firmware e hardware.
Checklist final
Antes de culpar ASPM, confirme:
- sintoma reproduzível;
- horário da falha;
- logs;
- dispositivo correto;
- temperatura;
- firmware;
- driver;
- encaixe;
- slot;
- topologia;
- geração PCIe.
Depois faça apenas um teste de energia por vez.
Conclusão
PCIe ASPM é um excelente exemplo de como o diagnóstico de computadores modernos mudou.
Hoje um componente não precisa falhar somente quando trabalha demais.
Ele pode apresentar problema justamente durante:
- idle;
- suspensão;
- retomada;
- entrada em baixo consumo;
- saída de baixo consumo.
Por isso, um computador que passa horas em stress test ainda pode apresentar uma falha relacionada às transições de energia.
Ao mesmo tempo, ASPM não deve virar um culpado genérico.
Um erro que desaparece quando desativamos economia de energia pode envolver:
- firmware;
- driver;
- NVMe;
- slot;
- placa-mãe;
- integridade de sinal;
- compatibilidade.
O segredo está em testar de maneira controlada.
Em vez de desativar dezenas de recursos:
mude uma variável, reproduza o problema, compare e registre o resultado.
É assim que uma falha aparentemente aleatória começa a revelar um padrão.
Precisa de ajuda com falhas intermitentes de SSD, PCIe ou Windows 11?
A VMIA realiza diagnóstico de computadores Windows, SSDs, placas-mãe, drivers e problemas de estabilidade que podem aparecer somente em determinadas condições de uso ou energia.
Telefone e WhatsApp: (11) 99779-7772
Site: vmia.site
Blog técnico: vmia.com.br
Avaliações: avaliacao.vmia.com.br
Antes de trocar peças ou desativar recursos aleatoriamente, vale descobrir em qual estado o hardware realmente falha.
Faça um comentário