O que é PCIe ASPM? Entenda falhas de energia no Windows 11

PCIe ASPM no Windows 11 mostrando estados L0, L1, SSD NVMe e gerenciamento de energia do PCI Express
O PCIe ASPM reduz o consumo de energia do link PCI Express durante períodos de baixa atividade, mas problemas de compatibilidade podem aparecer durante transições entre estados de energia.
72 / 100 Pontuação de SEO

Um computador funciona perfeitamente durante um jogo pesado, passa horas executando tarefas exigentes e não apresenta qualquer sinal de instabilidade. Porém, basta deixá-lo alguns minutos parado para surgir um comportamento estranho:

  • SSD NVMe desaparece temporariamente;
  • placa de rede perde conexão;
  • dispositivo PCIe apresenta falha;
  • computador demora para retornar de um estado de economia;
  • aparecem erros relacionados a dispositivos;
  • o problema acontece depois de suspensão ou retomada;
  • a falha desaparece depois de reiniciar.

A primeira reação normalmente é procurar defeito em RAM, fonte, SSD, temperatura ou Windows.

Essas hipóteses são legítimas.

Mas existe outra área do computador que merece atenção quando o defeito parece relacionado às transições entre atividade e repouso:

PCI Express Active State Power Management, ou PCIe ASPM.

ASPM é um mecanismo de gerenciamento de energia do barramento PCI Express.

E entender seu funcionamento ajuda a explicar uma categoria particularmente difícil de defeitos:

problemas que não acontecem necessariamente quando o hardware trabalha muito, mas quando ele entra ou sai de estados de economia de energia.

Isso não significa que ASPM seja automaticamente culpado por qualquer falha de suspensão, NVMe ou PCIe.

Na realidade, esse será um dos pontos mais importantes deste artigo:

desativar ASPM e observar uma melhora é um teste diagnóstico; não é prova automática de que o Windows ou o próprio ASPM possui um defeito.

Precisamos primeiro entender o que está acontecendo.


O que é PCI Express?

Antes de explicar ASPM, precisamos entender onde ele atua.

PCI Express, normalmente abreviado como:

PCIe

é uma das principais interfaces de comunicação de alta velocidade utilizadas em computadores modernos.

Diversos componentes podem utilizar PCIe direta ou indiretamente, como:

  • placas de vídeo;
  • SSDs NVMe;
  • placas de rede;
  • controladores USB;
  • placas Wi-Fi;
  • placas de captura;
  • controladores adicionais;
  • dispositivos conectados ao chipset.

PCIe não serve apenas para a enorme placa de vídeo instalada no slot x16.

Boa parte da comunicação interna de um PC moderno depende dessa arquitetura.


O que são PCIe lanes?

Uma conexão PCIe utiliza pistas, conhecidas como:

lanes.

Podemos encontrar interfaces como:

PCIe x1

PCIe x2

PCIe x4

PCIe x8

PCIe x16

A quantidade disponível depende da plataforma e da conexão.

Um SSD NVMe, por exemplo, frequentemente utiliza uma conexão PCIe x4.

Uma GPU normalmente utiliza um slot físico x16, embora a quantidade elétrica de lanes disponível possa variar.


CPU e chipset participam dessa topologia

Nem todo dispositivo PCIe está necessariamente ligado diretamente ao processador.

Dependendo da plataforma, podemos ter:

CPU → dispositivo PCIe

ou:

CPU → chipset → dispositivo PCIe

Isso será importante mais adiante porque gerenciamento de energia não envolve apenas o dispositivo isoladamente.

Existe um:

link PCIe

entre componentes.


É justamente nesse link que ASPM entra

ASPM significa:

Active State Power Management.

De forma simplificada, ele permite reduzir o consumo de energia de um link PCI Express durante períodos de baixa atividade.

A lógica é simples.

Se determinado link não está transferindo dados o tempo inteiro, não faz sentido necessariamente mantê-lo continuamente no estado de maior atividade e consumo.

Então PCIe possui mecanismos para colocar o link em estados de menor consumo.


Pense em ASPM como gerenciamento do link

Esse detalhe evita uma confusão muito comum.

ASPM não significa simplesmente:

“desligar o SSD.”

Ele está relacionado ao gerenciamento de energia do link PCI Express.

O dispositivo pode possuir seus próprios estados de energia, mas isso constitui outra camada.


Link e dispositivo não são exatamente a mesma coisa

Imagine um SSD NVMe.

Temos, simplificando:

CPU/chipset

link PCIe

controlador NVMe

memória NAND

ASPM atua no gerenciamento de energia do link PCIe.

O próprio SSD também pode possuir mecanismos internos de economia.

Essas duas coisas podem trabalhar em conjunto, mas não são sinônimos.


Quais são os estados do link PCIe?

Para entender ASPM, precisamos conhecer alguns estados importantes.

Um link PCIe pode operar em diferentes condições.

Entre os conceitos mais conhecidos estão:

L0

L0s

L1

Além deles, versões mais modernas da especificação possuem mecanismos e subestados adicionais relacionados à economia de energia.


O que é L0?

L0 representa o estado normal de operação ativa do link.

É onde esperamos que a comunicação ocorra normalmente.

Podemos pensar:

L0 = link ativo

Isso não significa necessariamente que o dispositivo esteja utilizando 100% de sua capacidade.

Significa que o link está em seu estado operacional ativo.


O que é L0s?

L0s é um estado de economia de energia mais leve.

A ideia é reduzir consumo durante períodos de inatividade relativamente curtos, mantendo uma saída rápida para retornar à atividade.

Quanto mais agressiva a economia, normalmente maior se torna a importância da latência de transição.


O que é L1?

L1 representa um estado de economia mais profundo que L0s.

O link reduz ainda mais sua atividade.

Isso pode proporcionar economia maior, mas a transição de volta ao funcionamento ativo possui requisitos próprios.


Existem subestados de L1

Em plataformas modernas podemos encontrar referências a:

L1.1

L1.2

Esses subestados permitem economias adicionais.

Eles são particularmente relevantes em equipamentos nos quais consumo em idle importa muito, como notebooks.


Quanto mais profundo o estado, maior o desafio da transição

Podemos visualizar conceitualmente:

L0

atividade maior

L0s

economia leve

L1

economia maior

L1.x

possibilidades de economia ainda mais agressiva

O objetivo é reduzir consumo sem prejudicar a experiência.


Por que economizar alguns watts importa?

Em desktop, alguns usuários podem pensar:

“Meu computador está ligado na tomada. Não preciso disso.”

Mas gerenciamento de energia possui impacto em:

  • consumo total;
  • temperatura;
  • eficiência;
  • notebooks;
  • autonomia de bateria;
  • requisitos de plataformas modernas.

Além disso, bilhões de horas de funcionamento acumuladas tornam pequenas economias relevantes em escala.


Em notebook, ASPM é ainda mais importante

Imagine manter vários links PCIe em estado de maior consumo continuamente, mesmo sem tráfego.

Isso reduziria a eficiência energética.

Por isso, sistemas móveis tendem a utilizar mecanismos agressivos de gerenciamento de energia.


Então por que ASPM poderia causar problema?

Em condições normais:

não deveria.

Hardware, firmware e drivers compatíveis devem coordenar corretamente as transições.

O problema aparece quando existe alguma incompatibilidade, falha ou implementação problemática em uma das camadas envolvidas.


O verdadeiro problema pode estar na transição

Essa é a parte interessante.

Um dispositivo pode funcionar perfeitamente enquanto permanece ativo.

O problema aparece quando ocorre:

atividade

economia

retorno à atividade

Se alguma camada não coordena essa transição corretamente, podemos observar falhas aparentemente aleatórias.


Isso explica um comportamento curioso

Imagine:

Durante jogo

GPU, CPU, SSD e outros dispositivos permanecem ativos.

O computador funciona durante três horas.

Usuário fecha o jogo

Sistema entra em idle.

Vários mecanismos de economia começam a atuar.

Alguns minutos depois

Um dispositivo apresenta erro.

A conclusão intuitiva seria:

“Se aguenta jogo pesado, hardware está perfeito.”

Não necessariamente.


Estabilidade sob carga não prova estabilidade em transições de energia

Esse princípio vale além do PCIe.

Um computador moderno muda constantemente:

  • frequência;
  • tensão;
  • estados de CPU;
  • estados de GPU;
  • estados PCIe;
  • estados de dispositivos.

O sistema não trabalha em uma condição fixa.


Por isso alguns defeitos aparecem apenas em idle

Uma máquina pode suportar:

CPU 100%

GPU 100%

e falhar quando:

CPU 2%

GPU idle

PCIe em economia

Isso parece contraditório, mas eletronicamente não é impossível.


ASPM não é C-State da CPU

Essa confusão aparece frequentemente.

ASPM

Gerencia estados de energia do link PCI Express.

C-States

Relacionam-se aos estados de inatividade da CPU.

São mecanismos diferentes.


ASPM também não é simplesmente “plano de energia”

O plano de energia do Windows pode influenciar políticas relacionadas ao gerenciamento de energia, mas ele representa uma camada de controle mais ampla.

Não confunda:

plano de energia

com:

estado físico do link PCIe.


O Windows possui uma configuração relacionada

Nas opções avançadas de energia do Windows, dependendo da plataforma e configuração, podemos encontrar:

PCI Express → Gerenciamento de energia do estado do link

Em inglês:

Link State Power Management.

Podem existir opções como:

  • Desativado;
  • Economia de energia moderada;
  • Economia máxima.

A disponibilidade e o comportamento podem variar conforme a plataforma.


O que “Desativado” significa?

De forma geral, reduz ou desabilita o uso da política de economia de energia do estado do link controlada por essa configuração.

Isso pode ser útil como teste.

Por exemplo:

problema acontece

desabilita Link State Power Management

problema desaparece

Isso cria uma pista importante.


Mas ainda não prova a causa

Talvez a falha envolva:

  • firmware do dispositivo;
  • firmware da placa-mãe;
  • driver;
  • controlador;
  • chipset;
  • estado de energia do próprio dispositivo;
  • interação entre várias camadas.

Ao impedir uma transição, podemos apenas ter evitado o cenário que dispara o defeito.


Analogia: porta que emperra

Imagine uma porta que abre normalmente, mas emperra sempre que é fechada completamente.

Manter a porta aberta evita o problema.

Mas isso não prova que:

“fechar portas é uma tecnologia defeituosa.”

O defeito pode estar:

  • na dobradiça;
  • na fechadura;
  • no alinhamento;
  • na instalação.

Com ASPM, o raciocínio é semelhante.


ASPM pode afetar desempenho?

Em uma implementação funcionando corretamente, o sistema tenta equilibrar:

  • economia;
  • latência de retorno;
  • desempenho.

Em determinadas cargas extremamente sensíveis a latência, políticas de energia podem influenciar comportamento.

Mas não devemos assumir que desativar ASPM gera automaticamente mais FPS ou torna todo computador mais rápido.


ASPM não é “modo lento do PCIe”

Esse é outro erro.

Quando o link precisa trabalhar, ele deve retornar ao estado operacional apropriado.

O mecanismo existe justamente para economizar durante inatividade.


Onde o NVMe entra nessa história?

SSDs NVMe utilizam PCI Express.

Isso faz com que existam pelo menos duas áreas de gerenciamento de energia relevantes:

  1. gerenciamento do link PCIe;
  2. gerenciamento de energia do próprio dispositivo NVMe.

Misturar essas duas áreas produz diagnósticos incorretos.


NVMe possui estados próprios de energia

Um controlador NVMe pode oferecer diferentes estados de potência.

Dependendo do SSD, alguns estados priorizam:

  • desempenho;
  • baixo consumo;
  • idle profundo.

O controlador precisa retornar desses estados quando recebe trabalho novamente.


APST é outro conceito

Em NVMe existe:

Autonomous Power State Transition — APST.

Ele está relacionado às transições de estados de energia do próprio dispositivo NVMe.

Isso não é exatamente ASPM.


ASPM versus APST

Uma comparação simples:

ASPM

link PCIe

APST

estado de energia do dispositivo NVMe

Um SSD pode participar de ambos.


Isso explica por que “desativar economia PCIe” nem sempre resolve NVMe

O problema pode estar no estado interno do SSD.

Ou o contrário.

Pode estar no link.

Ou na interação entre:

ASPM + APST + firmware + driver + plataforma

Diagnóstico exige separar as camadas.


Sintomas que justificam investigar gerenciamento de energia

Não são provas, mas pistas:

  • NVMe some depois de idle;
  • dispositivo volta apenas após reiniciar;
  • problema depois de suspensão;
  • falha durante retomada;
  • placa de rede PCIe perde comunicação;
  • erros surgem quando computador fica parado;
  • sistema é estável sob carga, mas não em idle.

Também existem muitas outras causas

Um SSD que desaparece pode ter:

  • defeito;
  • superaquecimento;
  • firmware problemático;
  • mau contato;
  • alimentação;
  • slot;
  • placa-mãe;
  • driver.

Não culpe ASPM antes de investigar.


Event Viewer pode fornecer pistas

O Visualizador de Eventos do Windows pode registrar erros relacionados a:

  • armazenamento;
  • controladores;
  • PCIe;
  • WHEA;
  • reinicializações.

Mas um evento isolado não deve ser interpretado sem contexto.


WHEA merece atenção especial

WHEA significa:

Windows Hardware Error Architecture.

Ela permite ao Windows trabalhar com informações relacionadas a erros de hardware reportados pela plataforma.

Dependendo do problema, podemos encontrar eventos relacionados a componentes PCI Express.


WHEA não significa automaticamente CPU quebrada

Muitas pessoas veem:

WHEA

e imediatamente concluem:

“processador com defeito.”

WHEA cobre diferentes classes de erros de hardware.

Precisamos analisar o conteúdo específico do evento.


PCI Express Root Port pode aparecer

Em alguns erros relacionados à hierarquia PCIe, podemos encontrar referências a:

PCI Express Root Port

Isso aponta para a topologia PCIe, mas ainda precisamos descobrir qual dispositivo e qual condição estão envolvidos.


Root Port não é necessariamente o dispositivo defeituoso

Imagine:

CPU/chipset

Root Port

dispositivo

O erro pode aparecer associado ao caminho de comunicação.

Isso não prova que o Root Port físico está quebrado.


AER é outro conceito importante

PCI Express possui mecanismos de relatório de erros, como:

Advanced Error Reporting — AER.

Eles ajudam a identificar determinadas condições de erro no barramento.

Essa área pode aparecer em diagnósticos avançados de problemas PCIe.


Erro corrigido é diferente de erro fatal

Algumas condições podem ser corrigidas ou recuperadas sem derrubar o sistema.

Outras podem provocar consequências maiores.

Portanto, apenas contar eventos não basta.

Precisamos saber:

  • tipo;
  • frequência;
  • dispositivo;
  • momento;
  • impacto.

Correlação temporal ajuda novamente

Imagine:

14:02 → computador entra em idle

14:07 → dispositivo falha

14:07 → evento PCIe

14:08 → NVMe desaparece

Isso é muito mais interessante do que encontrar um evento isolado de três meses atrás.


Reliability Monitor também pode ajudar

Abra:

perfmon /rel

O Monitor de Confiabilidade organiza falhas ao longo do tempo.

Ele pode ajudar a correlacionar:

  • travamentos;
  • falhas de hardware;
  • atualizações;
  • drivers;
  • aplicativos.

Device Manager pode mostrar estado do dispositivo

No Gerenciador de Dispositivos podemos investigar:

  • dispositivo;
  • driver;
  • versão;
  • eventos;
  • propriedades.

Mas a ausência de um triângulo amarelo não garante que nunca houve falha transitória.


Driver de chipset merece atenção

O sistema operacional precisa compreender corretamente a plataforma.

Drivers e componentes relacionados ao chipset podem participar do gerenciamento de energia e da comunicação com dispositivos.

Use pacotes apropriados ao fabricante da plataforma e do equipamento.


Firmware da placa-mãe também importa

UEFI pode conter:

  • correções;
  • compatibilidade;
  • inicialização PCIe;
  • gerenciamento de energia;
  • ajustes para dispositivos.

Se existe um problema conhecido corrigido por uma atualização, firmware pode ser relevante.

Mas novamente:

não atualize BIOS aleatoriamente.


Firmware do SSD também pode importar

Controladores NVMe possuem firmware próprio.

Fabricantes podem corrigir:

  • compatibilidade;
  • gerenciamento de energia;
  • estabilidade;
  • comportamento térmico;
  • bugs específicos.

Por isso, dois SSDs NVMe diferentes no mesmo slot podem se comportar de maneira diferente.


Um teste A/B é extremamente útil

Imagine:

Configuração A

Link State Power Management habilitado.

Problema ocorre repetidamente.

Configuração B

Link State Power Management desabilitado.

Problema não ocorre durante o mesmo tipo de uso.

Isso cria evidência.


Depois precisamos confirmar

Não basta testar por dez minutos.

Se o problema acontecia uma vez por semana, ficar quinze minutos sem erro não prova nada.

O período de teste precisa ser compatível com a frequência histórica da falha.


Controle outras variáveis

Durante o teste, evite simultaneamente:

  • atualizar driver;
  • atualizar BIOS;
  • trocar SSD;
  • mudar plano de energia;
  • trocar RAM.

Caso contrário, você não saberá qual mudança alterou o comportamento.


Uma variável por vez

Esse princípio apareceu no nosso artigo sobre BIOS e vale perfeitamente aqui.

alteração

observação

resultado

comparação

Diagnóstico técnico depende disso.


Desabilitar ASPM permanentemente é solução?

Depende do diagnóstico.

Se uma incompatibilidade específica foi confirmada e não existe correção melhor disponível, uma alteração de política pode ser utilizada como workaround em alguns cenários.

Mas primeiro procure a causa.

Talvez exista:

  • firmware corrigido;
  • driver atualizado;
  • BIOS corrigida;
  • problema físico;
  • SSD defeituoso.

Em notebook existe uma desvantagem evidente

Desativar mecanismos de economia pode aumentar:

  • consumo;
  • temperatura em idle;
  • uso da bateria.

Por isso, uma configuração aceitável em desktop pode ser ruim para notebook.


“Economia máxima” também não é automaticamente melhor

Mais economia pode significar transições mais profundas ou políticas mais agressivas.

Em hardware corretamente implementado isso deve funcionar.

Mas em diagnóstico de incompatibilidade, comparar políticas pode fornecer pistas.


Não copie ajustes de “otimização gamer”

Existem muitos guias recomendando desativar:

  • ASPM;
  • C-States;
  • suspensão;
  • economia USB;
  • gerenciamento de energia;
  • vários serviços;

para supostamente aumentar FPS.

Esse tipo de alteração em massa destrói a capacidade de diagnosticar.


O computador moderno foi projetado para mudar de estado

Economia de energia não é um defeito.

O desafio aparece quando uma combinação específica apresenta incompatibilidade ou falha.

O objetivo não deve ser:

“desativar toda economia possível.”

O objetivo deve ser:

“descobrir qual transição provoca a falha.”


ASPM e suspensão são a mesma coisa?

Não.

Suspensão é um estado mais amplo do sistema.

ASPM trabalha com links PCI Express.

Mas durante mudanças de estado do sistema, vários dispositivos também alteram suas condições de energia.

Por isso os dois assuntos podem aparecer juntos no diagnóstico.


E Modern Standby?

Modern Standby envolve outra arquitetura de gerenciamento de energia do sistema.

Não é sinônimo de ASPM.

Uma máquina pode possuir vários mecanismos simultâneos:

estado do sistema

estado da CPU

estado do link PCIe

estado do dispositivo

Entender essas camadas é essencial.


Um mapa simplificado

Podemos pensar:

Sistema

Suspensão / Modern Standby

CPU

C-States e outros mecanismos

PCI Express

ASPM

NVMe

Estados de energia / APST

Dispositivo

Firmware e gerenciamento próprio

Uma falha de retomada pode envolver interação entre várias dessas camadas.


Por que isso torna o diagnóstico difícil?

Porque alterar uma camada pode mascarar problema de outra.

Por exemplo:

desativar ASPM mantém o link mais ativo.

O SSD deixa de apresentar falha.

Mas isso ainda não nos diz se a origem era:

  • link;
  • firmware do SSD;
  • driver;
  • plataforma.

Precisamos continuar investigando.


O erro pode desaparecer após reiniciar

Isso também faz sentido.

Uma reinicialização pode:

  • reinicializar dispositivo;
  • reconstruir estado do driver;
  • restabelecer link;
  • limpar condição transitória.

Por isso, “voltou depois de reiniciar” não significa necessariamente problema do Windows.


Desligar completamente pode produzir resultado diferente

Em alguns casos, um desligamento completo e nova energização pode reinicializar hardware de maneira diferente de uma simples retomada.

Essa comparação também pode fornecer pistas.


E o Fast Startup?

Inicialização Rápida do Windows adiciona outra variável ao diagnóstico de desligamento/inicialização.

Se um problema só desaparece depois de uma reinicialização, mas não depois de desligar e ligar, vale investigar a diferença entre esses caminhos.

Mas isso é outro mecanismo e não deve ser confundido diretamente com ASPM.


O grande ensinamento

ASPM mostra uma característica importante dos computadores modernos:

um hardware pode falhar não apenas quando trabalha demais, mas também quando tenta trabalhar menos.

O desafio está nas transições.

Um computador que passa em stress test não está automaticamente livre de problemas relacionados a:

  • idle;
  • suspensão;
  • retomada;
  • estados de energia;
  • gerenciamento PCIe.

Como diagnosticar ASPM no Windows 11: energia do PCIe, WHEA, NVMe e testes A/B

Na primeira parte entendemos que ASPM não é simplesmente um recurso que “desliga dispositivos”.

Ele gerencia estados de energia do link PCI Express.

Também vimos uma distinção essencial:

ASPM → link PCIe

enquanto:

APST → estados de energia do dispositivo NVMe

Agora podemos partir para uma pergunta prática:

como investigar se uma falha realmente possui alguma relação com as transições de energia do PCIe?

O objetivo não é encontrar a configuração ASPM e simplesmente desativá-la.

O objetivo é construir evidências.


Primeiro: descreva exatamente o defeito

Evite começar com:

“meu PCIe está com problema.”

Registre o comportamento real.

Por exemplo:

O computador funciona normalmente durante uso intenso, mas depois de aproximadamente 20 minutos parado o SSD secundário deixa de responder. Depois de reiniciar, ele volta.

Essa descrição é muito mais útil.

Ela contém:

  • condição anterior;
  • período;
  • carga;
  • dispositivo;
  • sintoma;
  • método de recuperação.

Outro exemplo

A placa de rede funciona normalmente enquanto existe tráfego, mas ocasionalmente perde comunicação depois de longos períodos de idle.

Isso não prova ASPM.

Mas justifica investigar gerenciamento de energia.


Monte uma linha do tempo

Um diagnóstico pode começar assim:

18:30 — computador iniciado

18:40 — teste de carga normal

19:10 — sistema deixado parado

19:35 — dispositivo deixa de responder

19:36 — evento registrado

19:40 — reinicialização

19:42 — dispositivo volta

Agora temos algo que podemos comparar com os logs.


O horário exato é extremamente importante

Visualizador de Eventos e Monitor de Confiabilidade armazenam grande quantidade de informação.

Sem saber quando o problema aconteceu, podemos encontrar dezenas de eventos irrelevantes.

Sempre registre aproximadamente:

quando ocorreu a falha.


Comece pelo Monitor de Confiabilidade

No Windows 11, pressione:

Win + R

e execute:

perfmon /rel

O Monitor de Confiabilidade mostra uma linha do tempo visual.

Procure eventos próximos do horário da falha.

Podemos encontrar:

  • falhas do Windows;
  • falhas de aplicativos;
  • falhas de hardware;
  • instalações;
  • atualizações.

O Monitor de Confiabilidade não substitui o Event Viewer

Ele serve como excelente ponto de partida.

Depois podemos aprofundar no:

Visualizador de Eventos.


Abrindo o Visualizador de Eventos

Pressione:

Win + R

e execute:

eventvwr.msc

Um dos locais mais importantes para começar é:

Logs do Windows

Sistema

Ali encontramos eventos de diversos componentes.


Não filtre apenas por “Erro”

Esse é um erro comum.

Informações relevantes podem aparecer como:

  • Crítico;
  • Erro;
  • Aviso;
  • Informação.

O contexto temporal costuma ser mais importante do que simplesmente procurar tudo que está vermelho.


Procure o conjunto de eventos ao redor da falha

Se o problema ocorreu às:

19:35

analise alguns minutos antes e depois.

Talvez encontremos uma sequência:

19:34 — dispositivo apresenta timeout

19:35 — controlador registra erro

19:35 — dispositivo é reinicializado

19:36 — aplicativo falha

Isso conta uma história.


WHEA pode aparecer

WHEA significa:

Windows Hardware Error Architecture.

No Event Viewer, eventos relacionados podem aparecer através do:

WHEA-Logger

Eles merecem investigação quando o problema envolve hardware ou comunicação PCIe.


Mas não diagnostique apenas pelo nome WHEA

O evento precisa ser aberto.

Observe informações como:

  • tipo de erro;
  • componente;
  • origem;
  • dispositivo;
  • barramento;
  • severidade.

Dependendo do evento, os campos disponíveis podem variar.


“PCI Express Root Port” é uma pista

Em alguns eventos podemos encontrar referência a um componente semelhante a:

PCI Express Root Port

Isso indica que a hierarquia PCIe participa do erro reportado.

Mas ainda não sabemos automaticamente qual peça trocar.


O que é Root Port?

Podemos simplificar assim:

CPU ou chipset

PCIe Root Port

link PCIe

dispositivo

O Root Port funciona como parte da estrutura que conecta o dispositivo ao restante da plataforma.


Um erro no Root Port não significa necessariamente placa-mãe defeituosa

O evento pode refletir uma condição observada naquele caminho.

Precisamos descobrir o dispositivo abaixo daquele Root Port.

Pode ser:

  • SSD NVMe;
  • placa Wi-Fi;
  • placa de rede;
  • outro controlador.

Como descobrir qual dispositivo está ligado ali?

O Gerenciador de Dispositivos ajuda a visualizar relações de hardware.

Abra:

devmgmt.msc

Depois utilize:

Exibir

Dispositivos por conexão

Essa visualização pode ajudar a entender a hierarquia.


“Dispositivos por conexão” é subestimado

Normalmente usamos o Gerenciador de Dispositivos por categoria:

Adaptadores de vídeo

Adaptadores de rede

Unidades de disco

Mas a visualização por conexão ajuda a enxergar:

Root

PCI Express

controlador

dispositivo

Isso pode ser muito útil.


Hardware IDs também ajudam

Nas propriedades de um dispositivo:

Detalhes

IDs de Hardware

podemos encontrar identificadores PCI.

Eles podem incluir informações como:

VEN

e:

DEV

que representam fornecedor e dispositivo.


Não altere IDs

Eles servem para identificação.

Não tente modificar entradas do Registro ou INF apenas porque encontrou um identificador.

O objetivo agora é mapear hardware.


PowerShell também pode ajudar na identificação

Para listar dispositivos Plug and Play, podemos utilizar:

Get-PnpDevice

Por exemplo:

Get-PnpDevice -PresentOnly

Isso ajuda a observar os dispositivos atualmente presentes.


PnPUtil também é útil

O Windows oferece:

pnputil

que pode fornecer informações sobre dispositivos e drivers.

Dependendo da versão do Windows 11, os parâmetros disponíveis podem variar.

Use:

pnputil /?

para verificar as opções presentes naquele sistema.


Não precisamos instalar ferramenta para tudo

Antes de baixar utilitários aleatórios, explore:

  • Device Manager;
  • Event Viewer;
  • Reliability Monitor;
  • PowerShell;
  • PnPUtil.

O próprio Windows oferece bastante informação.


Agora vamos ao plano de energia

Dependendo da configuração do Windows e do hardware, as opções avançadas de energia podem apresentar:

PCI Express

Gerenciamento de energia do estado do link

Essa configuração controla a política relacionada à economia de energia do link PCI Express.


Onde encontrar?

Uma forma tradicional é acessar:

Painel de Controle

Opções de Energia

Alterar configurações do plano

Alterar configurações de energia avançadas

Depois procure:

PCI Express


A opção pode não aparecer

Nem toda instalação, plataforma ou configuração expõe exatamente as mesmas opções na interface.

Isso é especialmente importante em notebooks modernos.

Não conclua que o Windows está corrompido simplesmente porque determinada opção de um tutorial não aparece.


Existem diferentes políticas

Quando disponíveis, normalmente encontramos conceitos equivalentes a:

Desativado

Economia de energia moderada

Economia máxima

Os nomes podem variar conforme idioma e versão.


Como usar isso como teste?

Suponha que o computador apresente uma falha reproduzível depois de idle.

Primeiro registre a configuração atual.

Por exemplo:

Estado inicial: Economia máxima

Depois altere apenas:

Link State Power Management → Desativado

E repita o mesmo cenário.


Não mude mais nada

Durante esse teste, evite:

  • atualizar BIOS;
  • trocar driver;
  • trocar SSD;
  • alterar C-States;
  • desativar suspensão;
  • mudar Fast Startup.

Queremos saber o efeito de uma variável.


Teste A/B

Podemos montar:

TesteLink StateResultado
AEconomia máximaFalhou após idle
BDesativadoNão falhou
A2Economia máximaFalhou novamente

Esse padrão é muito mais convincente.


Repetir o teste aumenta a confiança

Se:

A falha

B funciona

A falha novamente

temos uma correlação forte.

Ainda não temos necessariamente a causa física exata.

Mas temos uma excelente pista.


O teste precisa durar tempo suficiente

Se a falha acontece uma vez a cada dois dias, um teste de dez minutos não serve.

Registre:

  • tempo médio até falha;
  • quantidade de ocorrências;
  • condição do computador.

Compare energia AC e bateria em notebooks

Notebooks podem utilizar políticas diferentes:

Na bateria

e:

Conectado à tomada

Isso cria um experimento interessante.

Se a falha acontece somente na bateria, políticas de economia mais agressivas ganham relevância.


Mas bateria também muda outras coisas

Um notebook pode reduzir:

  • potência da CPU;
  • potência da GPU;
  • brilho;
  • atividade em segundo plano;
  • políticas de dispositivo.

Portanto:

falha somente na bateria

não prova ASPM.

É apenas mais uma pista.


Use powercfg para investigar energia

O Windows possui a ferramenta:

powercfg

Ela oferece vários recursos relacionados ao gerenciamento de energia.

Para consultar os comandos disponíveis na instalação:

powercfg /?


powercfg /a

Um comando útil é:

powercfg /a

Ele mostra os estados de suspensão disponíveis naquele computador.

Isso ajuda a entender a arquitetura de energia do sistema.


Por que isso importa?

Porque dois computadores com Windows 11 podem utilizar modelos de suspensão diferentes.

Então um procedimento que funciona em um desktop tradicional pode não se aplicar exatamente da mesma forma a um notebook com Modern Standby.


powercfg /sleepstudy

Em sistemas compatíveis com Modern Standby, o Windows pode oferecer:

powercfg /sleepstudy

Esse relatório é voltado para análise do comportamento durante Modern Standby.

Não é um “detector de ASPM”, mas pode fornecer contexto importante em problemas relacionados à suspensão e consumo.


powercfg /systemsleepdiagnostics

Outra ferramenta disponível em determinadas versões/configurações é:

powercfg /systemsleepdiagnostics

Ela pode gerar informações relacionadas às transições de suspensão do sistema.

Novamente:

isso analisa um cenário mais amplo que ASPM.


Não confunda relatório de energia com prova

Um relatório pode mostrar comportamento anormal, mas ainda precisamos correlacioná-lo com:

  • dispositivo;
  • horário;
  • driver;
  • eventos;
  • sintomas.

Agora vamos separar ASPM de NVMe APST

Esse é um dos pontos mais importantes do diagnóstico.

Imagine um SSD NVMe que desaparece depois de idle.

Existem pelo menos duas transições relevantes:

Link

PCIe ASPM

Dispositivo

NVMe Power States / APST

Se alterarmos apenas a política PCIe e o problema muda, aprendemos algo.

Mas ainda pode existir interação com o firmware do SSD.


O que é APST novamente?

Autonomous Power State Transition

permite que um dispositivo NVMe faça transições entre estados de energia conforme políticas apropriadas.

Esses estados pertencem ao controlador NVMe.


Um SSD pode possuir vários estados

Conceitualmente:

PS0

PS1

PS2

PS3

PS4

A quantidade e características dependem do dispositivo.

Estados mais profundos podem consumir menos energia e apresentar maior latência de retorno.


Nem todo estado é necessariamente operacional

A especificação NVMe diferencia características dos estados de potência.

Alguns podem ser adequados para operação, enquanto outros representam condições de baixo consumo mais profundas.

O firmware do SSD define suas capacidades.


Por que firmware ruim pode causar problemas?

Se o controlador entra em um estado profundo e não retorna corretamente, podemos observar sintomas como:

  • timeout;
  • dispositivo indisponível;
  • congelamento;
  • recuperação do controlador.

Isso é apenas um exemplo conceitual.

Não conclua que qualquer timeout significa firmware ruim.


Atualização de firmware do SSD pode ser relevante

Fabricantes de SSDs podem disponibilizar utilitários oficiais para:

  • verificar firmware;
  • atualizar firmware;
  • visualizar saúde;
  • executar diagnósticos.

Se existe correção documentada para estabilidade ou energia, isso merece atenção.


Use somente firmware correto

Nunca tente instalar firmware de:

  • outro modelo;
  • outra revisão;
  • outro fabricante.

Firmware incorreto pode inutilizar o dispositivo.


Faça backup antes de intervenções importantes

Se o SSD apresenta instabilidade, trate os dados como prioridade.

Antes de testes agressivos ou atualizações:

garanta backup dos arquivos importantes.

Diagnóstico nunca deve colocar os dados em segundo plano.


SMART pode estar perfeito e ainda existir problema

Um SSD pode apresentar indicadores SMART aparentemente normais e ainda ter:

  • bug de firmware;
  • incompatibilidade;
  • problema de controlador;
  • timeout PCIe;
  • falha intermitente.

SMART é uma fonte de informação, não um certificado absoluto.


Temperatura também precisa ser descartada

Imagine:

SSD some depois de 30 minutos

Pode parecer gerenciamento de energia.

Mas talvez ele esteja aquecendo.

Registre temperatura antes da falha.


Porém idle e temperatura contam histórias diferentes

Se o problema ocorre apenas depois que o SSD esfria e entra em baixo consumo, gerenciamento de energia fica mais interessante.

Se ocorre apenas durante cópia pesada e alta temperatura, investigamos outra direção.


Teste de carga versus idle

Um experimento útil:

Teste 1

Carga contínua no dispositivo.

Teste 2

Longo período de idle.

Se:

carga → estável

idle → falha

isso merece investigação de transições.


Mas não force carga só para impedir economia permanentemente

Usar um programa para manter SSD ou GPU ocupados continuamente não é solução.

Serve, no máximo, como experimento controlado.


PCIe possui gerações diferentes

Também podemos ter:

PCIe 3.0

PCIe 4.0

PCIe 5.0

Problemas de integridade de sinal podem aparecer em determinadas combinações de geração, placa e dispositivo.

Isso constitui outra variável.


Forçar uma geração PCIe inferior pode ser teste?

Em algumas placas, a UEFI permite escolher a geração do link.

Por exemplo:

Auto

Gen4

Gen3

Isso pode ser útil em diagnósticos específicos.

Mas não mude junto com ASPM no mesmo teste.


Exemplo de diagnóstico ruim

Usuário faz:

ASPM OFF

Gen4 → Gen3

BIOS update

driver update

Tudo simultaneamente.

Problema desaparece.

Conclusão:

“ASPM era o defeito.”

Não podemos concluir isso.


Exemplo de diagnóstico melhor

Primeiro:

ASPM OFF

Teste.

Depois, se necessário:

ASPM volta ao original

Gen4 → Gen3

Novo teste.

Agora conseguimos comparar.


Se Gen3 resolve e Gen4 falha

A investigação muda.

Podemos estar diante de:

  • integridade de sinal;
  • riser;
  • slot;
  • placa;
  • dispositivo;
  • firmware;
  • compatibilidade.

Isso não é automaticamente ASPM.


Riser PCIe merece atenção

Computadores com montagem vertical de GPU podem utilizar riser.

Um riser inadequado ou problemático pode gerar erros que parecem software.

Especialmente quando:

placa PCIe 4.0

riser inadequado

entram na combinação.


SSD M.2 também depende do contato físico

Um NVMe instável pode ter:

  • encaixe incorreto;
  • parafuso inadequado;
  • flexão;
  • contato ruim;
  • slot problemático.

Antes de culpar gerenciamento de energia, verifique o básico.


Chipset pode estar no caminho

Um SSD ligado ao chipset possui uma topologia diferente de um SSD diretamente ligado às lanes da CPU.

Se a placa possui vários slots M.2, testar outro slot pode fornecer evidência.


Mas trocar slot também muda a topologia

Isso é importante.

Se o problema desaparece no segundo slot, não significa automaticamente que o primeiro está quebrado.

Talvez o segundo esteja ligado:

  • diretamente à CPU;
  • a outro Root Port;
  • a outra quantidade de lanes.

Consulte o diagrama da placa.


O manual da placa-mãe volta a ser essencial

Procure informações como:

  • M.2_1;
  • M.2_2;
  • CPU lanes;
  • chipset lanes;
  • compartilhamento SATA;
  • PCIe generation.

O manual frequentemente explica detalhes que o Windows não consegue mostrar de maneira óbvia.


Latência também entra na discussão

Estados mais profundos economizam mais energia, mas podem exigir mais tempo para retorno.

Em hardware funcionando corretamente, isso faz parte do projeto.

Não interprete qualquer microssegundo adicional como “lag”.


Não use DPC latency como prova direta de ASPM

Ferramentas de latência podem ajudar em outros diagnósticos, mas uma leitura alta não prova que ASPM seja culpado.

Precisamos correlacionar a pilha completa.


Drivers podem influenciar o comportamento

Atualizações de:

  • chipset;
  • armazenamento;
  • rede;
  • GPU;

podem modificar como dispositivos participam do gerenciamento de energia.

Por isso, registre versões.


Device Manager possui opções de energia em alguns dispositivos

Em determinadas placas de rede, por exemplo, encontramos:

Permitir que o computador desligue este dispositivo para economizar energia.

Isso não é exatamente ASPM.

É outra política de gerenciamento de energia.


Não desative tudo de uma vez

Se você desativa:

  • ASPM;
  • economia da placa de rede;
  • suspensão seletiva USB;
  • C-States;

e o problema desaparece, perdeu a oportunidade de descobrir qual mecanismo estava envolvido.


A palavra correta é isolamento

Nosso objetivo é:

isolar a variável.

Esse é o princípio que transforma tentativa e erro em diagnóstico.


Roteiro inicial para suspeita de ASPM

  1. Defina exatamente o sintoma.
  2. Registre horário.
  3. Consulte Reliability Monitor.
  4. Consulte Event Viewer.
  5. Procure WHEA e eventos do dispositivo.
  6. Identifique a topologia no Device Manager.
  7. Registre driver e firmware.
  8. Verifique temperatura.
  9. Registre política de energia atual.
  10. Altere apenas Link State Power Management.
  11. Repita o cenário.
  12. Compare.

Se o problema desaparecer

Não pare imediatamente.

Faça o teste inverso quando for seguro:

ASPM original

problema volta?

Se sim, a correlação fica mais forte.


Se o problema continuar

Isso também é informação.

Podemos reduzir a prioridade de ASPM e investigar:

  • APST;
  • firmware;
  • temperatura;
  • hardware;
  • driver;
  • slot;
  • alimentação.

Se o computador reinicia durante o teste

Veja se existe:

  • BugCheck;
  • WHEA;
  • Kernel-Power;
  • dump.

Kernel-Power 41 sozinho não identifica a causa.

Ele informa que o Windows detectou uma inicialização após encerramento não esperado.


Se houver tela azul, preserve o dump

Um BSOD pode fornecer informação muito mais útil do que simplesmente desativar recursos.

Arquivos de dump podem apontar para:

  • driver;
  • hardware;
  • subsistema;
  • código de parada.

Não use limpadores que apagam logs durante o diagnóstico

Event Viewer, dumps e histórico de confiabilidade são evidências.

Apagá-los antes de investigar elimina informações valiosas.

WHEA, AER e erros PCIe: como separar economia de energia de defeito físico

Na parte anterior vimos como criar um teste A/B para ASPM e como correlacionar falhas com Event Viewer, Monitor de Confiabilidade e Gerenciador de Dispositivos.

Agora vamos aprofundar a parte que costuma assustar mais:

eventos WHEA relacionados ao PCI Express.

Muitos usuários encontram algo como:

WHEA-Logger

PCI Express Root Port

Corrected Hardware Error

e concluem imediatamente:

“a placa-mãe está com defeito.”

Essa conclusão pode estar errada.

WHEA é uma camada de relatório de erros de hardware.

Ela informa que a plataforma detectou uma condição anormal, mas precisamos interpretar:

  • onde aconteceu;
  • qual tipo de erro;
  • se foi corrigido;
  • se foi recorrente;
  • se existe impacto real.

O que é WHEA?

WHEA significa:

Windows Hardware Error Architecture.

Ela fornece uma infraestrutura para o Windows receber e registrar informações de erros reportados pelo hardware e firmware.

Isso pode envolver diferentes componentes.

Por exemplo:

  • processador;
  • memória;
  • PCI Express;
  • cache;
  • interconexões.

WHEA não é sinônimo de CPU com defeito

Esse é um dos mitos mais comuns.

Existem eventos WHEA relacionados a CPU, mas também existem erros associados a PCIe.

Por isso, precisamos abrir o evento e observar seus detalhes.


O que é AER?

PCI Express possui um mecanismo chamado:

Advanced Error Reporting — AER.

Ele permite reportar diferentes tipos de erros do link PCIe.

Isso ajuda o sistema a distinguir condições que podem ser:

  • corrigíveis;
  • não fatais;
  • fatais.

Erro corrigido não significa necessariamente falha grave

Imagine que o sistema detecte um erro de comunicação e consiga recuperar automaticamente.

O usuário pode nem perceber.

O Windows ainda pode registrar o evento.

Esse tipo de erro pode ser classificado como corrigido dependendo da condição.


Um evento corrigido isolado merece contexto

Se existe:

1 evento em vários meses

e o computador funciona normalmente, isso é diferente de:

milhares de eventos por hora

acompanhados de travamentos.

Frequência importa.


Contagem crescente é uma pista

Se os eventos começam a aparecer repetidamente durante:

  • idle;
  • suspensão;
  • retomada;

isso pode fortalecer uma hipótese ligada a estados de energia.

Se surgem apenas sob carga intensa, a direção pode ser outra.


O que é Bus, Device e Function?

Dispositivos PCIe possuem endereçamento dentro da hierarquia PCI.

Podemos encontrar referências a:

Bus

Device

Function

Esses valores ajudam a identificar onde o dispositivo está conectado.


BDF

Técnicos costumam resumir isso como:

BDF — Bus.Function

Por exemplo, conceitualmente:

03:00.0

Isso pode ajudar a correlacionar o evento com o dispositivo real.


Windows e outras ferramentas podem mostrar esses dados

Dependendo da ferramenta, podemos encontrar:

  • localização;
  • caminho de instância;
  • IDs PCI;
  • barramento.

Essas informações ajudam a descobrir se o erro vem de:

  • NVMe;
  • GPU;
  • placa Wi-Fi;
  • controladora.

Root Port pode aparecer no evento

Como vimos antes, o Root Port representa parte da hierarquia que conecta o dispositivo ao restante da plataforma.

O evento pode apontar para o Root Port porque foi ali que o erro foi observado.

Isso não significa necessariamente:

“troque a placa-mãe.”


O dispositivo abaixo do Root Port pode ser o verdadeiro interessado

Exemplo:

Root Port

SSD NVMe

Se os erros aparecem apenas quando esse SSD está instalado, ele entra na investigação.


Mas o problema também pode estar no caminho

Outras possibilidades incluem:

  • slot;
  • sinal;
  • riser;
  • alimentação;
  • firmware;
  • compatibilidade.

Por isso, precisamos testar.


PCIe Gen4 e Gen5 aumentam a exigência de integridade de sinal

Quanto maior a velocidade do link, maior a sensibilidade a problemas de sinal.

Isso não significa que PCIe 4.0 ou 5.0 sejam instáveis.

Significa que implementação física importa muito.


O que é integridade de sinal?

Simplificando, é a capacidade de transmitir dados corretamente através do caminho elétrico.

Esse caminho inclui:

  • trilhas da placa;
  • conectores;
  • slot;
  • dispositivo;
  • riser, se houver.

Um link pode renegociar ou apresentar erros

Se existe problema físico ou elétrico, o sistema pode:

  • registrar erros corrigidos;
  • reduzir estabilidade;
  • perder dispositivo;
  • travar.

Isso pode parecer software.


Forçar Gen3 pode ajudar no diagnóstico

Se a placa oferece:

Auto

Gen5

Gen4

Gen3

podemos comparar.

Exemplo:

Gen4 → erros

Gen3 → estável

Isso sugere que velocidade do link participa do problema.


Mas isso não significa ASPM

Esse é o ponto-chave.

Se reduzir a geração resolve, a investigação se desloca para:

  • integridade de sinal;
  • riser;
  • slot;
  • dispositivo;
  • placa-mãe.

ASPM pode não ser a causa.


ASPM e geração PCIe são variáveis diferentes

Nunca altere:

ASPM

e:

Gen4 → Gen3

ao mesmo tempo durante um teste diagnóstico.

Você perde a capacidade de saber qual alteração importou.


Riser PCIe pode ser um grande vilão

Montagens com GPU vertical frequentemente utilizam cabos riser.

Um riser projetado para uma geração inferior pode apresentar problemas em velocidades superiores.


Sintoma típico

A GPU funciona em:

Gen3

mas apresenta instabilidade em:

Gen4

Isso pode indicar limitação do caminho físico.


SSD M.2 também depende da qualidade do caminho

Embora não use riser na maioria dos casos, um SSD M.2 depende de:

  • slot;
  • contato;
  • trilhas;
  • montagem;
  • alimentação;
  • temperatura.

Parafuso apertado demais também pode ser problema?

Em situações extremas, montagem incorreta pode gerar tensão mecânica.

O SSD deve ficar corretamente assentado e fixado, sem flexão excessiva.


Dissipador também merece atenção

Alguns heatsinks M.2 utilizam thermal pads.

Se mal posicionados, podem:

  • pressionar excessivamente;
  • deixar controlador sem contato térmico;
  • interferir na montagem.

Temperatura pode imitar instabilidade PCIe

Um SSD superaquecendo pode:

  • reduzir desempenho;
  • aumentar latência;
  • eventualmente apresentar comportamento anormal.

Por isso, monitore temperatura.


ASPM costuma estar mais ligado a idle

Uma pista conceitual:

falha em idle

→ energia ganha prioridade.

falha sob carga

→ térmica, sinal, alimentação e estabilidade entram mais forte.

Mas não é uma regra absoluta.


Cenário 1 — NVMe falha apenas depois de 20 minutos parado

Temos:

  • carga normal;
  • temperatura baixa;
  • falha após idle;
  • volta depois de reiniciar.

Hipóteses fortes:

  • APST;
  • ASPM;
  • firmware;
  • driver.

Cenário 2 — NVMe falha durante benchmark pesado

Agora olhamos mais para:

  • temperatura;
  • controlador;
  • alimentação;
  • slot;
  • integridade de sinal.

Cenário 3 — erros WHEA aparecem quando ativa Gen4

Se:

Gen3 estável

e:

Gen4 gera eventos

isso aponta mais para caminho PCIe do que para ASPM puro.


Cenário 4 — erros aparecem apenas com Link State Power Management máximo

Agora a relação com estados de energia fica mais interessante.

Um teste A/B pode confirmar a correlação.


Cenário 5 — erro acontece só após suspensão

Nesse caso, precisamos investigar:

  • estado do sistema;
  • driver;
  • ASPM;
  • estado do dispositivo;
  • firmware.

Retomada envolve várias camadas.


Não confunda suspensão com idle simples

Idle:

computador ligado e ativo

Suspensão:

estado do sistema

São condições diferentes.


Modern Standby pode complicar ainda mais

Em equipamentos compatíveis, Modern Standby mantém uma arquitetura diferente de suspensão tradicional.

Isso pode envolver:

  • atividade de rede;
  • dispositivos;
  • estados de energia sofisticados.

Como saber se o sistema usa Modern Standby?

Execute:

powercfg /a

Observe os estados disponíveis.

Se aparecer algo relacionado a:

Standby (S0 Low Power Idle)

o sistema utiliza arquitetura Modern Standby.


S0 Low Power Idle não é ASPM

Mas ASPM pode participar do funcionamento energético dos dispositivos durante esse estado.

É uma camada dentro de outra.


WHEA pode aparecer como consequência, não causa

Imagine:

dispositivo falha

link registra erro

WHEA grava evento

O WHEA apenas registrou a condição.

Ele não criou o problema.


Kernel-Power também é consequência

Se o computador reinicia depois de uma falha PCIe, podemos encontrar:

Kernel-Power 41

Isso não prova fonte defeituosa.

Ele apenas mostra que o Windows detectou desligamento ou reinicialização inesperada.


O mesmo vale para Event ID isolado

Nunca diagnostique peça usando apenas:

Event ID 17

Event ID 41

ou outro número sem contexto.

O conteúdo completo importa.


Events 17 e 19 podem aparecer em contextos WHEA

Dependendo da versão do Windows e do tipo de erro, determinados IDs podem representar eventos corrigidos ou outras condições.

Não use apenas o número como diagnóstico.

Leia:

  • fonte;
  • componente;
  • texto;
  • horário.

Como correlacionar BDF com dispositivo

Uma estratégia:

  1. abra o evento WHEA;
  2. anote localização PCI;
  3. abra Device Manager;
  4. use Dispositivos por conexão;
  5. compare IDs de hardware;
  6. identifique o componente.

HWiNFO pode ajudar em diagnósticos avançados

Ferramentas de inventário podem mostrar a hierarquia PCIe e velocidade negociada.

Elas podem ajudar a confirmar:

  • largura x4/x8/x16;
  • geração;
  • dispositivo;
  • temperatura.

Mas não substituem o diagnóstico.


GPU-Z também pode ajudar para GPU

Para placa de vídeo, utilitários apropriados podem mostrar:

  • PCIe x16;
  • geração;
  • link ativo.

Isso ajuda a verificar se o link está negociando como esperado.


Link reduzido em idle pode ser normal

Esse é outro ponto importante.

Uma GPU pode mostrar:

PCIe x16 4.0

sob carga e uma condição reduzida em idle.

Isso pode fazer parte da economia de energia.

Não conclua defeito só porque o valor muda.


Coloque carga antes de comparar

Algumas ferramentas possuem um pequeno teste de renderização justamente para ativar a GPU e observar a negociação real do link.


NVMe também pode negociar geração e largura

Um SSD anunciado como:

PCIe 4.0 x4

pode operar abaixo disso se:

  • slot for Gen3;
  • slot tiver menos lanes;
  • plataforma limitar;
  • BIOS configurar diferente.

Isso pode ser normal por projeto

Sempre consulte a especificação da placa-mãe.


Erros corrigidos podem surgir por cabo/riser ruim

Se a GPU usa riser:

GPU direta no slot → sem erro

GPU via riser → erro

essa comparação é poderosa.


Outro teste: mover o SSD

Se a placa possui dois slots M.2:

M2_1 → falha

M2_2 → estável

isso é uma pista.

Mas lembre:

os slots podem usar caminhos diferentes.


Pode haver compartilhamento de lanes

Um slot M.2 pode desabilitar:

  • portas SATA;
  • outro slot;
  • parte de um PCIe.

Isso faz parte da topologia.


Manual é obrigatório

Procure notas como:

When M2_2 is populated...

Essas observações são essenciais.


ASPM pode ser configurado também na UEFI

Algumas placas oferecem opções específicas de PCIe ASPM dentro da BIOS/UEFI.

Os nomes variam.

Não altere sem documentar o estado inicial.


Windows e UEFI podem interagir

Dependendo da plataforma, firmware e sistema operacional participam do gerenciamento de energia.

Então a política final pode resultar da combinação das duas camadas.


Não existe uma chave universal de Registro segura

Evite tutoriais que prometem:

“adicione este DWORD e desative ASPM para sempre.”

Isso pode depender de versão, hardware e implementação.

Prefira configurações documentadas e reversíveis.


powercfg pode mostrar o plano atual

Use:

powercfg /getactivescheme

Isso ajuda a registrar qual plano estava ativo durante os testes.


Também podemos listar esquemas

Use:

powercfg /list

Assim fica mais fácil comparar.


Não troque de plano junto com ASPM

Mudar de:

Equilibrado

para:

Alto desempenho

pode alterar várias políticas simultaneamente.

Se o objetivo é testar ASPM, altere apenas o parâmetro relevante.


Alto desempenho não é ferramenta de diagnóstico perfeita

Ele modifica muito mais que PCIe.

Se o problema some, não sabemos qual política causou a mudança.


Um teste melhor

Mantenha:

plano Equilibrado

e altere apenas:

Link State Power Management

Isso isola melhor a variável.


E se a opção não aparecer?

Não force alterações no Registro imediatamente.

Primeiro investigue:

  • plataforma;
  • Modern Standby;
  • políticas OEM;
  • driver;
  • BIOS.

Alguns sistemas ocultam certas opções intencionalmente.


Notebooks OEM merecem cuidado

Fabricantes podem aplicar políticas próprias.

Utilitários como:

  • Lenovo Vantage;
  • Dell Power Manager;
  • MyASUS;
  • HP Support Assistant;

podem influenciar gerenciamento de energia.


Isso não significa desinstalar tudo

A ideia é entender se o fabricante fornece:

  • perfis térmicos;
  • energia;
  • drivers;
  • firmware.

Driver genérico versus OEM

Em alguns notebooks, o driver oficial do fabricante pode incluir ajustes específicos para a plataforma.

Nem sempre o driver mais novo disponível em outro lugar é automaticamente melhor.


Firmware de SSD OEM também pode diferir

Um SSD fornecido pelo fabricante do notebook pode ter firmware personalizado.

Tenha cuidado ao usar ferramentas genéricas.


Cenário realista: notebook com NVMe que some após suspensão

Roteiro:

  1. verificar backup;
  2. registrar firmware do SSD;
  3. registrar BIOS;
  4. verificar powercfg /a;
  5. analisar Event Viewer;
  6. procurar WHEA;
  7. testar suspensão repetidamente;
  8. atualizar componentes documentados;
  9. comparar política de energia;
  10. confirmar estabilidade.

Cenário realista: desktop com placa Wi-Fi PCIe instável

Se a conexão desaparece depois de idle:

  • veja driver;
  • política de energia da placa;
  • ASPM;
  • slot;
  • eventos PCIe.

Não culpe o roteador antes de verificar se o adaptador realmente deixou de responder.


Cenário realista: placa de captura desconecta

Placas PCIe especializadas também podem apresentar incompatibilidades de energia.

Nesse caso:

  • firmware;
  • driver;
  • ASPM;
  • slot;
  • chipset;

podem participar.


Cenário realista: GPU registra erros PCIe

Se existe:

  • WHEA;
  • riser;
  • Gen4;
  • montagem vertical;

teste a GPU diretamente no slot.

Isso pode economizar horas.


Re-seat pode fazer parte do diagnóstico

Reinstalar fisicamente o dispositivo pode resolver:

  • contato inadequado;
  • encaixe parcial.

Mas faça com o equipamento devidamente desligado.


Limpeza de contatos exige cuidado

Não utilize produtos inadequados.

Em muitos casos, apenas remover e reinstalar corretamente já é suficiente para testar contato.


Alimentação também entra na equação

GPU e alguns dispositivos dependem de alimentação adicional.

Problemas de cabo ou conector podem causar sintomas que parecem PCIe.


NVMe recebe energia pelo próprio slot

Isso torna a alimentação mais dependente da placa e do slot.

Problemas na linha de alimentação podem causar instabilidade.


ASPM reduz consumo, mas não conserta alimentação

Se existe falha elétrica real, mudar política pode apenas alterar a frequência do problema.


O teste reversível é essencial

Sempre que possível:

A → falha

B → estável

A novamente → falha

Esse padrão aumenta muito a qualidade do diagnóstico.


Quando parar de testar e trocar hardware?

Quando existem evidências consistentes de defeito físico.

Por exemplo:

  • dispositivo falha em várias máquinas;
  • outro dispositivo funciona perfeitamente no mesmo slot;
  • firmware atualizado;
  • políticas testadas;
  • erros persistem.

Teste cruzado é poderoso

Se possível:

SSD suspeito em outro PC

ou:

SSD conhecido no mesmo slot

Isso ajuda a separar:

dispositivo

de:

plataforma.


Mas nem todo usuário possui outro PC

Nesse caso, use as evidências disponíveis:

  • logs;
  • A/B;
  • slots;
  • firmware;
  • estabilidade.

Não descarte dados importantes durante diagnóstico

Se armazenamento é suspeito, backup vem primeiro.

Nunca faça dezenas de testes em SSD instável antes de proteger os arquivos.


O que ASPM realmente nos ensina

Ele mostra que o diagnóstico moderno precisa considerar:

estado.

Não basta perguntar:

“o componente funciona?”

Precisamos perguntar:

“em qual estado ele falha?”

Pode ser:

  • carga;
  • idle;
  • suspensão;
  • retomada;
  • Gen4;
  • Gen3;
  • bateria;
  • tomada.

Essas condições revelam padrões.

Fluxo completo de diagnóstico, quando desativar ASPM, FAQ e conclusão

Depois de entender como funcionam ASPM, estados L0/L1, APST, WHEA, AER, Root Ports, gerações PCIe e testes A/B, podemos organizar tudo em um procedimento prático.

O objetivo é responder uma pergunta simples:

quando uma falha realmente merece investigação de gerenciamento de energia PCIe?

E, principalmente:

quando é melhor parar de mexer em ASPM e procurar outra causa?


Comece pelo sintoma, não pela configuração

Antes de alterar qualquer política de energia, descreva o defeito.

Exemplo ruim:

“acho que ASPM está bugado.”

Exemplo melhor:

SSD secundário funciona normalmente durante uso intenso, mas desaparece depois de aproximadamente 30 minutos sem atividade e volta após reiniciar o computador.

Esse segundo formato já cria uma hipótese testável.


Passo 1 — Identifique em qual condição a falha aparece

Pergunte:

  • acontece sob carga?
  • acontece em idle?
  • acontece depois de suspensão?
  • acontece apenas na bateria?
  • acontece apenas conectado à tomada?
  • acontece somente em PCIe Gen4 ou Gen5?
  • desaparece depois de reiniciar?

Essas condições são extremamente importantes.


Passo 2 — Identifique o dispositivo

Descubra se o problema envolve:

  • NVMe;
  • GPU;
  • Wi-Fi;
  • placa de rede;
  • controladora;
  • placa de captura;
  • outro dispositivo PCIe.

Não diagnostique o barramento inteiro quando existe apenas um dispositivo suspeito.


Passo 3 — Registre o horário da falha

Depois consulte:

perfmon /rel

e:

eventvwr.msc

Procure eventos exatamente no período em que o problema aconteceu.


Passo 4 — Procure evidências relacionadas

Observe:

  • WHEA-Logger;
  • erros de armazenamento;
  • timeouts;
  • reset de dispositivo;
  • eventos PCIe;
  • falhas de driver.

Um evento isolado não basta.

Busque uma sequência coerente.


Passo 5 — Verifique o básico antes de ASPM

Antes de entrar em gerenciamento de energia, confira:

  • encaixe;
  • temperatura;
  • firmware;
  • driver;
  • slot;
  • alimentação;
  • cabos;
  • riser.

Um mau contato pode produzir sintomas tão estranhos quanto uma falha de energia.


Passo 6 — Faça backup se armazenamento estiver envolvido

Se um SSD apresenta desaparecimentos ou timeouts, proteja os arquivos importantes antes de continuar.

Diagnóstico vem depois da segurança dos dados.


Passo 7 — Registre a configuração atual

Anote:

  • plano de energia;
  • Link State Power Management;
  • versão da BIOS;
  • driver;
  • firmware do dispositivo;
  • geração PCIe;
  • slot utilizado.

Sem registro, você pode se perder depois de várias alterações.


Passo 8 — Faça um único teste A/B

Mantenha tudo igual e altere apenas:

PCI Express

Gerenciamento de energia do estado do link

Desativado

Depois reproduza o mesmo cenário.


Passo 9 — Compare o resultado

Se o problema continua exatamente igual, ASPM perde prioridade.

Se desaparece, a relação com transições de energia fica mais interessante.


Passo 10 — Faça o teste inverso

Quando for seguro:

ASPM original

falha retorna?

Se sim, a correlação se fortalece.


Quando deixar ASPM desativado pode fazer sentido?

Em determinadas situações, pode funcionar como workaround.

Por exemplo:

  • falha reproduzível;
  • desativar ASPM elimina o problema;
  • firmware e drivers estão atualizados;
  • não existe correção melhor disponível;
  • impacto energético é aceitável.

Ainda assim, documente a alteração.


Em notebook, pense duas vezes

Desabilitar gerenciamento de energia pode aumentar:

  • consumo em idle;
  • temperatura;
  • drenagem de bateria.

Por isso, o custo pode ser maior em portátil.


Em desktop, o impacto pode ser menos perceptível

Mas isso não significa que devemos desativar sem necessidade.

Mecanismos modernos de energia existem por um motivo.


ASPM desativado não corrige necessariamente o defeito

Pode apenas impedir a condição que o dispara.

A causa real ainda pode estar em:

  • firmware;
  • driver;
  • dispositivo;
  • placa-mãe;
  • sinal.

Quando procurar atualização de firmware?

Quando existe documentação ou versão mais nova relacionada a:

  • compatibilidade;
  • estabilidade;
  • gerenciamento de energia;
  • PCIe;
  • NVMe.

Use sempre fonte oficial do fabricante.


Quando procurar driver?

Se a falha envolve:

  • rede;
  • controladora;
  • GPU;
  • chipset;

vale comparar a versão instalada com a recomendada para a plataforma.


Quando testar outra geração PCIe?

Se existem erros persistentes e a plataforma permite:

Gen4 → Gen3

ou:

Gen5 → Gen4

faça isso como teste separado.

Nunca junto com ASPM.


Se reduzir geração resolve

A suspeita migra para:

  • integridade de sinal;
  • riser;
  • slot;
  • dispositivo;
  • placa.

Não conclua que o Windows é o culpado.


Quando testar outro slot?

Se existem vários slots compatíveis.

Isso pode ajudar a separar:

dispositivo

de:

caminho PCIe.

Mas consulte o manual, porque a topologia pode mudar.


Quando testar outro dispositivo?

Se possível:

SSD suspeito → outro PC

ou:

SSD conhecido → mesmo slot

Esse teste cruzado é muito valioso.


Quando suspeitar mais do próprio NVMe?

Quando temos:

  • timeouts;
  • desaparecimento;
  • falha em diferentes slots;
  • firmware atualizado;
  • comportamento semelhante em outra máquina.

Nesse cenário, o dispositivo ganha prioridade.


Quando suspeitar mais da placa-mãe?

Quando:

  • vários dispositivos falham no mesmo slot;
  • outro slot funciona;
  • eventos apontam repetidamente para aquele caminho;
  • problema persiste com dispositivos diferentes.

Quando suspeitar de riser?

Especialmente quando:

GPU direta → funciona

GPU via riser → falha

ou quando Gen3 funciona e Gen4 falha.


Quando ASPM provavelmente não é a causa principal?

Se o defeito acontece:

  • apenas sob alta temperatura;
  • apenas sob carga máxima;
  • em qualquer estado de energia;
  • com sinais físicos claros;
  • mesmo com ASPM desativado.

Nesse caso, outras hipóteses ficam mais fortes.


Não confunda economia com defeito

ASPM é parte normal do PCI Express.

Não existe motivo para tratar o recurso como algo nocivo por padrão.


O problema está na compatibilidade, não no conceito

Quando existe falha, normalmente investigamos a interação entre:

  • hardware;
  • firmware;
  • driver;
  • plataforma.

ASPM melhora FPS?

Não existe regra que diga que desativar ASPM aumenta desempenho perceptivelmente.

Em muitos computadores, a diferença prática é irrelevante para jogos.


Pode aumentar latência?

Estados de economia possuem tempos de transição.

Isso faz parte do projeto.

Em cenários extremamente sensíveis, políticas podem influenciar latência, mas não é correto transformar isso em recomendação universal.


“Alto desempenho” desativa ASPM?

Pode alterar políticas, mas o comportamento depende do plano e da plataforma.

Não use isso como substituto de teste isolado.


O plano Equilibrado é ruim?

Não.

Ele é projetado para equilibrar desempenho e consumo.


Desativar todas as economias deixa o PC mais estável?

Não necessariamente.

Você pode apenas:

  • aumentar consumo;
  • elevar temperatura;
  • mascarar o defeito.

Fluxograma rápido de diagnóstico

Falha PCIe

Acontece só em idle/suspensão?

Se não:

→ investigue carga, temperatura, sinal e hardware.

Se sim:

Existem eventos WHEA ou timeout?

Se sim:

Dispositivo identificado?

Firmware e driver atualizados?

Temperatura normal?

Teste ASPM OFF

Problema continua?

Sim:

→ investigue APST, hardware, slot e firmware.

Não:

→ relação com transição de energia ganha força.

Reativar ASPM reproduz falha?

Sim:

→ correlação forte.


FAQ — dúvidas frequentes sobre PCIe ASPM

1. O que é ASPM?

Active State Power Management é um mecanismo de economia de energia do link PCI Express.


2. ASPM desliga o SSD?

Não exatamente.

Ele atua no link PCIe. O SSD possui também seus próprios estados de energia.


3. O que é L0?

É o estado ativo normal do link PCIe.


4. O que é L1?

É um estado de economia de energia do link.


5. O que são L1.1 e L1.2?

São subestados de economia mais profunda utilizados em plataformas compatíveis.


6. ASPM e APST são a mesma coisa?

Não.

ASPM gerencia o link PCIe. APST está ligado aos estados do dispositivo NVMe.


7. ASPM pode fazer um NVMe desaparecer?

Uma incompatibilidade relacionada a transições de energia pode contribuir para esse tipo de sintoma, mas existem muitas outras causas.


8. Desativar ASPM é seguro?

Como teste diagnóstico, pode ser útil. Pode aumentar consumo, especialmente em notebook.


9. Devo deixar desativado permanentemente?

Somente se houver motivo claro e o workaround for necessário.


10. ASPM reduz desempenho?

Em condições normais, ele foi projetado para economizar energia durante períodos de baixa atividade sem comprometer o funcionamento normal.


11. Desativar ASPM aumenta FPS?

Não é uma regra e normalmente não deve ser usado como “otimização gamer”.


12. ASPM é igual a C-State?

Não.

C-States pertencem à CPU.


13. ASPM é igual à suspensão?

Não.

Suspensão é um estado do sistema.


14. O que é Link State Power Management?

É a configuração do Windows relacionada à política de energia do link PCI Express.


15. Por que essa opção não aparece no meu Windows?

A disponibilidade depende da plataforma, políticas e arquitetura de energia.


16. O que é WHEA?

Windows Hardware Error Architecture é a infraestrutura usada pelo Windows para registrar determinados erros de hardware.


17. WHEA significa CPU ruim?

Não.

Pode envolver vários componentes, inclusive PCIe.


18. O que significa PCI Express Root Port?

É parte da hierarquia que conecta dispositivos PCIe ao restante da plataforma.


19. Root Port com erro significa placa-mãe defeituosa?

Não automaticamente.

Precisamos identificar o dispositivo e o contexto.


20. O que é AER?

Advanced Error Reporting é um mecanismo do PCI Express para reportar erros de comunicação.


21. Erros corrigidos são graves?

Depende da frequência e do impacto. Um evento isolado pode ter significado muito diferente de milhares recorrentes.


22. PCIe Gen4 pode ser menos estável que Gen3?

Hardware compatível deve funcionar corretamente em Gen4. Se Gen3 funciona e Gen4 falha, investigue integridade de sinal e compatibilidade.


23. Um riser pode causar WHEA?

Sim, se introduzir problemas de sinal ou compatibilidade.


24. SSD quente pode parecer problema de ASPM?

Pode gerar sintomas que confundem o diagnóstico.


25. SMART perfeito garante SSD saudável?

Não.

SMART não cobre todas as possíveis falhas.


26. Posso atualizar firmware do SSD?

Sim, quando existe atualização oficial apropriada para o modelo. Faça backup antes.


27. BIOS pode corrigir problemas PCIe?

Pode existir firmware com correções de compatibilidade, mas atualização não deve ser feita aleatoriamente.


28. Posso mudar ASPM pela BIOS?

Algumas placas oferecem opções relacionadas. Depende do modelo.


29. Devo usar hacks de Registro?

Evite alterações não documentadas. Prefira métodos reversíveis e suportados.


30. Como saber se o problema é ASPM?

A melhor evidência vem de um teste reproduzível:

ASPM ativo → falha

ASPM desativado → estável

ASPM ativo novamente → falha

Mesmo assim, ainda investigue firmware e hardware.


Checklist final

Antes de culpar ASPM, confirme:

  • sintoma reproduzível;
  • horário da falha;
  • logs;
  • dispositivo correto;
  • temperatura;
  • firmware;
  • driver;
  • encaixe;
  • slot;
  • topologia;
  • geração PCIe.

Depois faça apenas um teste de energia por vez.


Conclusão

PCIe ASPM é um excelente exemplo de como o diagnóstico de computadores modernos mudou.

Hoje um componente não precisa falhar somente quando trabalha demais.

Ele pode apresentar problema justamente durante:

  • idle;
  • suspensão;
  • retomada;
  • entrada em baixo consumo;
  • saída de baixo consumo.

Por isso, um computador que passa horas em stress test ainda pode apresentar uma falha relacionada às transições de energia.

Ao mesmo tempo, ASPM não deve virar um culpado genérico.

Um erro que desaparece quando desativamos economia de energia pode envolver:

  • firmware;
  • driver;
  • NVMe;
  • slot;
  • placa-mãe;
  • integridade de sinal;
  • compatibilidade.

O segredo está em testar de maneira controlada.

Em vez de desativar dezenas de recursos:

mude uma variável, reproduza o problema, compare e registre o resultado.

É assim que uma falha aparentemente aleatória começa a revelar um padrão.

Precisa de ajuda com falhas intermitentes de SSD, PCIe ou Windows 11?

A VMIA realiza diagnóstico de computadores Windows, SSDs, placas-mãe, drivers e problemas de estabilidade que podem aparecer somente em determinadas condições de uso ou energia.

Telefone e WhatsApp: (11) 99779-7772
Site: vmia.site
Blog técnico: vmia.com.br
Avaliações: avaliacao.vmia.com.br

Antes de trocar peças ou desativar recursos aleatoriamente, vale descobrir em qual estado o hardware realmente falha.

Seja o primeiro a comentar

Faça um comentário

Seu e-mail não será publicado.


*