Dentro de la API Graph cuDNN de NVIDIA: fusión, ajuste automático y reutilización de planes con la interfaz cuDNN
@section(“5. SDPA (Flash Attention) con enmascaramiento causal”) def sdpa_demo(): si no HAS_SDPA: aumente RuntimeError(f”SDPA fusionado necesita SM80+ (Amperios), esta GPU es sm_{SM}”) b, h, s, d = 4, 16, 1024,…