FlashAttentionの実装者向け解説記事。APIの呼び出しだけでなく、GPUやdtype、shapeなどの条件下で発生するfallbackを回避し、効率的なメモリ管理とonline softmaxを実現する方法。