vllm_omni.diffusion.attention.backends.flash_attn_hub ¶
FlashAttention3HubBackend ¶
Bases: AttentionBackend
FlashAttention3HubImpl ¶
Bases: AttentionImpl[AttentionMetadata]
flash_attn_func instance-attribute ¶
flash_attn_varlen_func instance-attribute ¶
flash_attn_varlen_func: Callable[..., Any] | None = getattr(
hub_module, "flash_attn_varlen_func", None
)
forward_cuda ¶
forward_cuda(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor
FlashAttentionHubBackend ¶
Bases: AttentionBackend
FlashAttentionHubImpl ¶
Bases: AttentionImpl[AttentionMetadata]
flash_attn_func instance-attribute ¶
flash_attn_varlen_func instance-attribute ¶
flash_attn_varlen_func: Callable[..., Any] | None = getattr(
hub_module, "flash_attn_varlen_func", None
)
forward_cuda ¶
forward_cuda(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor