vllm_omni.diffusion.attention.backends.fastvideo_vsa ¶
FastVideoVSABackend ¶
Bases: AttentionBackend
FastVideoVSAImpl ¶
Bases: AttentionImpl
block_elements instance-attribute ¶
block_size instance-attribute ¶
disable_when_sp_active instance-attribute ¶
disable_when_sp_active = bool(
backend_kwargs.get("disable_when_sp_active", True)
)
fallback_on_error instance-attribute ¶
fallback_on_error = bool(
backend_kwargs.get("fallback_on_error", True)
)
min_seq_len instance-attribute ¶
min_seq_len = int(
backend_kwargs.get(
"min_seq_len", self.block_elements * 2
)
)
num_kv_heads instance-attribute ¶
sdpa_fallback instance-attribute ¶
sdpa_fallback = SDPAImpl(
num_heads=num_heads,
head_size=head_size,
softmax_scale=softmax_scale,
causal=causal,
num_kv_heads=num_kv_heads,
qkv_layout=qkv_layout,
)
forward_cuda ¶
forward_cuda(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor
forward_musa ¶
forward_musa(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor
forward_npu ¶
forward_npu(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor
forward_xpu ¶
forward_xpu(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor