Skip to content

vllm_omni.diffusion.attention.backends.fastvideo_vsa

logger module-attribute

logger = init_logger(__name__)

FastVideoVSABackend

Bases: AttentionBackend

accept_output_buffer class-attribute instance-attribute

accept_output_buffer: bool = True

get_impl_cls staticmethod

get_impl_cls() -> type[FastVideoVSAImpl]

get_name staticmethod

get_name() -> str

get_supported_head_sizes staticmethod

get_supported_head_sizes() -> list[int]

supports_packed_mask_free classmethod

supports_packed_mask_free() -> bool

validate_available classmethod

validate_available() -> None

FastVideoVSAImpl

Bases: AttentionImpl

block_elements instance-attribute

block_elements = (
    self.block_size[0]
    * self.block_size[1]
    * self.block_size[2]
)

block_size instance-attribute

block_size = self._parse_block_size(
    backend_kwargs.get("block_size", (4, 8, 8))
)

causal instance-attribute

causal = causal

disable_when_sp_active instance-attribute

disable_when_sp_active = bool(
    backend_kwargs.get("disable_when_sp_active", True)
)

fallback_on_error instance-attribute

fallback_on_error = bool(
    backend_kwargs.get("fallback_on_error", True)
)

head_size instance-attribute

head_size = head_size

min_seq_len instance-attribute

min_seq_len = int(
    backend_kwargs.get(
        "min_seq_len", self.block_elements * 2
    )
)

num_heads instance-attribute

num_heads = num_heads

num_kv_heads instance-attribute

num_kv_heads = (
    num_kv_heads if num_kv_heads is not None else num_heads
)

qkv_layout instance-attribute

qkv_layout = qkv_layout

sdpa_fallback instance-attribute

sdpa_fallback = SDPAImpl(
    num_heads=num_heads,
    head_size=head_size,
    softmax_scale=softmax_scale,
    causal=causal,
    num_kv_heads=num_kv_heads,
    qkv_layout=qkv_layout,
)

softmax_scale instance-attribute

softmax_scale = softmax_scale

topk instance-attribute

topk = int(backend_kwargs.get('topk', 64))

forward_cuda

forward_cuda(
    query: Tensor,
    key: Tensor,
    value: Tensor,
    attn_metadata: AttentionMetadata | None = None,
) -> Tensor

forward_musa

forward_musa(
    query: Tensor,
    key: Tensor,
    value: Tensor,
    attn_metadata: AttentionMetadata | None = None,
) -> Tensor

forward_npu

forward_npu(
    query: Tensor,
    key: Tensor,
    value: Tensor,
    attn_metadata: AttentionMetadata | None = None,
) -> Tensor

forward_xpu

forward_xpu(
    query: Tensor,
    key: Tensor,
    value: Tensor,
    attn_metadata: AttentionMetadata | None = None,
) -> Tensor