vllm.model_executor.models.bert ¶

TOKEN_TYPE_SHIFT `module-attribute` ¶

TOKEN_TYPE_SHIFT = 30

BertAttention ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertAttention(nn.Module):

    def __init__(
        self,
        hidden_size: int,
        num_attention_heads: int,
        layer_norm_eps: float,
        cache_config: Optional[CacheConfig] = None,
        quant_config: Optional[QuantizationConfig] = None,
        prefix: str = "",
    ):
        super().__init__()

        self.self = BertSelfAttention(hidden_size=hidden_size,
                                      num_attention_heads=num_attention_heads,
                                      cache_config=cache_config,
                                      quant_config=quant_config,
                                      prefix=f"{prefix}.output")

        self.output = BertSelfOutput(hidden_size=hidden_size,
                                     layer_norm_eps=layer_norm_eps,
                                     quant_config=quant_config,
                                     prefix=f"{prefix}.output")

    def forward(
        self,
        hidden_states: torch.Tensor,
    ) -> torch.Tensor:
        self_output = self.self(hidden_states)
        return self.output(self_output, hidden_states)

output `instance-attribute` ¶

output = BertSelfOutput(
    hidden_size=hidden_size,
    layer_norm_eps=layer_norm_eps,
    quant_config=quant_config,
    prefix=f"{prefix}.output",
)

self `instance-attribute` ¶

self = BertSelfAttention(
    hidden_size=hidden_size,
    num_attention_heads=num_attention_heads,
    cache_config=cache_config,
    quant_config=quant_config,
    prefix=f"{prefix}.output",
)

init ¶

__init__(
    hidden_size: int,
    num_attention_heads: int,
    layer_norm_eps: float,
    cache_config: Optional[CacheConfig] = None,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(
    self,
    hidden_size: int,
    num_attention_heads: int,
    layer_norm_eps: float,
    cache_config: Optional[CacheConfig] = None,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
):
    super().__init__()

    self.self = BertSelfAttention(hidden_size=hidden_size,
                                  num_attention_heads=num_attention_heads,
                                  cache_config=cache_config,
                                  quant_config=quant_config,
                                  prefix=f"{prefix}.output")

    self.output = BertSelfOutput(hidden_size=hidden_size,
                                 layer_norm_eps=layer_norm_eps,
                                 quant_config=quant_config,
                                 prefix=f"{prefix}.output")

forward ¶

forward(hidden_states: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    hidden_states: torch.Tensor,
) -> torch.Tensor:
    self_output = self.self(hidden_states)
    return self.output(self_output, hidden_states)

BertEmbedding ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertEmbedding(nn.Module):

    def __init__(self, config: BertConfig):

        super().__init__()
        self.size = config.hidden_size
        self.word_embeddings = VocabParallelEmbedding(config.vocab_size,
                                                      config.hidden_size)
        self.position_embeddings = VocabParallelEmbedding(
            config.max_position_embeddings, config.hidden_size)
        self.token_type_embeddings = VocabParallelEmbedding(
            config.type_vocab_size, config.hidden_size)
        self.LayerNorm = nn.LayerNorm(config.hidden_size,
                                      eps=config.layer_norm_eps)

        self.register_buffer(
            "position_ids",
            torch.arange(config.max_position_embeddings).unsqueeze(0),
        )
        self.position_embedding_type = config.position_embedding_type
        if self.position_embedding_type != "absolute":
            raise ValueError("Only 'absolute' position_embedding_type" +
                             " is supported")

    def forward(
        self,
        input_ids: torch.Tensor,
        position_ids: torch.Tensor,
        inputs_embeds: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:
        token_type_ids = _decode_token_type_ids(input_ids)

        if inputs_embeds is None:
            inputs_embeds = self.word_embeddings(input_ids)

        position_embeddings = self.position_embeddings(position_ids)

        token_type_embeddings = self.token_type_embeddings(token_type_ids)

        embeddings = inputs_embeds + token_type_embeddings + position_embeddings
        embeddings = self.LayerNorm(embeddings)
        return embeddings

LayerNorm `instance-attribute` ¶

LayerNorm = LayerNorm(hidden_size, eps=layer_norm_eps)

position_embedding_type `instance-attribute` ¶

position_embedding_type = position_embedding_type

position_embeddings `instance-attribute` ¶

position_embeddings = VocabParallelEmbedding(
    max_position_embeddings, hidden_size
)

size `instance-attribute` ¶

size = hidden_size

token_type_embeddings `instance-attribute` ¶

token_type_embeddings = VocabParallelEmbedding(
    type_vocab_size, hidden_size
)

word_embeddings `instance-attribute` ¶

word_embeddings = VocabParallelEmbedding(
    vocab_size, hidden_size
)

init ¶

__init__(config: BertConfig)

Source code in vllm/model_executor/models/bert.py

def __init__(self, config: BertConfig):

    super().__init__()
    self.size = config.hidden_size
    self.word_embeddings = VocabParallelEmbedding(config.vocab_size,
                                                  config.hidden_size)
    self.position_embeddings = VocabParallelEmbedding(
        config.max_position_embeddings, config.hidden_size)
    self.token_type_embeddings = VocabParallelEmbedding(
        config.type_vocab_size, config.hidden_size)
    self.LayerNorm = nn.LayerNorm(config.hidden_size,
                                  eps=config.layer_norm_eps)

    self.register_buffer(
        "position_ids",
        torch.arange(config.max_position_embeddings).unsqueeze(0),
    )
    self.position_embedding_type = config.position_embedding_type
    if self.position_embedding_type != "absolute":
        raise ValueError("Only 'absolute' position_embedding_type" +
                         " is supported")

forward ¶

forward(
    input_ids: Tensor,
    position_ids: Tensor,
    inputs_embeds: Optional[Tensor] = None,
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    input_ids: torch.Tensor,
    position_ids: torch.Tensor,
    inputs_embeds: Optional[torch.Tensor] = None,
) -> torch.Tensor:
    token_type_ids = _decode_token_type_ids(input_ids)

    if inputs_embeds is None:
        inputs_embeds = self.word_embeddings(input_ids)

    position_embeddings = self.position_embeddings(position_ids)

    token_type_embeddings = self.token_type_embeddings(token_type_ids)

    embeddings = inputs_embeds + token_type_embeddings + position_embeddings
    embeddings = self.LayerNorm(embeddings)
    return embeddings

BertEmbeddingModel ¶

Bases: Module, SupportsQuant

A model that uses Bert to provide embedding functionalities.

This class encapsulates the BertModel and provides an interface for embedding operations and customized pooling functions.

Attributes:

Name	Type	Description
`model`		An instance of BertModel used for forward operations.
`_pooler`		An instance of Pooler used for pooling operations.

Source code in vllm/model_executor/models/bert.py

@default_pooling_type("CLS")
class BertEmbeddingModel(nn.Module, SupportsQuant):
    """A model that uses Bert to provide embedding functionalities.

    This class encapsulates the BertModel and provides an interface for
    embedding operations and customized pooling functions.

    Attributes:
        model: An instance of BertModel used for forward operations.
        _pooler: An instance of Pooler used for pooling operations.
    """

    is_pooling_model = True

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__()

        pooler_config = vllm_config.model_config.pooler_config
        assert pooler_config is not None

        self.model = self._build_model(vllm_config=vllm_config,
                                       prefix=maybe_prefix(prefix, "model"))
        self.pooler = self._build_pooler(pooler_config)

    def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
        return self.model.get_input_embeddings(input_ids)

    def forward(
        self,
        input_ids: torch.Tensor,
        positions: torch.Tensor,
        intermediate_tensors: Optional[IntermediateTensors] = None,
        inputs_embeds: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:
        return self.model(input_ids=input_ids,
                          positions=positions,
                          inputs_embeds=inputs_embeds,
                          intermediate_tensors=intermediate_tensors)

    def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        weights_list = list(weights)

        has_model_prefix = any(
            name.startswith("model.") for name, _ in weights_list)
        if not has_model_prefix:
            mapper = WeightsMapper(orig_to_new_prefix={"": "model."})

        loader = AutoWeightsLoader(self, skip_prefixes=["lm_head."])
        return loader.load_weights(weights_list, mapper=mapper)

    def _build_model(self,
                     vllm_config: VllmConfig,
                     prefix: str = "") -> BertModel:
        return BertModel(vllm_config=vllm_config,
                         prefix=prefix,
                         embedding_class=BertEmbedding)

    def _build_pooler(self, pooler_config: PoolerConfig) -> Pooler:
        return DispatchPooler({
            "encode": Pooler.for_encode(pooler_config),
            "embed": Pooler.for_embed(pooler_config),
        })

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

model `instance-attribute` ¶

model = _build_model(
    vllm_config=vllm_config,
    prefix=maybe_prefix(prefix, "model"),
)

pooler `instance-attribute` ¶

pooler = _build_pooler(pooler_config)

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/bert.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__()

    pooler_config = vllm_config.model_config.pooler_config
    assert pooler_config is not None

    self.model = self._build_model(vllm_config=vllm_config,
                                   prefix=maybe_prefix(prefix, "model"))
    self.pooler = self._build_pooler(pooler_config)

_build_model ¶

_build_model(
    vllm_config: VllmConfig, prefix: str = ""
) -> BertModel

Source code in vllm/model_executor/models/bert.py

def _build_model(self,
                 vllm_config: VllmConfig,
                 prefix: str = "") -> BertModel:
    return BertModel(vllm_config=vllm_config,
                     prefix=prefix,
                     embedding_class=BertEmbedding)

_build_pooler ¶

_build_pooler(pooler_config: PoolerConfig) -> Pooler

Source code in vllm/model_executor/models/bert.py

def _build_pooler(self, pooler_config: PoolerConfig) -> Pooler:
    return DispatchPooler({
        "encode": Pooler.for_encode(pooler_config),
        "embed": Pooler.for_embed(pooler_config),
    })

forward ¶

forward(
    input_ids: Tensor,
    positions: Tensor,
    intermediate_tensors: Optional[
        IntermediateTensors
    ] = None,
    inputs_embeds: Optional[Tensor] = None,
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    input_ids: torch.Tensor,
    positions: torch.Tensor,
    intermediate_tensors: Optional[IntermediateTensors] = None,
    inputs_embeds: Optional[torch.Tensor] = None,
) -> torch.Tensor:
    return self.model(input_ids=input_ids,
                      positions=positions,
                      inputs_embeds=inputs_embeds,
                      intermediate_tensors=intermediate_tensors)

get_input_embeddings ¶

get_input_embeddings(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
    return self.model.get_input_embeddings(input_ids)

load_weights ¶

load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/bert.py

def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    weights_list = list(weights)

    has_model_prefix = any(
        name.startswith("model.") for name, _ in weights_list)
    if not has_model_prefix:
        mapper = WeightsMapper(orig_to_new_prefix={"": "model."})

    loader = AutoWeightsLoader(self, skip_prefixes=["lm_head."])
    return loader.load_weights(weights_list, mapper=mapper)

BertEncoder ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertEncoder(nn.Module):

    def __init__(self, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__()
        config = vllm_config.model_config.hf_config
        cache_config = vllm_config.cache_config
        quant_config = vllm_config.quant_config
        self.layer = nn.ModuleList([
            BertLayer(config=config,
                      cache_config=cache_config,
                      quant_config=quant_config,
                      prefix=f"{prefix}.layer.{layer_idx}")
            for layer_idx in range(config.num_hidden_layers)
        ])

    def forward(
        self,
        hidden_states: torch.Tensor,
    ) -> torch.Tensor:
        for layer in self.layer:
            hidden_states = layer(hidden_states)
        return hidden_states

layer `instance-attribute` ¶

layer = ModuleList(
    [
        (
            BertLayer(
                config=config,
                cache_config=cache_config,
                quant_config=quant_config,
                prefix=f"{prefix}.layer.{layer_idx}",
            )
        )
        for layer_idx in (range(num_hidden_layers))
    ]
)

init ¶

__init__(vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/bert.py

def __init__(self, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__()
    config = vllm_config.model_config.hf_config
    cache_config = vllm_config.cache_config
    quant_config = vllm_config.quant_config
    self.layer = nn.ModuleList([
        BertLayer(config=config,
                  cache_config=cache_config,
                  quant_config=quant_config,
                  prefix=f"{prefix}.layer.{layer_idx}")
        for layer_idx in range(config.num_hidden_layers)
    ])

forward ¶

forward(hidden_states: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    hidden_states: torch.Tensor,
) -> torch.Tensor:
    for layer in self.layer:
        hidden_states = layer(hidden_states)
    return hidden_states

BertForSequenceClassification ¶

Bases: Module, SupportsCrossEncoding, SupportsQuant

A model that uses Bert to provide embedding functionalities.

This class encapsulates the BertModel and provides an interface for embedding operations and customized pooling functions.

Attributes:

Name	Type	Description
`model`		An instance of BertModel used for forward operations.
`_pooler`		An instance of Pooler used for pooling operations.

Source code in vllm/model_executor/models/bert.py

@default_pooling_type("CLS")
class BertForSequenceClassification(nn.Module, SupportsCrossEncoding,
                                    SupportsQuant):
    """A model that uses Bert to provide embedding functionalities.

   This class encapsulates the BertModel and provides an interface for
   embedding operations and customized pooling functions.

   Attributes:
       model: An instance of BertModel used for forward operations.
       _pooler: An instance of Pooler used for pooling operations.
   """

    is_pooling_model = True

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__()
        config = vllm_config.model_config.hf_config

        self.num_labels = config.num_labels
        self.bert = BertPoolingModel(vllm_config=vllm_config,
                                     prefix=maybe_prefix(prefix, "bert"),
                                     embedding_class=BertEmbedding)
        self.classifier = nn.Linear(config.hidden_size,
                                    config.num_labels,
                                    dtype=vllm_config.model_config.head_dtype)

        pooler_config = vllm_config.model_config.pooler_config
        assert pooler_config is not None

        self.pooler = DispatchPooler({
            "encode":
            Pooler.for_encode(pooler_config),
            "classify":
            ClassifierPooler(
                pooling=self.bert.pooler,
                classifier=self.classifier,
                act_fn=ClassifierPooler.act_fn_for_seq_cls(
                    vllm_config.model_config),
            ),
            "score":
            ClassifierPooler(
                pooling=self.bert.pooler,
                classifier=self.classifier,
                act_fn=ClassifierPooler.act_fn_for_cross_encoder(
                    vllm_config.model_config),
            ),
        })

    def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
        return self.bert.get_input_embeddings(input_ids)

    def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        loader = AutoWeightsLoader(self)
        loaded_params = loader.load_weights(weights)
        return loaded_params

    def forward(
        self,
        input_ids: Optional[torch.Tensor],
        positions: torch.Tensor,
        intermediate_tensors: Optional[IntermediateTensors] = None,
        inputs_embeds: Optional[torch.Tensor] = None,
        token_type_ids: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:

        if token_type_ids is not None:
            assert self.bert.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
            assert input_ids is not None
            _encode_token_type_ids(input_ids, token_type_ids)

        return self.bert(input_ids=input_ids,
                         positions=positions,
                         inputs_embeds=inputs_embeds,
                         intermediate_tensors=intermediate_tensors)

bert `instance-attribute` ¶

bert = BertPoolingModel(
    vllm_config=vllm_config,
    prefix=maybe_prefix(prefix, "bert"),
    embedding_class=BertEmbedding,
)

classifier `instance-attribute` ¶

classifier = Linear(
    hidden_size, num_labels, dtype=head_dtype
)

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

num_labels `instance-attribute` ¶

num_labels = num_labels

pooler `instance-attribute` ¶

pooler = DispatchPooler(
    {
        "encode": for_encode(pooler_config),
        "classify": ClassifierPooler(
            pooling=pooler,
            classifier=classifier,
            act_fn=act_fn_for_seq_cls(model_config),
        ),
        "score": ClassifierPooler(
            pooling=pooler,
            classifier=classifier,
            act_fn=act_fn_for_cross_encoder(model_config),
        ),
    }
)

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/bert.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__()
    config = vllm_config.model_config.hf_config

    self.num_labels = config.num_labels
    self.bert = BertPoolingModel(vllm_config=vllm_config,
                                 prefix=maybe_prefix(prefix, "bert"),
                                 embedding_class=BertEmbedding)
    self.classifier = nn.Linear(config.hidden_size,
                                config.num_labels,
                                dtype=vllm_config.model_config.head_dtype)

    pooler_config = vllm_config.model_config.pooler_config
    assert pooler_config is not None

    self.pooler = DispatchPooler({
        "encode":
        Pooler.for_encode(pooler_config),
        "classify":
        ClassifierPooler(
            pooling=self.bert.pooler,
            classifier=self.classifier,
            act_fn=ClassifierPooler.act_fn_for_seq_cls(
                vllm_config.model_config),
        ),
        "score":
        ClassifierPooler(
            pooling=self.bert.pooler,
            classifier=self.classifier,
            act_fn=ClassifierPooler.act_fn_for_cross_encoder(
                vllm_config.model_config),
        ),
    })

forward ¶

forward(
    input_ids: Optional[Tensor],
    positions: Tensor,
    intermediate_tensors: Optional[
        IntermediateTensors
    ] = None,
    inputs_embeds: Optional[Tensor] = None,
    token_type_ids: Optional[Tensor] = None,
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    input_ids: Optional[torch.Tensor],
    positions: torch.Tensor,
    intermediate_tensors: Optional[IntermediateTensors] = None,
    inputs_embeds: Optional[torch.Tensor] = None,
    token_type_ids: Optional[torch.Tensor] = None,
) -> torch.Tensor:

    if token_type_ids is not None:
        assert self.bert.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
        assert input_ids is not None
        _encode_token_type_ids(input_ids, token_type_ids)

    return self.bert(input_ids=input_ids,
                     positions=positions,
                     inputs_embeds=inputs_embeds,
                     intermediate_tensors=intermediate_tensors)

get_input_embeddings ¶

get_input_embeddings(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
    return self.bert.get_input_embeddings(input_ids)

load_weights ¶

load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/bert.py

def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    loader = AutoWeightsLoader(self)
    loaded_params = loader.load_weights(weights)
    return loaded_params

BertForTokenClassification ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

@default_pooling_type("ALL")
class BertForTokenClassification(nn.Module):
    is_pooling_model = True

    def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
        super().__init__()
        config = vllm_config.model_config.hf_config
        self.head_dtype = vllm_config.model_config.head_dtype
        self.num_labels = config.num_labels
        self.bert = BertModel(vllm_config=vllm_config,
                              prefix=maybe_prefix(prefix, "bert"),
                              embedding_class=BertEmbedding)
        self.classifier = nn.Linear(config.hidden_size,
                                    config.num_labels,
                                    dtype=self.head_dtype)

        pooler_config = vllm_config.model_config.pooler_config
        assert pooler_config is not None

        self.pooler = DispatchPooler({
            "encode":
            Pooler.for_encode(pooler_config),
        })

    def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
        return self.bert.get_input_embeddings(input_ids)

    def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        loader = AutoWeightsLoader(self)
        loaded_params = loader.load_weights(weights)
        return loaded_params

    def forward(
        self,
        input_ids: Optional[torch.Tensor],
        positions: torch.Tensor,
        intermediate_tensors: Optional[IntermediateTensors] = None,
        inputs_embeds: Optional[torch.Tensor] = None,
        token_type_ids: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:

        if token_type_ids is not None:
            assert self.bert.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
            assert input_ids is not None
            _encode_token_type_ids(input_ids, token_type_ids)

        hidden_states = self.bert(input_ids=input_ids,
                                  positions=positions,
                                  inputs_embeds=inputs_embeds,
                                  intermediate_tensors=intermediate_tensors)

        hidden_states = hidden_states.to(self.head_dtype)
        return self.classifier(hidden_states)

bert `instance-attribute` ¶

bert = BertModel(
    vllm_config=vllm_config,
    prefix=maybe_prefix(prefix, "bert"),
    embedding_class=BertEmbedding,
)

classifier `instance-attribute` ¶

classifier = Linear(
    hidden_size, num_labels, dtype=head_dtype
)

head_dtype `instance-attribute` ¶

head_dtype = head_dtype

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

num_labels `instance-attribute` ¶

num_labels = num_labels

pooler `instance-attribute` ¶

pooler = DispatchPooler(
    {"encode": for_encode(pooler_config)}
)

init ¶

__init__(*, vllm_config: VllmConfig, prefix: str = '')

Source code in vllm/model_executor/models/bert.py

def __init__(self, *, vllm_config: VllmConfig, prefix: str = ""):
    super().__init__()
    config = vllm_config.model_config.hf_config
    self.head_dtype = vllm_config.model_config.head_dtype
    self.num_labels = config.num_labels
    self.bert = BertModel(vllm_config=vllm_config,
                          prefix=maybe_prefix(prefix, "bert"),
                          embedding_class=BertEmbedding)
    self.classifier = nn.Linear(config.hidden_size,
                                config.num_labels,
                                dtype=self.head_dtype)

    pooler_config = vllm_config.model_config.pooler_config
    assert pooler_config is not None

    self.pooler = DispatchPooler({
        "encode":
        Pooler.for_encode(pooler_config),
    })

forward ¶

forward(
    input_ids: Optional[Tensor],
    positions: Tensor,
    intermediate_tensors: Optional[
        IntermediateTensors
    ] = None,
    inputs_embeds: Optional[Tensor] = None,
    token_type_ids: Optional[Tensor] = None,
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    input_ids: Optional[torch.Tensor],
    positions: torch.Tensor,
    intermediate_tensors: Optional[IntermediateTensors] = None,
    inputs_embeds: Optional[torch.Tensor] = None,
    token_type_ids: Optional[torch.Tensor] = None,
) -> torch.Tensor:

    if token_type_ids is not None:
        assert self.bert.config.vocab_size < (1 << TOKEN_TYPE_SHIFT)
        assert input_ids is not None
        _encode_token_type_ids(input_ids, token_type_ids)

    hidden_states = self.bert(input_ids=input_ids,
                              positions=positions,
                              inputs_embeds=inputs_embeds,
                              intermediate_tensors=intermediate_tensors)

    hidden_states = hidden_states.to(self.head_dtype)
    return self.classifier(hidden_states)

get_input_embeddings ¶

get_input_embeddings(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
    return self.bert.get_input_embeddings(input_ids)

load_weights ¶

load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/bert.py

def load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    loader = AutoWeightsLoader(self)
    loaded_params = loader.load_weights(weights)
    return loaded_params

BertIntermediate ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertIntermediate(nn.Module):

    def __init__(self,
                 hidden_size: int,
                 intermediate_size: int,
                 hidden_act: str,
                 quant_config: Optional[QuantizationConfig] = None,
                 prefix: str = ""):
        super().__init__()
        self.dense = ColumnParallelLinear(input_size=hidden_size,
                                          output_size=intermediate_size,
                                          bias=True,
                                          quant_config=quant_config,
                                          prefix=f"{prefix}.dense")
        self.intermediate_act_fn = get_act_fn(hidden_act)

    def forward(self, hidden_states: torch.Tensor) -> torch.Tensor:
        hidden_states, _ = self.dense(hidden_states)
        hidden_states = self.intermediate_act_fn(hidden_states)
        return hidden_states

dense `instance-attribute` ¶

dense = ColumnParallelLinear(
    input_size=hidden_size,
    output_size=intermediate_size,
    bias=True,
    quant_config=quant_config,
    prefix=f"{prefix}.dense",
)

intermediate_act_fn `instance-attribute` ¶

intermediate_act_fn = get_act_fn(hidden_act)

init ¶

__init__(
    hidden_size: int,
    intermediate_size: int,
    hidden_act: str,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(self,
             hidden_size: int,
             intermediate_size: int,
             hidden_act: str,
             quant_config: Optional[QuantizationConfig] = None,
             prefix: str = ""):
    super().__init__()
    self.dense = ColumnParallelLinear(input_size=hidden_size,
                                      output_size=intermediate_size,
                                      bias=True,
                                      quant_config=quant_config,
                                      prefix=f"{prefix}.dense")
    self.intermediate_act_fn = get_act_fn(hidden_act)

forward ¶

forward(hidden_states: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(self, hidden_states: torch.Tensor) -> torch.Tensor:
    hidden_states, _ = self.dense(hidden_states)
    hidden_states = self.intermediate_act_fn(hidden_states)
    return hidden_states

BertLayer ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertLayer(nn.Module):

    def __init__(self,
                 config: BertConfig,
                 cache_config: Optional[CacheConfig] = None,
                 quant_config: Optional[QuantizationConfig] = None,
                 prefix: str = ""):
        super().__init__()

        self.attention = BertAttention(
            hidden_size=config.hidden_size,
            num_attention_heads=config.num_attention_heads,
            layer_norm_eps=config.layer_norm_eps,
            cache_config=cache_config,
            quant_config=quant_config,
            prefix=f"{prefix}.attention")

        self.intermediate = BertIntermediate(
            hidden_size=config.hidden_size,
            intermediate_size=config.intermediate_size,
            hidden_act=config.hidden_act,
            quant_config=quant_config,
            prefix=f"{prefix}.intermediate")

        self.output = BertOutput(hidden_size=config.hidden_size,
                                 intermediate_size=config.intermediate_size,
                                 layer_norm_eps=config.layer_norm_eps,
                                 quant_config=quant_config,
                                 prefix=f"{prefix}.output")

    def forward(self, hidden_states: torch.Tensor):
        attn_output = self.attention(hidden_states)
        intermediate_output = self.intermediate(attn_output)
        output = self.output(intermediate_output, attn_output)
        return output

attention `instance-attribute` ¶

attention = BertAttention(
    hidden_size=hidden_size,
    num_attention_heads=num_attention_heads,
    layer_norm_eps=layer_norm_eps,
    cache_config=cache_config,
    quant_config=quant_config,
    prefix=f"{prefix}.attention",
)

intermediate `instance-attribute` ¶

intermediate = BertIntermediate(
    hidden_size=hidden_size,
    intermediate_size=intermediate_size,
    hidden_act=hidden_act,
    quant_config=quant_config,
    prefix=f"{prefix}.intermediate",
)

output `instance-attribute` ¶

output = BertOutput(
    hidden_size=hidden_size,
    intermediate_size=intermediate_size,
    layer_norm_eps=layer_norm_eps,
    quant_config=quant_config,
    prefix=f"{prefix}.output",
)

init ¶

__init__(
    config: BertConfig,
    cache_config: Optional[CacheConfig] = None,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(self,
             config: BertConfig,
             cache_config: Optional[CacheConfig] = None,
             quant_config: Optional[QuantizationConfig] = None,
             prefix: str = ""):
    super().__init__()

    self.attention = BertAttention(
        hidden_size=config.hidden_size,
        num_attention_heads=config.num_attention_heads,
        layer_norm_eps=config.layer_norm_eps,
        cache_config=cache_config,
        quant_config=quant_config,
        prefix=f"{prefix}.attention")

    self.intermediate = BertIntermediate(
        hidden_size=config.hidden_size,
        intermediate_size=config.intermediate_size,
        hidden_act=config.hidden_act,
        quant_config=quant_config,
        prefix=f"{prefix}.intermediate")

    self.output = BertOutput(hidden_size=config.hidden_size,
                             intermediate_size=config.intermediate_size,
                             layer_norm_eps=config.layer_norm_eps,
                             quant_config=quant_config,
                             prefix=f"{prefix}.output")

forward ¶

forward(hidden_states: Tensor)

Source code in vllm/model_executor/models/bert.py

def forward(self, hidden_states: torch.Tensor):
    attn_output = self.attention(hidden_states)
    intermediate_output = self.intermediate(attn_output)
    output = self.output(intermediate_output, attn_output)
    return output

BertModel ¶

Bases: Module, SupportsQuant

Source code in vllm/model_executor/models/bert.py

@support_torch_compile
@default_pooling_type("CLS")
class BertModel(nn.Module, SupportsQuant):

    is_pooling_model = True

    packed_modules_mapping = {"qkv_proj": ["query", "key", "value"]}

    def __init__(
        self,
        *,
        vllm_config: VllmConfig,
        prefix: str = "",
        embedding_class: type[nn.Module] = BertEmbedding,
    ) -> None:
        super().__init__()

        self.config = vllm_config.model_config.hf_config
        self.embeddings = embedding_class(self.config)
        self.encoder = BertEncoder(vllm_config=vllm_config,
                                   prefix=f"{prefix}.encoder")

    def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
        return self.embeddings(input_ids)

    def forward(
        self,
        input_ids: torch.Tensor,
        positions: torch.Tensor,
        intermediate_tensors: Optional[IntermediateTensors] = None,
        inputs_embeds: Optional[torch.Tensor] = None,
    ) -> torch.Tensor:
        hidden_states = self.embeddings(
            input_ids=input_ids,
            position_ids=positions,
            inputs_embeds=inputs_embeds,
        )

        return self.encoder(hidden_states)

    def _load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
        stacked_params_mapping = [
            # (param_name, shard_name, shard_id)
            ("qkv_proj", "query", "q"),
            ("qkv_proj", "key", "k"),
            ("qkv_proj", "value", "v"),
        ]

        loaded_stacked_params = []
        other_weights = []
        params_dict = dict(self.named_parameters())
        for name, loaded_weight in weights:
            for (param_name, weight_name, shard_id) in stacked_params_mapping:
                if weight_name not in name:
                    continue

                name = name.replace(weight_name, param_name)
                if name not in params_dict:
                    continue
                param = params_dict[name]
                weight_loader = param.weight_loader
                weight_loader(param, loaded_weight, shard_id)
                loaded_stacked_params.append(name)
                break
            else:
                if name in params_dict:
                    other_weights.append((name, loaded_weight))

        return other_weights, loaded_stacked_params

    def load_weights(self, weights: Iterable[tuple[str,
                                                   torch.Tensor]]) -> set[str]:
        other_weights, loaded_stacked_params = self._load_weights(weights)

        loader = AutoWeightsLoader(self, skip_prefixes=["pooler."])
        loaded_params = loader.load_weights(other_weights)
        loaded_params.update(loaded_stacked_params)
        return loaded_params

config `instance-attribute` ¶

config = hf_config

embeddings `instance-attribute` ¶

embeddings = embedding_class(config)

encoder `instance-attribute` ¶

encoder = BertEncoder(
    vllm_config=vllm_config, prefix=f"{prefix}.encoder"
)

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

packed_modules_mapping `class-attribute` `instance-attribute` ¶

packed_modules_mapping = {
    "qkv_proj": ["query", "key", "value"]
}

init ¶

__init__(
    *,
    vllm_config: VllmConfig,
    prefix: str = "",
    embedding_class: type[Module] = BertEmbedding,
) -> None

Source code in vllm/model_executor/models/bert.py

def __init__(
    self,
    *,
    vllm_config: VllmConfig,
    prefix: str = "",
    embedding_class: type[nn.Module] = BertEmbedding,
) -> None:
    super().__init__()

    self.config = vllm_config.model_config.hf_config
    self.embeddings = embedding_class(self.config)
    self.encoder = BertEncoder(vllm_config=vllm_config,
                               prefix=f"{prefix}.encoder")

_load_weights ¶

_load_weights(weights: Iterable[tuple[str, Tensor]])

Source code in vllm/model_executor/models/bert.py

def _load_weights(self, weights: Iterable[tuple[str, torch.Tensor]]):
    stacked_params_mapping = [
        # (param_name, shard_name, shard_id)
        ("qkv_proj", "query", "q"),
        ("qkv_proj", "key", "k"),
        ("qkv_proj", "value", "v"),
    ]

    loaded_stacked_params = []
    other_weights = []
    params_dict = dict(self.named_parameters())
    for name, loaded_weight in weights:
        for (param_name, weight_name, shard_id) in stacked_params_mapping:
            if weight_name not in name:
                continue

            name = name.replace(weight_name, param_name)
            if name not in params_dict:
                continue
            param = params_dict[name]
            weight_loader = param.weight_loader
            weight_loader(param, loaded_weight, shard_id)
            loaded_stacked_params.append(name)
            break
        else:
            if name in params_dict:
                other_weights.append((name, loaded_weight))

    return other_weights, loaded_stacked_params

forward ¶

forward(
    input_ids: Tensor,
    positions: Tensor,
    intermediate_tensors: Optional[
        IntermediateTensors
    ] = None,
    inputs_embeds: Optional[Tensor] = None,
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    input_ids: torch.Tensor,
    positions: torch.Tensor,
    intermediate_tensors: Optional[IntermediateTensors] = None,
    inputs_embeds: Optional[torch.Tensor] = None,
) -> torch.Tensor:
    hidden_states = self.embeddings(
        input_ids=input_ids,
        position_ids=positions,
        inputs_embeds=inputs_embeds,
    )

    return self.encoder(hidden_states)

get_input_embeddings ¶

get_input_embeddings(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def get_input_embeddings(self, input_ids: torch.Tensor) -> torch.Tensor:
    return self.embeddings(input_ids)

load_weights ¶

load_weights(
    weights: Iterable[tuple[str, Tensor]],
) -> set[str]

Source code in vllm/model_executor/models/bert.py

def load_weights(self, weights: Iterable[tuple[str,
                                               torch.Tensor]]) -> set[str]:
    other_weights, loaded_stacked_params = self._load_weights(weights)

    loader = AutoWeightsLoader(self, skip_prefixes=["pooler."])
    loaded_params = loader.load_weights(other_weights)
    loaded_params.update(loaded_stacked_params)
    return loaded_params

BertOutput ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertOutput(nn.Module):

    def __init__(self,
                 hidden_size: int,
                 intermediate_size: int,
                 layer_norm_eps: float,
                 quant_config: Optional[QuantizationConfig] = None,
                 prefix: str = ""):
        super().__init__()

        self.dense = RowParallelLinear(input_size=intermediate_size,
                                       output_size=hidden_size,
                                       bias=True,
                                       quant_config=quant_config,
                                       prefix=f"{prefix}.dense")

        self.LayerNorm = nn.LayerNorm(hidden_size, eps=layer_norm_eps)

    def forward(self, hidden_states: torch.Tensor,
                input_tensor: torch.Tensor) -> torch.Tensor:
        hidden_states, _ = self.dense(hidden_states)
        hidden_states = self.LayerNorm(hidden_states + input_tensor)
        return hidden_states

LayerNorm `instance-attribute` ¶

LayerNorm = LayerNorm(hidden_size, eps=layer_norm_eps)

dense `instance-attribute` ¶

dense = RowParallelLinear(
    input_size=intermediate_size,
    output_size=hidden_size,
    bias=True,
    quant_config=quant_config,
    prefix=f"{prefix}.dense",
)

init ¶

__init__(
    hidden_size: int,
    intermediate_size: int,
    layer_norm_eps: float,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(self,
             hidden_size: int,
             intermediate_size: int,
             layer_norm_eps: float,
             quant_config: Optional[QuantizationConfig] = None,
             prefix: str = ""):
    super().__init__()

    self.dense = RowParallelLinear(input_size=intermediate_size,
                                   output_size=hidden_size,
                                   bias=True,
                                   quant_config=quant_config,
                                   prefix=f"{prefix}.dense")

    self.LayerNorm = nn.LayerNorm(hidden_size, eps=layer_norm_eps)

forward ¶

forward(
    hidden_states: Tensor, input_tensor: Tensor
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(self, hidden_states: torch.Tensor,
            input_tensor: torch.Tensor) -> torch.Tensor:
    hidden_states, _ = self.dense(hidden_states)
    hidden_states = self.LayerNorm(hidden_states + input_tensor)
    return hidden_states

BertPooler ¶

Bases: Pooler

Source code in vllm/model_executor/models/bert.py

class BertPooler(Pooler):

    def __init__(self, config: BertConfig):
        super().__init__()

        self.pooling = PoolingMethod.from_pooling_type(PoolingType.CLS)
        self.dense = nn.Linear(config.hidden_size, config.hidden_size)
        self.activation = nn.Tanh()

    def get_supported_tasks(self) -> Set[PoolingTask]:
        return self.pooling.get_supported_tasks()

    def get_pooling_updates(self, task: PoolingTask) -> PoolingParamsUpdate:
        return self.pooling.get_pooling_updates(task)

    def _head(self, pooled_output: torch.Tensor):
        pooled_output = self.dense(pooled_output)
        pooled_output = self.activation(pooled_output)
        return pooled_output

    def forward(
        self,
        hidden_states: Union[torch.Tensor, list[torch.Tensor]],
        pooling_metadata: PoolingMetadata,
    ) -> Union[torch.Tensor, list[torch.Tensor]]:
        pooled_output = self.pooling(hidden_states, pooling_metadata)

        if isinstance(pooled_output, list):
            pooled_output = [self._head(output) for output in pooled_output]
        else:
            pooled_output = self._head(pooled_output)

        return pooled_output

activation `instance-attribute` ¶

activation = Tanh()

dense `instance-attribute` ¶

dense = Linear(hidden_size, hidden_size)

pooling `instance-attribute` ¶

pooling = from_pooling_type(CLS)

init ¶

__init__(config: BertConfig)

Source code in vllm/model_executor/models/bert.py

def __init__(self, config: BertConfig):
    super().__init__()

    self.pooling = PoolingMethod.from_pooling_type(PoolingType.CLS)
    self.dense = nn.Linear(config.hidden_size, config.hidden_size)
    self.activation = nn.Tanh()

_head ¶

_head(pooled_output: Tensor)

Source code in vllm/model_executor/models/bert.py

def _head(self, pooled_output: torch.Tensor):
    pooled_output = self.dense(pooled_output)
    pooled_output = self.activation(pooled_output)
    return pooled_output

forward ¶

forward(
    hidden_states: Union[Tensor, list[Tensor]],
    pooling_metadata: PoolingMetadata,
) -> Union[Tensor, list[Tensor]]

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    hidden_states: Union[torch.Tensor, list[torch.Tensor]],
    pooling_metadata: PoolingMetadata,
) -> Union[torch.Tensor, list[torch.Tensor]]:
    pooled_output = self.pooling(hidden_states, pooling_metadata)

    if isinstance(pooled_output, list):
        pooled_output = [self._head(output) for output in pooled_output]
    else:
        pooled_output = self._head(pooled_output)

    return pooled_output

get_pooling_updates ¶

get_pooling_updates(
    task: PoolingTask,
) -> PoolingParamsUpdate

Source code in vllm/model_executor/models/bert.py

def get_pooling_updates(self, task: PoolingTask) -> PoolingParamsUpdate:
    return self.pooling.get_pooling_updates(task)

get_supported_tasks ¶

get_supported_tasks() -> Set[PoolingTask]

Source code in vllm/model_executor/models/bert.py

def get_supported_tasks(self) -> Set[PoolingTask]:
    return self.pooling.get_supported_tasks()

BertPoolingModel ¶

Bases: BertModel

Source code in vllm/model_executor/models/bert.py

@default_pooling_type("ALL")
class BertPoolingModel(BertModel):

    is_pooling_model = True

    def __init__(
        self,
        *,
        vllm_config: VllmConfig,
        prefix: str = "",
        embedding_class: type[nn.Module] = BertEmbedding,
    ) -> None:
        super().__init__(
            vllm_config=vllm_config,
            prefix=prefix,
            embedding_class=embedding_class,
        )

        config = vllm_config.model_config.hf_config
        self.pooler = BertPooler(config)

    def load_weights(self, weights: Iterable[tuple[str,
                                                   torch.Tensor]]) -> set[str]:
        other_weights, loaded_stacked_params = self._load_weights(weights)

        loader = AutoWeightsLoader(self)
        loaded_params = loader.load_weights(other_weights)
        loaded_params.update(loaded_stacked_params)
        return loaded_params

is_pooling_model `class-attribute` `instance-attribute` ¶

is_pooling_model = True

pooler `instance-attribute` ¶

pooler = BertPooler(config)

init ¶

__init__(
    *,
    vllm_config: VllmConfig,
    prefix: str = "",
    embedding_class: type[Module] = BertEmbedding,
) -> None

Source code in vllm/model_executor/models/bert.py

def __init__(
    self,
    *,
    vllm_config: VllmConfig,
    prefix: str = "",
    embedding_class: type[nn.Module] = BertEmbedding,
) -> None:
    super().__init__(
        vllm_config=vllm_config,
        prefix=prefix,
        embedding_class=embedding_class,
    )

    config = vllm_config.model_config.hf_config
    self.pooler = BertPooler(config)

load_weights ¶

load_weights(
    weights: Iterable[tuple[str, Tensor]],
) -> set[str]

Source code in vllm/model_executor/models/bert.py

def load_weights(self, weights: Iterable[tuple[str,
                                               torch.Tensor]]) -> set[str]:
    other_weights, loaded_stacked_params = self._load_weights(weights)

    loader = AutoWeightsLoader(self)
    loaded_params = loader.load_weights(other_weights)
    loaded_params.update(loaded_stacked_params)
    return loaded_params

BertSelfAttention ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertSelfAttention(nn.Module):

    def __init__(
        self,
        hidden_size: int,
        num_attention_heads: int,
        cache_config: Optional[CacheConfig] = None,
        quant_config: Optional[QuantizationConfig] = None,
        prefix: str = "",
    ):
        super().__init__()
        self.hidden_size = hidden_size
        tp_size = get_tensor_model_parallel_world_size()

        self.total_num_heads = num_attention_heads
        assert self.total_num_heads % tp_size == 0

        self.num_heads = self.total_num_heads // tp_size
        self.total_num_kv_heads = self.total_num_heads
        self.head_dim = self.hidden_size // self.total_num_heads
        assert self.head_dim * self.total_num_heads == self.hidden_size

        self.num_kv_heads = max(1, self.total_num_kv_heads // tp_size)

        self.q_size = self.num_heads * self.head_dim
        self.kv_size = self.num_kv_heads * self.head_dim
        self.scaling = self.head_dim**-0.5
        self.qkv_proj = QKVParallelLinear(
            hidden_size=self.hidden_size,
            head_size=self.head_dim,
            total_num_heads=self.total_num_heads,
            total_num_kv_heads=self.total_num_kv_heads,
            bias=True,
            quant_config=quant_config,
            prefix=f"{prefix}.qkv_proj")

        self.attn = EncoderOnlyAttention(num_heads=self.num_heads,
                                         head_size=self.head_dim,
                                         scale=self.scaling,
                                         num_kv_heads=self.num_kv_heads,
                                         cache_config=cache_config,
                                         quant_config=quant_config,
                                         prefix=f"{prefix}.attn")

    def forward(
        self,
        hidden_states: torch.Tensor,
    ) -> torch.Tensor:
        qkv, _ = self.qkv_proj(hidden_states)
        q, k, v = qkv.split([self.q_size, self.kv_size, self.kv_size], dim=-1)
        output = self.attn(q, k, v)
        return output

attn `instance-attribute` ¶

attn = EncoderOnlyAttention(
    num_heads=num_heads,
    head_size=head_dim,
    scale=scaling,
    num_kv_heads=num_kv_heads,
    cache_config=cache_config,
    quant_config=quant_config,
    prefix=f"{prefix}.attn",
)

head_dim `instance-attribute` ¶

head_dim = hidden_size // total_num_heads

hidden_size `instance-attribute` ¶

hidden_size = hidden_size

kv_size `instance-attribute` ¶

kv_size = num_kv_heads * head_dim

num_heads `instance-attribute` ¶

num_heads = total_num_heads // tp_size

num_kv_heads `instance-attribute` ¶

num_kv_heads = max(1, total_num_kv_heads // tp_size)

q_size `instance-attribute` ¶

q_size = num_heads * head_dim

qkv_proj `instance-attribute` ¶

qkv_proj = QKVParallelLinear(
    hidden_size=hidden_size,
    head_size=head_dim,
    total_num_heads=total_num_heads,
    total_num_kv_heads=total_num_kv_heads,
    bias=True,
    quant_config=quant_config,
    prefix=f"{prefix}.qkv_proj",
)

scaling `instance-attribute` ¶

scaling = head_dim ** -0.5

total_num_heads `instance-attribute` ¶

total_num_heads = num_attention_heads

total_num_kv_heads `instance-attribute` ¶

total_num_kv_heads = total_num_heads

init ¶

__init__(
    hidden_size: int,
    num_attention_heads: int,
    cache_config: Optional[CacheConfig] = None,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(
    self,
    hidden_size: int,
    num_attention_heads: int,
    cache_config: Optional[CacheConfig] = None,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
):
    super().__init__()
    self.hidden_size = hidden_size
    tp_size = get_tensor_model_parallel_world_size()

    self.total_num_heads = num_attention_heads
    assert self.total_num_heads % tp_size == 0

    self.num_heads = self.total_num_heads // tp_size
    self.total_num_kv_heads = self.total_num_heads
    self.head_dim = self.hidden_size // self.total_num_heads
    assert self.head_dim * self.total_num_heads == self.hidden_size

    self.num_kv_heads = max(1, self.total_num_kv_heads // tp_size)

    self.q_size = self.num_heads * self.head_dim
    self.kv_size = self.num_kv_heads * self.head_dim
    self.scaling = self.head_dim**-0.5
    self.qkv_proj = QKVParallelLinear(
        hidden_size=self.hidden_size,
        head_size=self.head_dim,
        total_num_heads=self.total_num_heads,
        total_num_kv_heads=self.total_num_kv_heads,
        bias=True,
        quant_config=quant_config,
        prefix=f"{prefix}.qkv_proj")

    self.attn = EncoderOnlyAttention(num_heads=self.num_heads,
                                     head_size=self.head_dim,
                                     scale=self.scaling,
                                     num_kv_heads=self.num_kv_heads,
                                     cache_config=cache_config,
                                     quant_config=quant_config,
                                     prefix=f"{prefix}.attn")

forward ¶

forward(hidden_states: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(
    self,
    hidden_states: torch.Tensor,
) -> torch.Tensor:
    qkv, _ = self.qkv_proj(hidden_states)
    q, k, v = qkv.split([self.q_size, self.kv_size, self.kv_size], dim=-1)
    output = self.attn(q, k, v)
    return output

BertSelfOutput ¶

Bases: Module

Source code in vllm/model_executor/models/bert.py

class BertSelfOutput(nn.Module):

    def __init__(self,
                 hidden_size: int,
                 layer_norm_eps: float,
                 quant_config: Optional[QuantizationConfig] = None,
                 prefix: str = ""):
        super().__init__()
        self.dense = RowParallelLinear(input_size=hidden_size,
                                       output_size=hidden_size,
                                       bias=True,
                                       quant_config=quant_config,
                                       prefix=f"{prefix}.dense")
        self.LayerNorm = nn.LayerNorm(hidden_size, eps=layer_norm_eps)

    def forward(self, hidden_states: torch.Tensor,
                input_tensor: torch.Tensor) -> torch.Tensor:
        hidden_states, _ = self.dense(hidden_states)
        hidden_states = self.LayerNorm(hidden_states + input_tensor)
        return hidden_states

LayerNorm `instance-attribute` ¶

LayerNorm = LayerNorm(hidden_size, eps=layer_norm_eps)

dense `instance-attribute` ¶

dense = RowParallelLinear(
    input_size=hidden_size,
    output_size=hidden_size,
    bias=True,
    quant_config=quant_config,
    prefix=f"{prefix}.dense",
)

init ¶

__init__(
    hidden_size: int,
    layer_norm_eps: float,
    quant_config: Optional[QuantizationConfig] = None,
    prefix: str = "",
)

Source code in vllm/model_executor/models/bert.py

def __init__(self,
             hidden_size: int,
             layer_norm_eps: float,
             quant_config: Optional[QuantizationConfig] = None,
             prefix: str = ""):
    super().__init__()
    self.dense = RowParallelLinear(input_size=hidden_size,
                                   output_size=hidden_size,
                                   bias=True,
                                   quant_config=quant_config,
                                   prefix=f"{prefix}.dense")
    self.LayerNorm = nn.LayerNorm(hidden_size, eps=layer_norm_eps)

forward ¶

forward(
    hidden_states: Tensor, input_tensor: Tensor
) -> Tensor

Source code in vllm/model_executor/models/bert.py

def forward(self, hidden_states: torch.Tensor,
            input_tensor: torch.Tensor) -> torch.Tensor:
    hidden_states, _ = self.dense(hidden_states)
    hidden_states = self.LayerNorm(hidden_states + input_tensor)
    return hidden_states

_decode_token_type_ids ¶

_decode_token_type_ids(input_ids: Tensor) -> Tensor

Source code in vllm/model_executor/models/bert.py

def _decode_token_type_ids(input_ids: torch.Tensor) -> torch.Tensor:

    ids_mask = torch.ones_like(input_ids,
                               dtype=torch.int32,
                               device=input_ids.device) << TOKEN_TYPE_SHIFT
    tokens_mask = ids_mask.bitwise_not()

    token_type_ids = input_ids.bitwise_and(ids_mask) >> TOKEN_TYPE_SHIFT

    input_ids.bitwise_and_(tokens_mask)

    return token_type_ids

_encode_token_type_ids ¶

_encode_token_type_ids(
    input_ids: Tensor, token_type_ids: Tensor
) -> None

Source code in vllm/model_executor/models/bert.py

def _encode_token_type_ids(input_ids: torch.Tensor,
                           token_type_ids: torch.Tensor) -> None:
    # input_ids can be padded to the right
    input_ids[:token_type_ids.shape[0]].bitwise_or_(
        token_type_ids << TOKEN_TYPE_SHIFT)

vllm.model_executor.models.bert ¶

TOKEN_TYPE_SHIFT module-attribute ¶

BertAttention ¶

output instance-attribute ¶

self instance-attribute ¶

__init__ ¶

forward ¶

BertEmbedding ¶

LayerNorm instance-attribute ¶

position_embedding_type instance-attribute ¶

position_embeddings instance-attribute ¶

size instance-attribute ¶

token_type_embeddings instance-attribute ¶

word_embeddings instance-attribute ¶

__init__ ¶

forward ¶

BertEmbeddingModel ¶

is_pooling_model class-attribute instance-attribute ¶

model instance-attribute ¶

pooler instance-attribute ¶

__init__ ¶

_build_model ¶

_build_pooler ¶

forward ¶

get_input_embeddings ¶

load_weights ¶

BertEncoder ¶

layer instance-attribute ¶

__init__ ¶

forward ¶

BertForSequenceClassification ¶

bert instance-attribute ¶

classifier instance-attribute ¶

is_pooling_model class-attribute instance-attribute ¶

num_labels instance-attribute ¶

pooler instance-attribute ¶

__init__ ¶

forward ¶

get_input_embeddings ¶

load_weights ¶

BertForTokenClassification ¶

bert instance-attribute ¶

classifier instance-attribute ¶

head_dtype instance-attribute ¶

is_pooling_model class-attribute instance-attribute ¶

num_labels instance-attribute ¶

pooler instance-attribute ¶

__init__ ¶

forward ¶

get_input_embeddings ¶

load_weights ¶

BertIntermediate ¶

dense instance-attribute ¶

intermediate_act_fn instance-attribute ¶

__init__ ¶

forward ¶

BertLayer ¶

attention instance-attribute ¶

intermediate instance-attribute ¶

output instance-attribute ¶

__init__ ¶

forward ¶

BertModel ¶

config instance-attribute ¶

embeddings instance-attribute ¶

encoder instance-attribute ¶

is_pooling_model class-attribute instance-attribute ¶

packed_modules_mapping class-attribute instance-attribute ¶

__init__ ¶

_load_weights ¶

forward ¶

get_input_embeddings ¶

load_weights ¶

BertOutput ¶

LayerNorm instance-attribute ¶

dense instance-attribute ¶

__init__ ¶

forward ¶

BertPooler ¶

activation instance-attribute ¶

TOKEN_TYPE_SHIFT `module-attribute` ¶

output `instance-attribute` ¶

self `instance-attribute` ¶

init ¶

LayerNorm `instance-attribute` ¶

position_embedding_type `instance-attribute` ¶

position_embeddings `instance-attribute` ¶

size `instance-attribute` ¶

token_type_embeddings `instance-attribute` ¶

word_embeddings `instance-attribute` ¶

init ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

model `instance-attribute` ¶

pooler `instance-attribute` ¶

init ¶

layer `instance-attribute` ¶

init ¶

bert `instance-attribute` ¶

classifier `instance-attribute` ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

num_labels `instance-attribute` ¶

pooler `instance-attribute` ¶

init ¶

bert `instance-attribute` ¶

classifier `instance-attribute` ¶

head_dtype `instance-attribute` ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

num_labels `instance-attribute` ¶

pooler `instance-attribute` ¶

init ¶

dense `instance-attribute` ¶

intermediate_act_fn `instance-attribute` ¶

init ¶

attention `instance-attribute` ¶

intermediate `instance-attribute` ¶

output `instance-attribute` ¶

init ¶

config `instance-attribute` ¶

embeddings `instance-attribute` ¶

encoder `instance-attribute` ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

packed_modules_mapping `class-attribute` `instance-attribute` ¶

init ¶

LayerNorm `instance-attribute` ¶

dense `instance-attribute` ¶

init ¶

activation `instance-attribute` ¶

dense `instance-attribute` ¶

pooling `instance-attribute` ¶

init ¶

is_pooling_model `class-attribute` `instance-attribute` ¶

pooler `instance-attribute` ¶

init ¶

attn `instance-attribute` ¶

head_dim `instance-attribute` ¶

hidden_size `instance-attribute` ¶

kv_size `instance-attribute` ¶

num_heads `instance-attribute` ¶

num_kv_heads `instance-attribute` ¶

q_size `instance-attribute` ¶

qkv_proj `instance-attribute` ¶

scaling `instance-attribute` ¶

total_num_heads `instance-attribute` ¶

total_num_kv_heads `instance-attribute` ¶

init ¶

LayerNorm `instance-attribute` ¶

dense `instance-attribute` ¶

init ¶