Transformer——多头注意力机制(Pytorch)
创始人
2025-01-11 08:34:26
0

1. 原理图

2. 代码

import torch import torch.nn as nn   class Multi_Head_Self_Attention(nn.Module):     def __init__(self, embed_size, heads):         super(Multi_Head_Self_Attention, self).__init__()         self.embed_size = embed_size         self.heads = heads         self.head_dim = embed_size // heads          self.queries = nn.Linear(self.embed_size, self.embed_size, bias=False)         self.keys = nn.Linear(self.embed_size, self.embed_size, bias=False)         self.values = nn.Linear(self.embed_size, self.embed_size, bias=False)         self.fc_out = nn.Linear(self.embed_size, self.embed_size, bias=False)      def forward(self,queries, keys, values, mask):         N = queries.shape[0]  # batch_size         query_len = queries.shape[1]  # sequence_length         key_len = keys.shape[1]  # sequence_length          value_len = values.shape[1]  # sequence_length          queries = self.queries(queries)         keys = self.keys(keys)         values = self.values(values)          # Split the embedding into self.heads pieces         # batch_size, sequence_length, embed_size(512) -->          # batch_size, sequence_length, heads(8), head_dim(64)         queries = queries.reshape(N, query_len, self.heads, self.head_dim)         keys = keys.reshape(N, key_len, self.heads, self.head_dim)         values = values.reshape(N, value_len, self.heads, self.head_dim)          # batch_size, sequence_length, heads(8), head_dim(64) -->          # batch_size, heads(8), sequence_length, head_dim(64)         queries = queries.transpose(1, 2)         keys = keys.transpose(1, 2)         values = values.transpose(1, 2)          # Scaled dot-product attention         score = torch.matmul(queries, keys.transpose(-2, -1)) / (self.head_dim ** (1/2))          if mask is not None:             score = score.masked_fill(mask == 0, float("-inf"))         # batch_size, heads(8), sequence_length, sequence_length         attention = torch.softmax(score, dim=-1)          out = torch.matmul(attention, values)         # batch_size, heads(8), sequence_length, head_dim(64) -->         # batch_size, sequence_length, heads(8), head_dim(64) -->         # batch_size, sequence_length, embed_size(512)         # 为了方便送入后面的网络         out = out.transpose(1, 2).contiguous().reshape(N, query_len, self.embed_size)         out = self.fc_out(out)          return out       batch_size = 64 sequence_length = 10 embed_size = 512 heads = 8 mask = None  Q = torch.randn(batch_size, sequence_length, embed_size)   K = torch.randn(batch_size, sequence_length, embed_size)   V = torch.randn(batch_size, sequence_length, embed_size)    model = Multi_Head_Self_Attention(embed_size, heads) output = model(Q, K, V, mask) print(output.shape)

 

相关内容

热门资讯

围绕透视问题!微乐填大坑辅助透... 围绕透视问题!微乐填大坑辅助透视挂,友相逢确实有挂,竟然真的有挂1、在微乐填大坑插件功能辅助器技巧中...
2026版规律!来来灯塔辅助透... 2026版规律!来来灯塔辅助透视挂,天天爱泰州麻将真的是有挂,原来真的有挂;小薇(辅助器软件下载)致...
更值得关注的是!心悦辽宁麻将辅... 更值得关注的是!心悦辽宁麻将辅助透视挂,微友麻将真的是有挂,果然真的有挂1、这是跨平台的心悦辽宁麻将...
据相关数据显示!开心跑胡子辅助... 据相关数据显示!开心跑胡子辅助透视挂,兴动互娱存在有挂,总是果真有挂1、开心跑胡子免费脚本咨询教程、...
反观!悠闲麻将川南辅助透视挂,... 反观!悠闲麻将川南辅助透视挂,汇有王者真的是有挂,好像有挂秘籍一、悠闲麻将川南可以开透视的定义与意义...
一直以来!PG娱乐城辅助透视挂... 一直以来!PG娱乐城辅助透视挂,灵飞承德麻将是有挂,确实有挂规律PG娱乐城能透视中分为三种模型:PG...
2026版复盘!闲聚辅助透视挂... 您好,闲聚这款游戏可以开挂的,确实是有挂的,需要了解加去威信【136704302】很多玩家在这款游戏...
近日!collisionsto... 近日!collisionstory辅助透视挂,边锋老友阜新麻将存在有挂,确实有挂猫腻1、边锋老友阜新...
相较于以往!正大互娱辅助透视挂... 相较于以往!正大互娱辅助透视挂,边锋舟山棋牌确实有挂,切实真实有挂1、许多玩家不知道正大互娱辅助怎么...
无独有偶!经典推倒胡辅助透视挂... 无独有偶!经典推倒胡辅助透视挂,智玩是有挂,确实有挂秘诀1、经典推倒胡辅助器安装包、经典推倒胡辅助器...