为什么我还是无法理解transformer?

2025-06-25 02:30:10

不要想的太过复杂,就只有随机数生成的三个矩阵,原始输入已经通过矩阵相乘关联在三个随机数矩阵中,再通过一些代数游戏得到每个token对于整体输入序列的注意力权重矩阵,再和另外一个随机数矩阵进行线性的代数变化即可。

反向传播更新的是这三个矩阵的权重,三个矩阵的维度设计也是为了符合线性代数的运算。

总之这个就是一个巧妙的线性代数游戏,没有什么复杂的逻辑问题。

为什么我还是无法理解transformer?
广告位810*200
相关阅读
Rust连续多年成为最受欢迎的语言,为啥国内使用的人还是很少?

Rust连续多年成为最受欢迎的语言,为啥国内使用的人还是很少?

我在写,同时我只能说,这东西用上了就想重写别的语言的项目,配...

2025-06-18
我的世界怎么租一个四个人的服务器?

我的世界怎么租一个四个人的服务器?

我个人是用的阿里云做的内网穿透,阿里云有个峰值带宽200M不...

2025-06-18
你身边身材最好的女生是什么样?

你身边身材最好的女生是什么样?

去游泳的时候见过一个,165左右,小头宽肩细腰胯宽腿直肤白,...

2025-06-18
H264和H265谁画质好,求回谢谢!?

H264和H265谁画质好,求回谢谢!?

如果是电影,那不一定 一个电影肯定是母带最清晰,这个大家都明...

2025-06-18
Office 中为何还要保留 Access 数据库?

Office 中为何还要保留 Access 数据库?

我是做会计的,一直挺自豪Excel用得不错,确实也在工作中提...

2025-06-18