01 Attention 为什么能让 Token 彼此“看见”? 从 Q、K、V 到上下文表示,拆解一次注意力计算 2026 年 10 月 1 日 继续阅读 → #大模型#LLM#深度学习#Attention
03 月光:音乐中的印象派朦胧意境 用音乐描绘月光 2025 年 8 月 23 日 如何用音乐描绘月光?你可能听过贝多芬的月光曲的故事,虽然那是杜撰的,但用钢琴这种音色描绘月光委实贴切。我们今天来看看被誉为“音乐中的莫奈”的德彪西,是如何用音乐描绘月光。 继续阅读 → #古典乐
04 自注意力机制(Self-attention) 大模型基石 2025 年 7 月 27 日 在Seq2Seq问题中,一般采用Encoder-Decoder的架构来解决多输入到多输出学习,但学习效果受限于中间被压缩的Context Vector大小。那么能不能一口气直接看整个序列呢?聪明的大脑提出了今天的主角——Self-attention,不光能看全序列、提取信息相关性,甚至还能并行,TA不伟大谁伟大?!🐂🍺 继续阅读 → #深度学习
05 误差反向传播算法(Backpropagation) 深度学习的基础 2025 年 5 月 11 日 机器学习本质是学习一个函数,学习的过程是指找到这个函数中合适的参数。那该如何更新参数?一般采用梯度下降法(Gradient Descent)。在深度学习中,需要更高效的更新参数,研究出了链式法则(Chain Rule)。 继续阅读 → #深度学习