HJJJ的个人小站

HJJJ

Undergraduate Computer Science year 3 at HKU

ViT 详解:如何把一张图变成一段 token 序列

🔄 更新于 2026-08-16 VLM VLM ViT Transformer PyTorch

前言 本站的《Transformer 详解》讲了如何用注意力机制处理文本:把句子切分成 token,让任意两个位置直接交互。本文回答一个相关的问题:同一套机制,能不能用来处理图像? 答案是能,这个架构就是 ViT(Vision Transformer,视觉 Transformer),由 Google 在 2020 年提出。它的核心思路是:把图像切成固定大小的小块(Patch),每块展平成一个向量, …

Read More

从 CLIP 到 LLaVA:一文读懂视觉语言模型(VLM)的演进与核心数学公式

🔄 更新于 2026-08-15 VLM VLM Multimodal CLIP LLaVA Contrastive Learning

前言 大语言模型(Large Language Model,LLM) 很会处理文字。它能把一段指令拆成 token,按概率逐字生成回复。但把它和一张图片放到一起,它就没了用武之地。给它一张图片的像素数据,它不知道画面上是一只猫还是一栋楼。它只能看文字。(注意:这里的大模型我们指的是早期的文本大模型,这个时候还没有出现 MLLM(多模态大模型),因此先不考虑现在的大模型所具备的图像识别和理解功能。但 …

Read More

LLaVA 详解:视觉指令微调的完整拆解

🔄 更新于 2026-08-15 VLM VLM LLaVA Multimodal Zero-shot

前言 本文是《从 CLIP 到 LLaVA:一文读懂视觉语言模型(VLM)的演进与核心数学公式》的配套专篇。主篇里讲了三只流派,CLIP 走对比学习对齐,Flamingo 走交叉注意力,LLaVA 走的是生成式视觉指令微调。本文把 LLaVA 这一路从架构到损失函数的每一步完整拆开,包括线性投影的数学、视觉 token 如何进入语言模型、自回归交叉熵损失的推导,以及两阶段训练的具体流程。 阅读前提 …

Read More

CLIP 详解:对比学习如何让模型同时看懂图与文

VLM VLM CLIP Contrastive Learning Zero-shot

前言 本文是《从 CLIP 到 LLaVA:一文读懂视觉语言模型(VLM)的演进与核心数学公式》的配套专篇。主篇里只讲了 CLIP 的核心思想,本文把架构、每个公式的符号、温度参数 $\tau$ 的物理意义和正负样本矩阵完整拆开。 核心思想 CLIP(Contrastive Language-Image Pre-training) 由 OpenAI 在 2021 年提出。它的思路不要求模型把图像" …

Read More

大模型不是 Agent:智能体究竟是如何运转的?

🔄 更新于 2026-08-09 AI Agent Ai agent Agent LLM Harness Tool calling Skill

什么是 Agent 你在 ChatGPT 的网页里打一句话,它回一段话。问天气,它给你天气。让它写首诗,它给你一首诗。到这里为止,你手里的是一个大语言模型(Large Language Model,LLM),一个很会接话的问答机器。 可如果它自己握着键盘鼠标,自己翻仓库里的文件,自己往数据库里写数据,把一个"把项目做完"的任务从头做到尾,情况就变了。人们把这种形态叫做 Agent(智能体)。 …

Read More

Transformer 详解:从注意力机制到代码实战

🔄 更新于 2026-08-06 Deep Learning Theory Transformer Attention PyTorch

前言 Transformer 是目前深度学习中最重要的一类架构。从 GPT、BERT 这类大语言模型,到 ViT 这类视觉模型,近几年绝大多数突破背后都有它的身影。可以说,理解 Transformer 是读懂当代 AI 的必修课。 本文假设你已经读过本站的《正向传播与反向传播:神经网络到底如何学习》,理解"网络是一串函数复合、训练时误差沿链式法则反向流动"这两条主线。我们会沿用同样的思路拆解 …

Read More

Softmax 与缩放点积的数学:Attention 背后的概率与数值

🔄 更新于 2026-08-04 AI Math Softmax Attention Jacobian

前言 这篇文章是本站《Transformer 详解:从注意力机制到代码实战》的数学补充。它的定位非常具体:只讲"服务 Attention 的数学",不重复基础线性代数。 我们假设你已经读过本站的《矩阵微积分如何服务反向传播》,理解 Jacobian 与向量-Jacobian 乘积(VJP)这两个概念。在此基础上,本文回答三个问题: softmax 的梯度长什么样,为什么是这个形式? 为什么 …

Read More

线性代数基础(三):特征值与分解

线性代数 Theory Linear algebra Eigenvalue Svd

前言 前两篇讲了向量和矩阵。这一篇回答一个更深刻的问题:矩阵这个变换,有没有"主轴"? 沿着某个方向,变换可能只是单纯地拉伸(方向不变、长度变);沿着另一个方向,可能完全不动。抓住这些"不改变方向"的方向,矩阵的行为就一目了然了。 这就是特征值与特征向量的思想。它在深度学习里极其重要——梯度消失/爆炸、LoRA、PCA、甚至注意力里的缩放,背后都有它的影子。 特征值与特征向量 定义 对 $n …

Read More

线性代数基础(二):矩阵与线性变换

线性代数 Theory Linear algebra Matrix

前言 上一篇讲了向量。这一篇把向量"组织"起来——矩阵。矩阵是连接向量与线性变换的桥梁,也是神经网络里几乎所有计算(全连接层、注意力中的 $QK^\top$、反向传播的梯度回传)的载体。 读完本文,你会理解三件事:矩阵乘法到底在算什么、为什么神经网络一层是 $z = Wx + b$、以及 Jacobian 为什么能写成矩阵。 矩阵:数与表 矩阵是排成矩形的数表。一个 $m \times n$ 矩阵 …

Read More

线性代数基础(一):向量与空间

线性代数 Theory Linear algebra Vector

前言 这是"线性代数基础"专栏的第一篇。这个专栏的目的很明确:补齐看懂本站进阶数学文章所需的基础。读完本文(以及后续两篇),你应该能顺畅读懂《矩阵微积分如何服务反向传播》和《Softmax 与缩放点积的数学》。 我们从一个最朴素的问题开始:什么是向量? 它为什么值得花一整篇来讨论? 向量:从几何到坐标 向量有两种看待方式,二者等价,互为补充: 几何视角:向量是空间中带方向和长度的箭头。它表示"从一 …

Read More