<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Vlm on HJJJ的个人小站</title><link>https://hjjj.top/tags/vlm/</link><description>Recent content in Vlm on HJJJ的个人小站</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Sun, 16 Aug 2026 11:11:11 +0800</lastBuildDate><atom:link href="https://hjjj.top/tags/vlm/index.xml" rel="self" type="application/rss+xml"/><item><title>ViT 详解：如何把一张图变成一段 token 序列</title><link>https://hjjj.top/posts/computer-science/vlm/vit-intro/</link><pubDate>Thu, 13 Aug 2026 21:30:00 +0800</pubDate><guid>https://hjjj.top/posts/computer-science/vlm/vit-intro/</guid><description>从 Patch Embedding 的张量变形到图像分类：Vision Transformer 的原理、实现与局限</description></item><item><title>LLaVA 详解：视觉指令微调的完整拆解</title><link>https://hjjj.top/posts/computer-science/vlm/llava-intro/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0800</pubDate><guid>https://hjjj.top/posts/computer-science/vlm/llava-intro/</guid><description>从线性投影到自回归交叉熵损失，完整推导 LLaVA 如何把图像变成语言模型能读的 token</description></item><item><title>CLIP 详解：对比学习如何让模型同时看懂图与文</title><link>https://hjjj.top/posts/computer-science/vlm/clip-intro/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0800</pubDate><guid>https://hjjj.top/posts/computer-science/vlm/clip-intro/</guid><description>从双流架构、余弦相似度到 InfoNCE 对比损失，拆解 CLIP 的原理、零样本分类与作为 VLM 底座的应用</description></item><item><title>从 CLIP 到 LLaVA：一文读懂视觉语言模型（VLM）的演进与核心数学公式</title><link>https://hjjj.top/posts/computer-science/vlm/from-clip-to-llava/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0800</pubDate><guid>https://hjjj.top/posts/computer-science/vlm/from-clip-to-llava/</guid><description>从对比学习、生成式指令微调到交叉注意力，拆解 VLM 的架构与三大流派的核心数学原理</description></item></channel></rss>