vit 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】45|ViT:patch size 和分辨率如何锁死序列长度,归纳偏置去哪了

ViT 把图像切成 patch 再当 token,但 patch size 和分辨率一旦定下来,序列长度、attention 的显存和算力也同时被锁死——这不是"像素当 token"这句简化说法能盖过去的代价。本文用 Swin 的复杂度公式和可复算的数字拆开这条代价链,解释 CNN 归纳偏置为何让它在小数据上更稳、DeiT 靠数据增强和蒸馏补的是哪一块、CLS token 与位置编码在图像分辨率变化时会怎样失效,以及"还需不需要强视觉偏置"这条至今没有定论的争论。