AI 技术#多模态大模型#视觉指令微调#LLaVALLaVA 视觉指令微调:从投影层对齐到多模态幻觉缓解以 LLaVA 为例,深入分析视觉指令微调如何通过两阶段训练将视觉编码器与语言模型对齐,覆盖投影层设计、数据构造与端到端微调,并讨论多模态幻觉的成因与缓解手段,为实际部署提供工程权衡。