多模态大模型简介:能看、能听、能说
果子发表于:2026-10-03 15:02:20浏览:0次
一、什么是多模态
「模态」指信息的类型:文本、图像、音频、视频等。多模态大模型就是能同时理解和生成多种信息类型的模型——例如「看图说话」「按文字生成图片」「识别语音再回答」。
二、从单模态到多模态
早期的 GPT 系列主要处理文本。随着发展,模型开始融合视觉、语音:
- 文生图:Midjourney、Stable Diffusion、DALL·E。
- 多模态理解:GPT-4V、Qwen-VL、Gemini、Claude 等可识别图片内容并回答。
- 语音:Whisper(语音转文字)、各类语音合成与实时对话模型。
三、多模态模型大致怎么工作
核心思路是「统一表示」:把图像、语音等信息先编码成与文本类似的向量,让模型在同一个「语义空间」里处理。
- 图像用视觉编码器(如 ViT)转成向量;
- 文本用分词器转成 Token;
- 两者对齐后一起送入模型;
- 模型既可理解,也可反向生成图像/语音。
四、典型应用
- 图片问答:上传截图、照片,让模型识别并回答。
- OCR 与图表理解:读表格、看流程图、提取文档信息。
- 辅助创作:根据文字生成配图、海报。
- 无障碍:为视障者描述图片、为听障者生成字幕。
五、小结
多模态让 AI 从「只会读字」走向「能看会听」。它是通往更接近人类感知的通用智能的重要一步,也是当下产品创新最活跃的方向之一。

