您的当前位置:首页>全部文章>文章详情

多模态大模型简介:能看、能听、能说

果子发表于:2026-10-03 15:02:20浏览:0次TAG:

一、什么是多模态

「模态」指信息的类型:文本、图像、音频、视频等。多模态大模型就是能同时理解和生成多种信息类型的模型——例如「看图说话」「按文字生成图片」「识别语音再回答」。

二、从单模态到多模态

早期的 GPT 系列主要处理文本。随着发展,模型开始融合视觉、语音:

  • 文生图:Midjourney、Stable Diffusion、DALL·E。
  • 多模态理解:GPT-4V、Qwen-VL、Gemini、Claude 等可识别图片内容并回答。
  • 语音:Whisper(语音转文字)、各类语音合成与实时对话模型。

三、多模态模型大致怎么工作

核心思路是「统一表示」:把图像、语音等信息先编码成与文本类似的向量,让模型在同一个「语义空间」里处理。

  1. 图像用视觉编码器(如 ViT)转成向量;
  2. 文本用分词器转成 Token;
  3. 两者对齐后一起送入模型;
  4. 模型既可理解,也可反向生成图像/语音。

四、典型应用

  • 图片问答:上传截图、照片,让模型识别并回答。
  • OCR 与图表理解:读表格、看流程图、提取文档信息。
  • 辅助创作:根据文字生成配图、海报。
  • 无障碍:为视障者描述图片、为听障者生成字幕。

五、小结

多模态让 AI 从「只会读字」走向「能看会听」。它是通往更接近人类感知的通用智能的重要一步,也是当下产品创新最活跃的方向之一。