一文彻底搞懂多模态
发布时间:2024-11-15 00:52:27点击:
大语言模型推理
大语言模型推理(LargeLanguage Model Reasoning)是一种利用大型语言模型进行的分析、判断和得出结论的过程,这通常涉及到对 语言的理解、逻辑关系的把握以及知识的应用 等多个方面。在大语言模型推理中,模型能够处理复杂的 自然语言输入 ,理解其含义,并根据这些信息 进行推理 ,最终生成 有意义的输出
接下来分三部分: 指令调优 、上下文学习、 思维链, 一起来深入了解多模态基础: 大语言模型推理
大语言模型推理
一、指令调优
什么是指令调优Instruction Tuning 指令调优是通过在一组以指令格式组织的数据集上微调预训练的LLM,以实现对未见任务的泛化能力提升。多模态指令调优则是将这种方法扩展到多模态领域。
研究人员通常 通过改编现有基准数据集或进行自我指导 来获取适用于 多模态指令调优的数据集 。在模型方面,一种常见的方法是将外部模态信息注入到LLM中,并将其作为强大的推理器。
什么是多模态指令( Multimodal Instruction )? 多模态指令数据的基本形式可以概括为(指令,多模态输入,回答)三元组。
一种直观的获得这种数据的方式是 改造基准(Benchmark)数据集 。例如,图像描述(Image Captioning)数据集,原本包括一张图片和一段文字描述(Ground Truth),这种数据自然构成了指令数据的多模态输入和回答部分, 指令部分则为相应任务的描述,一般由人工编写或者调用GPT生成。
二、上下文学习
什么是上下文学习(In-contxt Learning)? 上下文学习是LLM的一项重要且新兴的能力,它允许模型通过少量示例和可选指令进行学习,并能够在新问题上进行推广,以实现少样本学习并解决复杂且未见过的任务。在推理阶段,上下文学习(ICL)可以通过在原始样本中添加一个演示集(即一组上下文样本)来实现。这种方法特别适用于解决各种视觉推理任务,以及教导LLM使用外部工具。
在GPT-3中,In-context learning可以分为以下三种情况:
三、Chain-of-Thought(思维链)
什么是Chain-of-Thought? Chain-of-Thought(思维链,简称CoT)是一种改进的提示技术,旨在提升大型语言模型(LLMs)在复杂推理任务上的表现。Chain-of-Thought要求模型在输出最终答案之前,先展示一系列有逻辑关系的思考步骤或想法,这些步骤相互连接,形成了一个完整的思考过程。
Chain-of-Thought可以通过两种主要方式实现:Zero-Shot CoT和Few-Shot CoT。
将单模态的CoT扩展到多模态CoT,需要填补模态差距。这通常涉及将不同模态的信息进行有效对齐和融合,以便模型能够同时理解和处理来自不同模态的数据。
原文链接: