ChatBox 的视觉模型的作用
这触及到了多模态 AI 的核心。使用 视觉模型,意味着 ChatBox 这类工具正在从一个只能读文字的助手,升级为一个 既能读文字,也能看懂图片的助手。
这触及到了多模态 AI 的核心。使用 “视觉模型”,意味着 ChatBox 这类工具正在从一个 “只能读文字的助手”,升级为一个 “既能读文字,也能看懂图片的助手”。
简单来说:之前的嵌入模型和重排模型处理的是“语义”,而视觉模型处理的是“视觉”。前者理解“说的是什么”,后者理解“画的是什么”。
如果知识库里只有文字,用不上视觉模型。但如果知识库里包含图片、图表、截图、扫描件,那就必须引入视觉模型。原因如下:
视觉模型的工作方式(在 ChatBox 知识库中)
与嵌入模型类似,但处理的不是文本而是图像:
预处理(离线): - 知识库中的每张图片被送入视觉模型。 - 模型不仅仅提取特征向量,更重要的是生成对图片的详细描述(Captioning)或多模态嵌入向量(同时包含语义和视觉特征)。 - 这些描述/向量被存入知识库索引。
检索(在线): - 用户用文字提问:“这张电路图中哪个电阻看起来烧焦了?” - 系统先用嵌入模型理解你的问题,然后在知识库中检索相关的图片(通过之前生成的描述或向量)。 - 找到候选图片后,如果启用了多模态重排,会再用视觉模型精细比对问题与图片像素。
回答: - 将最相关的图片(或图片中的关键区域)和用户的问题一起发给大语言模型。现代的多模态大模型(如GPT-4V、Claude 3、Gemini)能直接理解图片内容,并生成文字答案。
什么时候需要选视觉模型?
- 你的知识库中包含大量图片(产品目录、设计图、医疗影像、卫星图、监控截图)。
- 你的知识库是扫描的PDF(旧书、合同、报表)。
- 你需要用户能针对图表提问(销售数据分析、科学实验结果)。
- 你的业务流程依赖视觉判断(质量检测、故障诊断、医学影像分析)。
总结:三层模型的关系
- 嵌入模型:核心,必须。用于从海量文本中快速找到文字上相关的段落。
- 重排模型:增强,可选但对精度提升大。用于对文本候选进行精细排序,提升准确率。
- 视觉模型:扩展,仅在知识库有图片时需要。用于理解图片本身的像素信息,实现“看图说话”式问答。
一个简单判断标准:如果你希望用户能问“这个产品的颜色是?”(而不是“说明书写是什么颜色?”),或者问“图表里哪根柱子最高?”,那么你就需要开启视觉模型。如果你只有纯文本文档(如txt、md、纯文本PDF),则不需要。
相关推荐
chatbox重排模型是什么
一句话总结:嵌入模型负责“快速海选”,从大量文档中找出几百个候选;重排模型负责“精准复试”,从候选中重新打分、排序,挑出最靠前的几个。
chatbox知识库为什么要用嵌入模型?
因为知识库存储和检索的不是原始文档,而是文本的“语义指纹”——而嵌入模型就是生成这个“指纹”的工具。
chatbox的上下文的消息数量上限是什么意思
Chatbox里的“消息数量上限”,可以理解为 AI 的**记忆条数**。它决定了 AI 在生成新回复时,会“记住”你们对话中最近的多少条消息。
chatbox对话的温度设置
在 Chatbox(以及几乎所有 AI 对话软件/API)中,“温度” 是一个控制 AI 回答随机性或创造性的参数。
chatbox的top P是什么意思
本文解释了chatbox的top P的作用,并以实例进行演示