26.7.12 Agent开发日志
周末做的一套 AI Agent / RAG 面试题自测,共 19 题,记录我的回答和修正。 AI Agent(题目 Summary) Q1:MinerU 解析出来是 Markdown,相比纯文本,层级结构对检索有啥好处? MinerU 是文档解析工具。 层级检索存在标题,相较于纯文本,标题更能涵盖文本的大致含义。 Q2:你流程里的 VLM,是在检索阶段就参与,还是只在最后生成答案时才参与? VLM(视觉语言模型)的处理流程: 图片 | Vision Encoder | Image Embedding | Projector | Visual Tokens | LLM | 最终文本输出 检索阶段:输入图片和文字,VLM 对图片进行 Embedding 嵌入 -> 得到 VectorDB;对向量数据库进行整合,找出相似度最高的 Png,VLM 对 Png 进行分析。 生成答案阶段:在知识库中存在图片,搜索到 Chunk -> VLM 解析。 VLM 在检索阶段和生成阶段有什么区别? 区别在于检索对象不同。检索阶段参与时,图片本身会建立 Embedding 索引,Retriever 可以直接检索图片;生成阶段参与时,Retriever 检索的是文本 Chunk,只是在召回的 Chunk 中如果引用了图片,再调用 VLM 对图片进行理解。前者属于多模态检索(Multimodal Retrieval),后者属于多模态生成(Multimodal Generation),企业知识库更常见的是后者,因为实现简单、成本更低。 Embedding:回答的是"像不像?",用于相似度检索。 VLM 理解:回答的是"图片里是什么?",用于生成答案。 Q3:Ragas 评测里 Faithfulness(忠诚度)得分低,说明模型出了什么问题? Ragas(RAG assessment)是 RAG 测评框架,Faithfulness 衡量模型生成的答案是否忠实于检索到的上下文,有没有编造或扩展事实。 ...