做过的一些调研
Multi Modal

多模态的输入和输出

AgentScope:

  • Robust Fault Tolerance for Diverse LLMs and APIs:
  • Extensive Compatibility for Multi-Modal Applications:

知识库扩展到多模态,支持图片理解和视频理解

简介:视频理解的领域概念 视频理解的主要任务 传统的技术方案 vs 基于LLM的技术方案 我们的技术方案。离线知识库vs在线知识库,有不同的用户体验。 进一步上推最终的业务目标,提供的业务切入点(比如,视频告警(源自静态图片信息)等工业场景、)。先选择一个场景,来实际验证整体能力。 知识库的细粒度维护以及管理。便于多模态的知识库召回

https://github.com/YoadTew/zero-shot-video-to-text (opens in a new tab) : 提取字母

https://github.com/rn-snehapriya/Automatic-Note-Taking-From-Video-Using-Tesseract-OCR/blob/main/project.ipynb (opens in a new tab) 视频转图片,OCR识别

https://github.com/OpenGVLab/Ask-Anything (opens in a new tab) : 具有视频理解功能的 ChatGPT!以及更多支持的 LM,例如 miniGPT4、StableLM 和 MOSS。