多模态的输入和输出
AgentScope:
- Robust Fault Tolerance for Diverse LLMs and APIs:
- Extensive Compatibility for Multi-Modal Applications:
知识库扩展到多模态,支持图片理解和视频理解
简介:视频理解的领域概念 视频理解的主要任务 传统的技术方案 vs 基于LLM的技术方案 我们的技术方案。离线知识库vs在线知识库,有不同的用户体验。 进一步上推最终的业务目标,提供的业务切入点(比如,视频告警(源自静态图片信息)等工业场景、)。先选择一个场景,来实际验证整体能力。 知识库的细粒度维护以及管理。便于多模态的知识库召回
https://github.com/YoadTew/zero-shot-video-to-text (opens in a new tab) : 提取字母
https://github.com/OpenGVLab/Ask-Anything (opens in a new tab) : 具有视频理解功能的 ChatGPT!以及更多支持的 LM,例如 miniGPT4、StableLM 和 MOSS。