蜻豚视觉大模型

瑞为蜻豚™视觉大模型聚焦视觉理解,实现通用视觉语义理解,并且支持异构传感器融合输入、大小模型动态专家路由计算架构以及端到端的推理与任务规划。

全栈训练架构

支持大规模预训练、有监督任务微调(SFT)、强化学习偏好优化(RLHF/GPRO)

支持混合精度训练范式(BF16/FP16/INT8)与参数高效微调(LoRA/QLoRA)

采用Encoder动态平铺技术,支持多传感器接入,支持任意分辨率

采用Token智能压缩技术,支持长视频序列理解分析

采用视觉强化微调模块(RFT),支持跨任务视觉能力迁移

高效推理引擎

采用混合专家(MoE)架构,支持动态专家路由与高效任务分配

采用模型分层量化与蒸馏技术,支持10B级轻量大模型

采用汇编级指令优化技术,支持模型端侧部署

采用检索增强(RAG)技术,支持实时知识图谱接入

基于世界知识的端到端推理模型,支持自主任务规划