
不止会写代码Ornith-1.5-35B-A3B图像与视频多模态理解能力全面评测【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是 ornith-ai 团队推出的 350 亿参数开源多模态大模型原生支持图像理解与视频理解。它基于混合专家MoE架构每个 token 仅激活约 3B 参数推理成本远低于同规模稠密模型。本文将带你快速了解它的多模态视觉能力、关键配置参数和部署要点帮助新手判断这款模型是否适合你的看图、看视频场景。一、Ornith-1.5-35B-A3B 是什么先看懂核心规格这款模型名字里的35B-A3B是它的核心卖点总参数约 350 亿但实际只激活 30 亿。配合 262K 长上下文和视觉编码器它既能看懂高分辨率图片也能分析较长视频还能胜任代码与智能体任务。关键规格参数总参数 / 激活参数35B / 约 3BMoE256 个专家每 token 激活 8 个架构Qwen3_5MoeForConditionalGeneration视觉-语言统一架构视觉编码器qwen3_5_moe_vision27 层patch 16×162×2 空间合并上下文窗口262,144 tokensYaRN 可扩展至约 100 万图像/视频支持内置 image_token 与 video_token支持多图与视频帧精度 / 体积bfloat16约 70 GB推理运行时vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1 从 config.json 可见模型采用 40 层网络其中每 4 层插入一组全注意力full_attention其余为线性注意力层这是它在长序列上保持高效的关键设计。二、图像理解如何看懂一张高分辨率图片多模态理解的质量很大程度取决于图片如何被切分和编码。Ornith-1.5-35B-A3B 沿用了 Qwen3VL 系列处理器方案可从 preprocessor_config.json 和 processor_config.json 中找到关键信息16×16 视觉块 2×2 空间合并图片被切成 16 像素的小方块相邻 4 个块再合并为 1 个视觉 token在保留细节的同时大幅压缩 token 数。动态高分辨率图像处理器允许最长边像素上限高达 16,777,21616M 像素级别意味着文档、图表、设计稿这类细节密集的图片也能被看清而不是先被暴力缩小。统一的视觉起止标记视觉 token 前后由 vision_start / vision_end 特殊标记包裹与文本 token 在同一词表中融合建模词表约 24.8 万理解图片文字与理解自然语言用的是同一套大脑。对新手意味着什么你可以直接让它做 OCR 级任务——识别发票上的数字、解释流程图、对比两张截图的差异而不需要额外的 OCR 预处理。三、视频理解最多 768 帧如何高效看片视频多模态理解的难点在于既要足够多的帧覆盖动作又不能把 token 数撑爆。video_preprocessor_config.json 给出了这款模型的取巧方案视频处理参数取值说明采样帧率 fps2每秒抽取 2 帧平衡信息量与计算量最大帧数 max_frames768理论上可覆盖约 6 分多钟的连续视频最小帧数 min_frames4保证短视频也有足够的时序信息时间块 temporal_patch_size2相邻 2 帧打包为一个时间块进一步压缩 token空间像素上限最长边 25,165,824 像素支持高规格视频输入配合 262K 长上下文把视频 token 和文字指令一起放进同一条序列后模型可以完成描述这段视频里发生了什么、找出视频中的错误操作步骤这类真正的时序理解任务——而不只是逐帧识别。四、快速上手如何部署并调用多模态推理️硬件门槛bf16 权重约 70 GB官方配方为2× 80GB GPU张量并行为 256K 上下文留出余量。个人设备用户可关注 GGUF 量化版本通过 Ollama 或 llama.cpp 直接跑起来ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF️服务器部署使用 vLLM 或 SGLang 起一个 OpenAI 兼容服务详见项目 README.md 的 Serving 章节开启工具调用与推理解析器后任何 OpenAI 兼容客户端都能直接发图片 文字混合消息给它。⚙️采样参数建议来自 generation_config.json 与官方说明日常多模态问答temperature0.6、top_p0.95、top_k20追求更强推理默认即为推理模型回答前会先输出思维链服务端会将其拆分到独立的 reasoning_content 字段便于前端展示五、评测表现多模态之外的隐藏实力虽然本文聚焦图像与视频理解但顺带一提这款模型在同级模型中同样出色——SWE-bench Verified 得分 79对比 Gemma 4-31B 的 52、Terminal-Bench 2.1 达 68.5 分、GPQA Diamond 科学推理 89.2 分全面领先同规模竞品。对需要既能看图又能写代码的单机部署用户来说这是一个相当省心的选择。六、常用文件路径速查文件作用config.json模型结构配置MoE 专家、注意力层类型、视觉编码器参数preprocessor_config.json图像预处理参数分块、合并、像素上限video_preprocessor_config.json视频采样参数fps、最大帧数等processor_config.json图像/视频处理器完整配置generation_config.json默认采样参数temperature、top_p、top_kchat_template.jinja对话模板定义思考块与多模态消息格式model-00001~00016-of-00016.safetensors16 个分片的模型权重文件七、总结谁适合用 Ornith-1.5-35B-A3B 做多模态理解✅ 需要本地/私有化部署图像与视频理解又不想上超大模型✅ 想用一个模型同时覆盖 OCR、看图问答、视频分析、写代码✅ 希望 35B 的模型、3B 的推理成本2 张 80G 显卡即可跑满 256K 上下文如果你正在挑选一个不止会写代码的开源多模态模型Ornith-1.5-35B-A3B 的动态高分辨率图像编码 768 帧视频采样 百万级可扩展上下文构成了它完整的视觉理解拼图。【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考