一、目录一大语言模型与推理技术进展阶跃推出 Step Edge 端侧模型家族腾讯混元发布 Hy3 量化版及 llama.cpp MTP 补丁Thinking Machines Lab 发布多模态开源模型 Inkling字节Seed模型升级支持1M上下文并推出成本优惠OpenAI发布内部自动化红队模型GPT-RedInternLM 发布 Intern-S2-Preview-397B 多模态模型Google 推出 Gemma 4 更新启用 FA4 并修补工具调用Muse Spark 1.1上线OpenRouter仅面向美国开发者二多模态与生成模型动态腾讯混元全栈开源 HyOCR-1.5阿里 ATH-MaaS 团队发布文档解析模型 OvisOCR2OpenMOSS开源MOSS-VL-Realtime模型支持视频流实时视觉理解阿里通义万相开源 Wan-Dancer-14B 音乐转舞蹈模型MiniMax正式上线Music 3.0音乐生成模型NVIDIA 推出开源 Nemotron 3 Embed 嵌入模型系列商汤推出 SenseNova U1 Pro 具备原生图文交错思考能力京东发布JoyAI-Talker与JoyAI-Video-Edit模型Qwen发布Qwen-Audio-3.0-Realtime实时语音模型三垂直领域与具身智能模型actAVA发布医疗模型Cura 1T中国气象局开源“风和”气象服务大语言模型小米开源具身生成模型 Xiaomi-Robotics-U0 权重Xiaomi Robotics发布Xiaomi-Robotics-1采用10万小时免实体预训练二、详细内容汇总一大语言模型与推理技术进展1. 阶跃推出 Step Edge 端侧模型家族阶跃星辰发布端侧模型家族Step Edge采用「1N」架构由1个文本视觉基础模型为核心搭配Audio、GUI、Gen等多模态专项模型组成完整能力矩阵。该家族支持低至0.1秒的本地工具调用可在端侧独立完成文本、视觉与语音处理同时兼容端云协同调度模式。官方数据显示该系列在29项核心评测指标中取得第一但相关对比结果均为内部自测产出。家族配套自研Step Inference NPU推理引擎以降低端到端延迟相关产品在WAIC 2026线下展台进行展示。参考链接https://edge.iap.platform.shaipower.com/waic/step-edge/https://static.stepfun.com/blog/step-edge/https://mp.weixin.qq.com/s/StOzmXaUGSsjUXkAoW-HZg2. 腾讯混元发布 Hy3 量化版及 llama.cpp MTP 补丁腾讯混元团队针对开源社区部署需求推出295B参数Hy3模型的1bit、4bit及GPTQ Int4量化版本。原始BF16权重体量近600GB量化后1bit版本压缩至85.5GiB可在单张96GB显卡上完成部署4bit版本为169.9GiB需两张显卡运行GPTQ Int4版本专门适配vLLM服务端部署场景。官方表示4bit版本输出分布与原始模型基本一致1bit版本在长文理解能力上接近原模型仅在Agent与代码任务上有小幅回落。团队同步发布llama.cpp补丁支持MTP投机解码开启后1bit与4bit版本解码速度分别提升约50%和60%。参考链接https://huggingface.co/tencent/Hy3https://huggingface.co/AngelSlim/Hy3-GGUF3. Thinking Machines Lab 发布多模态开源模型 InklingThinking Machines Lab推出开源多模态混合专家模型Inkling现已开放完整权重可通过Tinker平台进行微调。模型总参数975B激活参数41B支持最高1M上下文窗口原生兼容文本、图像、音频输入支持灵活调节推理算力平衡性能表现与部署成本。模型权重已在Hugging Face上线提供原始版本与适配NVIDIA Blackwell架构的NVFP4版本支持SGLang、vLLM等主流框架本地部署同时多家第三方平台提供API调用服务。同系列轻量版Inkling-Small目前仅开放预览完整权重待测试完成后发布。参考链接https://thinkingmachines.ai/news/introducing-inkling/https://huggingface.co/thinkingmachines/Inklinghttps://tinker.thinkingmachines.ai/playground4. 字节Seed模型升级支持1M上下文并推出成本优惠字节跳动Seed团队完成Doubao-Seed-Evolving模型升级正式支持百万Token超长上下文可覆盖大型代码仓库、长篇文档等大体量处理场景。升级后模型长程任务能力在开发者众测中评分超过Doubao-Seed-2.1-pro同时Token消耗效率更高工具调用链路更精简。官方同步推出「体验奖励计划」参与可享调用成本立减20%。该模型已上线火山Agent Plan单月套餐限时9.9元起。参考链接https://mp.weixin.qq.com/s/oOOCgFFMl9XpsINb4HsqCghttps://ark.volcengine.com/region:cn-beijing/experience/gen_chat?modeldoubao-seed-evolving-latest-version5. OpenAI发布内部自动化红队模型GPT-RedOpenAI推出内部专用的自动化红队模型GPT-Red核心用途是大规模排查模型的提示注入安全漏洞。该模型通过自我对弈强化学习训练完成能够攻破包括GPT-5.5在内的几乎所有内部与生产模型目前已用于GPT-5.6 Sol的对抗性训练提升模型安全鲁棒性。官方数据显示相比四个月前的最优生产模型GPT-5.6 Sol在高难度直接提示注入基准上的失败率降低6倍。为避免恶意能力扩散GPT-Red与对外部署模型保持隔离仅限定内部使用。参考链接https://openai.com/index/unlocking-self-improvement-gpt-red/https://x.com/OpenAI/status/20774467187284256866. InternLM 发布 Intern-S2-Preview-397B 多模态模型书生浦语发布Intern-S2-Preview-397B多模态基础模型定位科学智能与长程Agent场景。模型实际参数量为403B采用全新预训练范式——直接从科学文献原始页面进行视觉预训练联合建模符号语义与视觉空间关系。官方称其在开源模型中实现了领先的通用推理性能在生物分子交互设计等专业科学任务上表现突出。模型支持最大256K文本长度与64K多模态推理长度默认开启思维模式兼容工具调用与时间序列推理目前权重已开源。参考链接https://huggingface.co/internlm/Intern-S2-Preview-397Bhttps://chat.intern-ai.org.cn7. Google 推出 Gemma 4 更新启用 FA4 并修补工具调用Google推送Gemma 4模型更新新版本已在Hugging Face开放下载。更新核心内容包括在NVIDIA Hopper GPU上启用Flash Attention 4预填充吞吐量提升25%-70%首个词元生成延迟最高下降31%同时修复了工具调用逻辑与聊天模板缺陷。Unsloth AI提示用户需重新下载GGUF、MLX和NVFP4量化版本才能应用完整修复。针对官方宣称已修复的工具调用问题有社区用户反馈多轮交互后仍会生成无意义内容。参考链接https://huggingface.co/collections/google/gemma-48. Muse Spark 1.1上线OpenRouter仅面向美国开发者Meta旗下Muse Spark 1.1多模态推理模型正式登陆OpenRouter平台目前仅向美国地区开发者开放。开发者可通过OpenRouter聊天室或MCP接口试用该模型相关基准测试结果后续将陆续公布。该模型为多模态推理架构支持文本、图像、视频、音频与PDF输入定位Agent工作流编排可承担主智能体规划调度或子智能体执行角色。参考链接https://x.com/MetaforDevs/status/2077804044505272425https://openrouter.ai/meta/muse-spark-1.1二多模态与生成模型动态1. 腾讯混元全栈开源 HyOCR-1.5腾讯混元团队全栈开源1B参数端到端OCR大模型HyOCR-1.5公开完整的数据构造方法、训练配方与推理框架。模型引入基于90.7M参数草稿模型的DFlash投机解码框架官方称在Transformers环境下实现6.37倍推理加速支持通过llama.cpp在CPU、消费级显卡及普通笔记本本地部署。训练层面采用Agentic Data Flow构造低资源语种、古文字与多图问答数据将最大支持图像分辨率提升至4K上下文窗口扩展至128K。官方表示该模型在OmniDocBench v1.6等多个基准取得SOTA但在CHAOS-Bench幻觉抑制测试中绝对值仍偏低。参考链接https://mp.weixin.qq.com/s/vKFCa9FfoGBUGK8J1MhFaghttps://github.com/Tencent-Hunyuan/HunyuanOCR2. 阿里 ATH-MaaS 团队发布文档解析模型 OvisOCR2阿里巴巴ATH-MaaS团队推出端到端页面级文档解析模型OvisOCR2。该模型基于Qwen3.5-0.8B进行后训练可将文档页面图像转换为符合自然阅读顺序的Markdown格式完整覆盖文本、公式、表格与视觉区域的解析还原。官方测试数据显示OvisOCR2在OmniDocBench v1.6上取得96.58分是首个登顶该榜单的端到端模型同时在PureDocBench上取得75.06的最高Avg3得分。模型采用Apache 2.0开源协议已在Hugging Face平台开放权重。参考链接https://huggingface.co/ATH-MaaS/OvisOCR2https://x.com/Xianbao_QIAN/status/20771608172929804893. OpenMOSS开源MOSS-VL-Realtime模型支持视频流实时视觉理解OpenMOSS团队开源视觉语言模型MOSS-VL-Realtime采用Apache-2.0协议。模型参数量11B上下文长度256K专为连续视频流的实时视觉理解场景设计。核心特性包括流运行过程中支持随时提问、并行感知与生成、可随场景变化动态修正或中断回复、证据不足时主动保持沉默。官方称其在多个流媒体视频理解基准上达到开源模型SOTA。目前模型开放测试与研究用途单个实例仅支持一路活跃实时会话。参考链接https://openmoss.github.io/MOSS-VLhttps://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime4. 阿里通义万相开源 Wan-Dancer-14B 音乐转舞蹈模型阿里通义万相团队开源音乐转舞蹈视频生成模型Wan-Dancer-14B用户可基于单张人物图片与音频在本地生成长时长、高画质且动作与音乐节奏精准同步的舞蹈视频。模型采用全局关键帧规划局部时序优化的分层架构保障长视频动作连贯性覆盖街舞、踢踏舞、拉丁舞、韩舞、中国古典舞五种风格。模型权重已上线Hugging Face与ModelScope平台推理代码在GitHub开源同时支持通过两个平台的在线空间直接体验。参考链接https://x.com/Alibaba_Wan/status/2076879192214626512https://huggingface.co/Wan-AI/Wan-Dancer-14B5. MiniMax正式上线Music 3.0音乐生成模型MiniMax正式推出新一代text-to-song音乐生成模型Music 3.0。新版本升级了语义理解模块可更精准地解析曲风、编曲等创作指令器乐音质得到提升支持滑音、连奏等真实演奏技法搭载新一代人声引擎消除了高频机器嘶嘶声人声自然度显著提升。目前开发者与用户可通过API调用music-3.0正式版也可使用免费版模型music-3-free进行体验。参考链接https://platform.minimaxi.com/docs/guides/music-generationhttps://minimaxi.com/audio/music6. NVIDIA 推出开源 Nemotron 3 Embed 嵌入模型系列NVIDIA发布Nemotron 3 Embed开源嵌入模型系列包含8B与1B两种参数规格已在Hugging Face开放权重支持商业使用。旗舰版Nemotron-3-Embed-8B-BF16在RTEB基准取得78.5%的得分位列榜首1B版本通过结构化剪枝与蒸馏技术得到面向轻量化部署场景适配Blackwell架构的NVFP4量化版可实现最高两倍的吞吐量提升。全系列均支持32k上下文窗口与34种语言检索官方同步提供微调、蒸馏配方与NIM微服务部署方案。参考链接https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rtebhttps://build.nvidia.com/nvidia/nemotron-3-embed-1bhttps://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF167. 商汤推出 SenseNova U1 Pro 具备原生图文交错思考能力商汤科技发布日日新SenseNova U1 Pro图片创作模型目前开启邀请制预览。该模型基于NEO-Unify原生架构统一理解、生成与动作链路相比U1 Lite重点升级了原生图文交错思考链能力。模型最高支持8K原生分辨率输出官方宣称文字渲染出错率极低可支撑印刷、展览级细节要求内生支持数十轮Agentic Generation Loop智能体生成循环实现整体风格与局部文本的同步精准可控编辑。正式版本与API服务预计2026年8月上线。参考链接https://www.sensenova.cn/https://x.com/SenseTime_AI/status/2078510614889238997https://www.ithome.com/0/978/562.htm8. 京东发布JoyAI-Talker与JoyAI-Video-Edit模型京东在WAIC期间首次系统展示JoyAI全系列模型矩阵同步发布两款新模型JoyAI-Talker实时语音交互模型与JoyAI-Video-Edit实时视频编辑模型。其中JoyAI-Talker具备低延迟对话、情绪理解、工具调用与记忆能力可通过多模态信息精准理解用户意图JoyAI-Video-Edit支持自定义画面与边预览边修改的流式编辑能力可应用于视频生成与具身智能仿真数据合成场景。两款模型暂未公布具体开放时间与使用方式。参考链接https://mp.weixin.qq.com/s/K_0jT-scyHgdJJi4y9ci7Qhttps://mp.weixin.qq.com/s/A-Om9cK9rFnUme9l42BMLA9. Qwen发布Qwen-Audio-3.0-Realtime实时语音模型通义千问正式推出实时语音交互对话模型Qwen-Audio-3.0-Realtime已在阿里云百炼平台上线。模型提供Plus推理更强与Flash速度更快两个版本可在毫秒级响应的同时保障推理深度支持边说边听、随时打断的全双工交互。与传统依赖明确指令触发的语音模型不同该模型可无需显式指令自动调用MCP、API等外部工具调用结果自动融入对话记忆。模型还能根据语境动态调整语气与情感表达官方称其在多个语音基准测试中取得高分或SOTA成绩。参考链接https://mp.weixin.qq.com/s/mqZEm3auE_1YTKZ6Jxfzaghttps://bailian.console.aliyun.com/cn-beijing/?spma2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSiteasia-pacific-china三垂直领域与具身智能模型1. actAVA发布医疗模型Cura 1TactAVA推出万亿参数医疗专用模型Cura 1T模型基于Kimi-K2.6微调采用递归自我改进训练机制聚焦患者护理、临床推理与医疗Agent工作流场景。官方测试显示该模型在HealthBench Hard等6项医疗基准中的5项得分领先在MedXpertQA-Multimodal上排名第二通用能力在各域外榜单中保持前五。同步开源了模型无关的评估工具cura-eval。官方强调Cura 1T为研究用途模型不可替代专业医疗服务。参考链接https://www.actava.ai/curahttps://github.com/actava-ai/Cura2. 中国气象局开源“风和”气象服务大语言模型中国气象局发布「风和」气象服务大语言模型并启动全球开源计划。该模型由公共气象服务中心联合智谱等机构研发基于GLM-4.5-Air的MoE架构上下文长度128K。模型训练使用超5000万tokens气象领域语料与49万指令微调样本官方称在MetsEval-1k评估中得分优于主流通用大模型。权重已在Hugging Face、GitHub与ModelScope平台开放采用MIT协议模型已完成生成式AI备案国际版同步上线提供服务。参考链接https://mp.weixin.qq.com/s/kc6JDKiosorc8tIWbLHqhQhttps://github.com/PMSCCMA/FengHehttps://huggingface.co/PMSCCMA/FengHe3. 小米开源具身生成模型 Xiaomi-Robotics-U0 权重小米发布并开源38B参数自回归世界基础模型Xiaomi-Robotics-U0。模型采用统一多模态自回归框架同时覆盖具身场景生成、具身迁移、具身视频生成与通用图文生成四类核心任务。官方数据显示该模型在WorldArena评测的126个模型中排名第一真机OOD场景下任务完成进度平均提升超26%。目前代码与部分模型权重已开源视频生成权重后续将陆续推出。参考链接https://robotics.xiaomi.com/xiaomi-robotics-u0.htmlhttps://huggingface.co/XiaomiRobotics/Xiaomi-Robotics-U04. Xiaomi Robotics发布Xiaomi-Robotics-1采用10万小时免实体预训练小米机器人实验室发布Xiaomi-Robotics-1机器人基础模型通过「大规模免实体预训练真实机器人后训练」的两阶段范式突破机器人领域高质量数据稀缺的瓶颈。预训练阶段使用10万小时、覆盖1700余种场景的免实体UMI轨迹数据后训练阶段接入包含7200小时真实家庭机器人数据的跨实体数据集。实验显示预训练效果随数据量与模型规模增长呈现清晰的Scaling规律且该增益可完整传递到后训练的真实机器人任务中暂无饱和迹象。下游应用中该模型学习全新复杂任务时单任务平均仅需不到10小时演示数据即可达到75%的总体成功率在四项主流仿真基准上均取得SOTA结果。参考链接https://robotics.xiaomi.com/xiaomi-robotics-1.html