尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

多智能体协同驱动图像转视频:构建AI动画故事生成系统

多智能体协同驱动图像转视频:构建AI动画故事生成系统 1. 项目概述当多智能体遇上图像转视频能讲好一个迪士尼故事吗最近在AIGC圈子里一个叫“AnimeAgent”的项目讨论度挺高。它的核心命题很有意思通过一个由多个AI智能体Multi-Agent协作的系统驱动图像到视频Image-to-Video, I2V模型来尝试扮演一个“迪士尼风格的故事讲述艺术家”。这听起来就像组建了一个虚拟的动画工作室里面有负责创意的“编剧Agent”、把控风格的“美术总监Agent”、以及执行生成的“动画师Agent”它们共同协作把一张静态的概念图变成一段有情节、有情感的动态短片。这个想法之所以吸引人是因为它精准地戳中了当前AIGC应用的几个痛点。单纯用I2V模型比如最近热门的HunyuanVideo 1.5 I2V你输入一张图它能给你一段动态但这段动态往往是随机的、缺乏叙事逻辑的——城堡的旗帜在飘但公主为什么走向城堡是归家还是赴宴模型不知道。而单纯用大语言模型LLM写故事它又缺乏视觉化的能力。AnimeAgent的思路就是把这两者甚至更多能力通过多智能体架构“缝合”起来让它们各司其职共同完成从“一幅画”到“一个故事短片”的复杂创作流程。这背后涉及的技术栈相当综合多智能体系统的协同与调度类似网络热词中提到的chimera那种对异构模型服务延迟和性能感知的考量、强化学习中的协作策略如actor-attention-critic这类多智能体强化学习框架的思想、以及最前沿的I2V生成模型。它要回答的不仅仅是一个技术可行性问题更是一个关于“AI艺术创作流程”的范式问题我们是否需要用模拟人类团队协作的方式来让AI完成更复杂、更可控的创意任务对于想深入AIGC应用开发特别是对视频生成、智能体协作感兴趣的朋友来说拆解这个项目无疑是一次绝佳的学习之旅。它能让你看到前沿研究是如何将分散的技术点整合成一个有明确目标的应用系统的。2. 核心架构拆解多智能体如何分工讲好一个故事要理解AnimeAgent不能把它看成一个黑箱而应该看作一个设计精密的虚拟制片流水线。它的核心架构思想是“分而治之协同作业”将讲故事的宏大任务分解为一系列子任务并分配给具有不同专长的智能体去完成。这远比用一个“全能模型”从头到尾生成要来得可控和可靠。2.1 智能体角色定义与职责划分一个典型的迪士尼风格故事短片其创作流程大致包括故事构思、分镜设计、角色与场景设定、动画制作、后期合成。AnimeAgent的多智能体系统就是对这一流程的数字化映射。我们可以设想其中几个关键智能体角色故事编剧智能体 (Story Writer Agent)核心职责基于用户输入的初始图像和可能的关键词提示如“温馨”、“冒险”、“重逢”生成一个简短、连贯、富有情感的故事脚本。这个脚本不仅包括情节概述还应包含关键的情绪转折点和角色动机。技术实现猜想通常由一个经过故事创作微调的大语言模型LLM担任。它的提示词工程Prompt Engineering非常关键需要被约束输出结构化的内容例如“第一幕开端描述场景引入角色情绪。第二幕发展一个小事件引发变化。第三幕结局情感升华或问题解决。” 这为后续视觉化提供了明确的蓝图。分镜与视觉导演智能体 (Storyboard Visual Director Agent)核心职责接收故事脚本并将其“翻译”成一系列的视觉描述。它需要决定整个短片由几个镜头组成每个镜头的构图、景别远景、中景、特写是怎样的角色在镜头中的动作和表情是什么镜头之间如何转场技术实现猜想这可能由一个具备强视觉-语言理解能力的多模态LLM如GPT-4V, Qwen-VL实现。它的输入是文本故事输出是一组分镜描述列表。例如“镜头1全景缓推夜晚宁静的城堡远景一扇窗透着暖光。镜头2中景切室内公主望向窗外表情略带忧郁。镜头3特写叠化她手中握着一枚闪烁的宝石。”动作与动画规划智能体 (Motion Animation Planning Agent)核心职责这是连接“静态描述”与“动态视频”的核心桥梁。它接收分镜描述并为每一个镜头规划出具体的、可被I2V模型理解的动态指令。这是最难的部分。例如对于“公主望向窗外”它需要分解为头部的缓慢转动角度、眼神的移动轨迹、可能伴随的轻微叹息导致的肩膀起伏。它需要将这些抽象描述转化为对I2V模型的具体控制信号如运动幅度参数、运动区域掩码Motion Mask、或者文本描述的运动关键词如“slowly turn head”, “gaze out of the window”。技术实现猜想这个智能体可能需要结合规则引擎和一个小型预测模型。规则引擎处理常见的动作模板如“行走”、“坐下”而预测模型则尝试理解更复杂的情绪化动作。它输出的可能是一种“动画指令序列”这种序列需要与下游I2V模型的输入接口对齐。I2V生成执行智能体 (I2V Generation Agent)核心职责真正的“画师”。它接收初始图像、当前镜头的描述、以及由动画规划智能体产生的具体运动指令调用底层的I2V模型如HunyuanVideo 1.5 I2V, Stable Video Diffusion生成一段几秒钟的短视频片段。它还需要处理生成视频的连贯性比如确保角色在不同镜头中的外观一致性。技术实现猜想这就是具体的I2V模型服务。智能体部分主要负责调用、传递参数、并进行初步的质量检查如是否严重扭曲、黑帧。在类似chimera这样的多智能体服务框架视角下这个智能体需要高效、低延迟地调用这个计算密集型的模型并管理其资源。剪辑与合成智能体 (Editing Composition Agent)核心职责将I2V生成执行智能体输出的所有短视频片段按照分镜的顺序进行组装。它需要处理镜头间的转场效果如淡入淡出、叠化调整各片段的时长和节奏并可能添加统一的色彩滤镜、简单的背景音乐或音效提示最终输出一个完整的短片。技术实现猜想这个智能体的功能可以相对轻量可能基于一些开源的视频处理库如FFmpeg封装而成通过API接收指令执行具体的剪辑合成任务。注意在实际系统设计中这些智能体可能不会如此泾渭分明有时两个职责会合并由一个更强大的智能体承担。但明确的分工思想是架构的基石。2.2 智能体间的通信与协同机制智能体各就各位后如何让它们高效协作而不是各自为政甚至相互冲突这就涉及到多智能体系统的核心——通信与协同。这里可以借鉴actor-attention-critic这类多智能体强化学习MARL框架中的一些思想但更多是在推理阶段的应用层协同。基于共享工作区的通信这是最直观的方式。系统维护一个“中央黑板”或“共享内存”记录当前项目的全局状态例如原始输入图像、生成的故事脚本、分镜列表、已完成的视频片段等。每个智能体完成任务后将产出写入共享工作区并触发下一个依赖此产出的智能体开始工作。例如故事编剧智能体写完脚本存入工作区分镜导演智能体监测到新脚本就自动启动。流程编排与调度需要一个“项目经理”智能体或一个固定的工作流引擎如基于LangChain, AutoGen或自定义状态机。它预定义了整个故事生成的流水线顺序负责调用各个智能体并管理它们之间的依赖关系。当某个环节失败或质量不达标时它还需要决定是重试、回退到上一步修改还是跳过。反馈与迭代循环高级的系统会引入反馈机制。例如I2V生成执行智能体生成的某个镜头效果很差人物扭曲它可以将此信息反馈给动画规划智能体“你给的运动指令导致模型崩溃了”。或者剪辑合成智能体发现前后两个镜头衔接不自然可以要求分镜导演智能体微调转场设计。这种闭环反馈是提升最终成品质量的关键但也大大增加了系统复杂度。实操心得协同的设计比智能体本身更重要在早期搭建这类系统时很容易陷入“追求每个智能体都最强”的误区。但实际发现一个由中等能力智能体组成的、协同机制设计良好的系统其稳定性和最终效果往往优于一群“高手”但沟通不畅的智能体。关键在于定义清晰、无歧义的智能体间接口API或数据格式。例如分镜描述的输出必须是一个结构化的JSON明确包含镜头序号、景别、动作描述、持续时间等字段这样动画规划智能体才能准确解析避免因自然语言描述的模糊性导致后续环节崩溃。3. 核心技术深度解析I2V模型与智能体控制的挑战多智能体架构搭好了故事也规划好了但最终画面动不起来一切都是空谈。因此I2V生成模型是整个系统的“心脏”而如何让智能体精准地控制这个“心脏”则是最大的技术挑战。3.1 I2V模型的能力边界与输入解析当前主流的I2V模型如HunyuanVideo 1.5 I2V、Stable Video Diffusion (SVD)、Pika等其基本原理是在大规模视频数据上训练扩散模型学习从静态图像和文本提示生成合理、连贯的短视频序列。它们通常接受以下输入参考图像视频的第一帧决定了场景、角色、风格的基本面貌。文本提示词描述视频中应该发生什么例如“a princess walking towards a castle”。负向提示词描述不希望出现的内容用于约束生成。运动控制参数一些高级模型或外部控制方法可以提供更精细的控制如运动强度控制整体动态幅度。区域运动掩码指定图像中哪些部分该动哪些部分保持静止如背景不动只让人物动。轨迹控制通过稀疏轨迹点粗略控制物体或镜头的运动路径。对于AnimeAgent这样的系统挑战在于动画规划智能体产生的“动画指令”如“公主由忧伤缓缓转为微笑”如何被有效地“翻译”成上述I2V模型能够理解和执行的输入参数文本提示词的局限性仅仅依靠文本提示词如“the princess smiles slowly”是极其不可靠的。I2V模型对复杂、序列化动作的理解能力有限它可能只会让公主的嘴部微微变化而无法协调面部肌肉、眼神、头部姿态的联动。更糟糕的是它可能完全忽略这个提示或者产生不可预测的扭曲。运动参数控制的粗糙性通用的运动强度或区域掩码控制太过粗糙。它无法表达“微笑”这种特定、细微的表情变化。我们需要的是对特定语义区域如嘴角、眼角的精细化运动引导。一致性难题迪士尼故事短片通常需要多镜头切换。I2V模型每次生成都是独立的如何保证公主在镜头1和镜头2中的发型、衣着、面容特征完全一致即使使用相同的初始图像和种子Seed细微的差异也会在剪辑后显得突兀。3.2 实现精细化控制的技术路径探索为了解决上述挑战社区和研究中出现了一些可能被AnimeAgent采用或需要集成的技术结合关键点与姿态估计思路动画规划智能体不直接输出文本指令而是输出一系列连续的“关键点”位置或“人体姿态”。例如规划出公主头部在16帧视频中每一帧的旋转角度和位置。实现系统可以先从初始图像中提取出公主的面部关键点使用如MediaPipe, Dlib等工具。然后动画规划智能体生成这些关键点在后续帧中的目标位置序列。最后使用像ControlNet for Video如果可用或TemporalNet这类技术将关键点序列作为条件输入I2V模型强约束生成视频中人物的运动符合预定轨迹。优缺点控制非常精准特别适合角色肢体动作。但对于表情微笑这种更依赖纹理和形状细微变化的运动仅靠稀疏关键点可能不够。利用视频编辑与重演技术思路不追求单次生成完美视频而是“先生成后编辑”。I2V生成执行智能体先生成一个基础视频如公主站着不动。然后由一个“视频编辑智能体”利用基于扩散模型的视频编辑工具如Rerender A Video, TokenFlow, FateZero在特定帧区间对特定区域公主的脸部进行重绘Inpainting将“中性表情”编辑成“微笑表情”。实现这要求动画规划智能体能输出更复杂的指令“在第10帧到第20帧对以坐标(x,y)为中心、半径r的圆形区域执行提示词为‘gentle smile’的重绘操作。” 这相当于把动作规划分解成了空间和时间的编辑指令。优缺点灵活性高能实现非常语义化的编辑。但流程更复杂编辑可能引入不连贯或质量损失且对计算资源要求更高。定制化模型微调与适配器思路针对特定的角色或风格如迪士尼公主收集或生成一小批高质量、带有精确动作标注的视频数据。用这些数据对基础的I2V模型进行LoRA或DreamBooth风格的微调或者训练一个轻量级的运动适配器Motion Adapter。让模型专门学习“如何让这个特定角色做出某种特定动作”。实现这更像是为项目构建专属的“动画资产库”。动画规划智能体的指令可以映射到这些预定义的动作编码如action_code: princess_smile_gentle然后由微调后的模型或适配器来执行。优缺点效果可能最好一致性也最高。但成本巨大需要数据、算力和专业知识不适合通用型故事讲述。实操心得从“可控性”与“成本”中寻找平衡在实际尝试中我们往往采用混合策略。对于大的、明确的肢体动作如行走、挥手采用关键点控制方法。对于细微的表情变化或复杂的物体交互则采用视频编辑方案。而定制化微调通常是项目后期在角色和风格完全确定后为了追求极致品质而进行的投入。对于AnimeAgent这样一个探索性项目更可能优先尝试前两种路径的组合在现有开源工具链上构建原型。4. 系统实现与工作流实操推演理解了架构和技术挑战后我们来推演一个简化版的AnimeAgent工作流是如何一步步运行的。这里我们假设一个相对务实的技术选型基于现有开源工具进行构建。4.1 环境准备与智能体组件选型首先我们需要为各个智能体角色选择合适的“演员”模型或工具。故事编剧 分镜导演智能体选型一个强大的多模态LLM可以兼任这两项工作例如Qwen-VL-Max或GPT-4V。它们既能理解图像内容又能进行复杂的剧本和分镜规划。为了降低成本和提高可控性也可以拆开用Llama 3 70B或Qwen 2.5 72B的纯文本版本做故事编剧再用一个视觉语言模型做分镜。部署这些大模型通常通过API调用如OpenAI API, Together API或本地部署使用vLLM, Text Generation Inference等高性能推理框架来提供服务。考虑到chimera框架提到的异构LLM服务这里可能需要一个本地推理集群来管理不同规格的模型。动画规划智能体选型这是定制化程度最高的部分。初期可以采用“规则库LLM补全”的方式。建立一个常见动作到I2V提示词/参数的映射规则库如walk-prompt: “walking slowly”, motion_strength: 0.7。对于规则库中没有的复杂动作调用一个较小的LLM如Qwen 2.5 7B来生成描述。部署可以是一个简单的Python服务内部封装规则引擎和一个小型LLM。I2V生成执行智能体选型开源首选是Stable Video Diffusion (SVD)或其改进版本如SVD-XT。商业API可选Runway Gen-2或Pika。考虑到可控性需求SVD加上社区的各种运动控制扩展如AnimateDiff的Motion LoRA 或使用Depth/OpenPose ControlNet是更灵活的选择。部署这需要强大的GPU资源至少RTX 4090级别显存越大越好。使用ComfyUI或AUTOMATIC1111的API模式来封装模型服务方便被智能体调用。剪辑与合成智能体选型无需AI模型使用FFmpeg和MoviePy库即可完成绝大部分剪辑、转场、音频合成工作。部署一个轻量级的Python脚本或服务。流程编排器选型可以使用LangGraphLangChain的多智能体工作流库或Microsoft AutoGen来直观地编排智能体之间的调用顺序和条件逻辑。也可以自己用FastAPI和Celery等工具构建一个异步任务队列。部署作为整个系统的主控大脑运行。4.2 端到端工作流步骤详解假设我们的输入是一张“迪士尼风格公主在城堡阳台眺望”的静态图片希望生成一个“她看到流星许愿露出希望微笑”的5秒短片。步骤1初始化与图像分析流程编排器启动将用户上传的图片和简单提示“许愿微笑”存入共享数据库如Redis或简单的JSON文件。调用分镜导演智能体兼任初始分析让其分析图像内容“一位长发公主身着礼服站在城堡阳台手扶栏杆夜晚星空。”步骤2故事脚本生成流程编排器将图像描述和用户提示传给故事编剧智能体。提示词需要精心设计例如你是一位迪士尼动画编剧。请根据以下场景和情绪关键词创作一个约5秒15帧的极短无声故事。 场景描述[此处填入步骤1得到的图像描述] 情绪关键词许愿希望微笑 输出格式必须为JSON { story_summary: 一段完整的故事概述, emotional_arc: [起始情绪, 转折情绪, 结尾情绪], key_moments: [时刻1描述, 时刻2描述, 时刻3描述] }智能体返回结构化的故事蓝图。步骤3分镜分解流程编排器将故事脚本传给分镜导演智能体。提示词要求其将故事分解为镜头将以下故事分解为2-3个镜头用于生成短视频。 故事[此处填入故事脚本] 请为每个镜头指定镜头号、景别特写/中景/全景、镜头内容描述包含角色动作和表情、预估时长秒。 输出为JSON列表。智能体返回例如[ { shot_id: 1, scene: 中景, description: 公主仰望星空一颗流星划过她的眼睛微微睁大露出惊讶和期待的表情。, duration: 2.5 }, { shot_id: 2, scene: 特写, description: 公主双手合十置于胸前闭上眼睛嘴角逐渐上扬浮现出一个充满希望的微笑。, duration: 2.5 } ]步骤4动画指令规划这是最关键的转换步骤。流程编排器将第一个分镜描述传给动画规划智能体。这个智能体内部运作如下规则匹配检查“仰望星空”、“眼睛睁大”是否在规则库中。假设有规则look_upward-{“motion_area”: “head”, “motion_type”: “rotate_up”, “strength”: 0.5}。LLM补全对于“流星划过”这个背景事件规则库没有。则调用内部的小LLM输入“将‘夜空中有流星划过’转化为对I2V模型的提示词强调动态效果。” LLM可能返回“prompt_ addition: ‘a shooting star streaks across the starry sky’, motion_strength: 0.3 (for background)”。整合输出智能体整合规则输出和LLM补全生成针对SVD模型的最终参数集可能包括init_image: [公主阳台原图]prompt: “a disney princess on a balcony looking up at the night sky, a shooting star streaks across the starry sky, she looks surprised and hopeful, masterpiece, best quality”negative_prompt: “ugly, deformed, blurry”motion_bucket_id: 120 (控制运动幅度值越大运动可能越强)noise_aug_strength: 0.02 (控制与初始图像的偏离度)如果使用了ControlNetcontrolnet_image: [一张处理过的、标有头部向上旋转箭头的图像]步骤5视频片段生成流程编排器将上述参数打包发送给I2V生成执行智能体。该智能体调用部署好的SVD ComfyUI API生成一段约2.5秒的视频片段保存为shot_1.mp4。生成过程中可以加入简单检查比如用OpenCV检查视频是否全黑或严重卡顿如果失败则重试或降低参数。步骤6迭代与合成重复步骤4和步骤5为第二个分镜生成shot_2.mp4。注意第二个镜头的初始图像init_image不能再用原始图而应该用第一个镜头的最后一帧以保证视觉连续性。这需要I2V生成执行智能体具备“以视频帧为初始图”的能力。 所有片段生成完毕后流程编排器调用剪辑与合成智能体将shot_1.mp4和shot_2.mp4用叠化转场连接起来并可能添加一段简单的梦幻风格背景音乐最终输出final_story.mp4。重要提示上述流程是高度理想化的。在实际操作中每个环节都可能失败或产生不满意的结果。因此一个健壮的系统必须在关键节点如分镜生成后、视频生成后加入“人工审核或质量评估环节”或者设计更复杂的自动重试和回滚逻辑。例如当I2V生成效果不佳时可以触发一个“重规划智能体”让它分析问题是动作指令太复杂还是提示词有歧义并调整参数重新生成。5. 当前局限、常见问题与未来展望尽管AnimeAgent的构想非常迷人但以目前的技术水平要让它成为一个真正可靠、实用的“迪士尼故事艺术家”还有漫长的路要走。在实际的探索和复现尝试中会遇到一系列极具挑战性的问题。5.1 主要技术瓶颈与局限动作控制的“语义鸿沟”问题这是最根本的难题。智能体规划的“充满希望的微笑”与I2V模型能理解的“嘴角肌肉向上移动几个像素”之间存在巨大的鸿沟。当前的I2V模型本质上是“纹理和运动模式”的生成器而非“物理与情感”的模拟器。它很难精确执行“缓缓转头”、“眼神发光”这类包含复杂语义和细微联动的指令。表现你可能会得到人物头部扭曲变形、微笑表情僵硬诡异、眼神方向与头部转动不协调。背景中不该动的物体如城堡莫名其妙地蠕动。缓解策略目前只能通过“降低预期”和“增加约束”来缓解。使用更保守的运动强度优先生成固定机位、动作幅度小的镜头。大量依赖负向提示词排除不想要的动作。将长镜头拆解成多个极短的、动作单一的片段分别生成。多镜头连贯性与一致性灾难问题I2V模型不具备长期记忆。即使你使用上一镜的最后一帧作为下一镜的初始图模型在生成过程中也会引入不可控的细节变化——发丝飘动的方向、衣服的褶皱、光照的细微色调这些变化在剪辑后会显得非常跳跃破坏沉浸感。表现公主在镜头1是金色卷发在镜头2发色变深或变直了。背景的云彩形状和位置发生突变。缓解策略强力风格锁定使用LoRA或Textual Inversion等技术为角色和场景训练一个高强度的风格/特征嵌入在生成每个镜头时都强制注入试图“锁住”外观。后期校正生成所有片段后使用视频到视频的风格迁移工具以后续镜头向前续镜头对齐进行颜色、亮度等的统一校正。但这会损失画质。规避策略尽量设计不需要严格连续匹配的剪辑方式如利用黑场、闪白转场或者直接采用旁白、字幕卡来分隔镜头。系统复杂性与脆弱性问题多智能体系统是一个长链条任何一个环节的微小错误都会被逐级放大。故事编剧写偏了后面全错。分镜描述有歧义动画规划就会出错。I2V模型的一次随机性抖动可能导致整个片段报废。表现系统运行不稳定需要大量人工干预和调试。生成一个10秒的视频可能需要数小时其中大部分时间在排队、重试和排查错误。缓解策略必须为每个智能体设计强大的“容错”和“自检”机制。例如I2V生成后自动用CLIP模型计算生成视频与提示词的图文相关性得分低于阈值则自动重试。建立完善的日志系统记录每个智能体的输入输出方便问题追踪。5.2 常见问题排查速查表问题现象可能原因排查与解决思路生成视频完全静止或扭曲I2V模型未正确加载或参数极端1. 检查模型文件。2. 大幅降低noise_aug_strength如0.01。3. 检查提示词是否过于复杂矛盾。人物动作诡异如肢体融化运动控制参数过强或冲突1. 降低motion_bucket_id或运动强度。2. 检查区域运动掩码是否准确覆盖了运动部位。3. 在负向提示词中加入“deformed limbs, melted”。不同镜头间角色外观不一致I2V模型随机性导致特征漂移1. 使用相同的随机种子Seed尝试。2. 引入角色LoRA并提高权重。3. 尝试使用IP-Adapter等图像特征注入工具。视频闪烁严重模型时序稳定性差1. 使用SVD-XT等改进版本。2. 启用模型自带的帧间平滑选项如temporal smoothing。3. 生成高帧率后用后期软件做光流法补帧和去闪烁。智能体A的输出智能体B无法解析接口数据格式不匹配或字段缺失1. 严格定义并校验所有智能体间通信的JSON Schema。2. 在智能体输出后增加一个“格式规范化”的中间层。整个流程耗时过长某个环节通常是I2V成为瓶颈1. 分析各环节耗时对I2V生成进行队列管理和资源优化参考chimera思想。2. 考虑使用更低分辨率的模型进行草稿生成满意后再用高清模型重绘。5.3 未来演进方向AnimeAgent项目指出的方向无疑是正确的。未来的演进可能会集中在I2V模型本身的进化下一代模型必须原生支持更精细、更语义化的控制信号输入例如直接接受描述动作的“动词短语”或简单的脚本。模型内部需要更强的时序一致性和对象持久性建模能力。统一的多模态动作规划模型可能会出现一个专门的模型它吃进故事脚本和静态图直接输出一套机器可执行的、精细的“动画导演指令集”这个指令集能无缝对接下游的生成模型。这相当于把我们的“动画规划智能体”变成一个端到端的强大模型。从生成到模拟更远未来或许我们不再需要“生成”每一帧而是构建一个3D可驱动的数字角色类似MetaHuman或Apple Vision Pro中的数字人AI智能体的任务是编写角色的行为脚本在3D引擎里“模拟”出动画再渲染成特定风格如迪士尼风。这将从根本上解决一致性和可控性问题。就目前而言构建AnimeAgent这样的系统其最大价值不在于立刻生产出完美的商业级动画短片而在于为我们提供了一个绝佳的实验场。它迫使我们去深入思考和研究AI在复杂创意任务中的协作范式、语义到视觉的映射难题、以及长流程生成任务的稳定性。每一个尝试复现或改进它的人都在为多模态AI和智能体系统的未来添砖加瓦。这个过程本身充满了挑战也充满了发现新思路的乐趣。
返回列表