未来的软件:对话理解意图,画布呈现作品。
最近,我在研究 AI 生成视频,也在体验 MiniMax Design。对我来说,它最准确的定位不是一款视频生成器,也不是在传统设计软件旁边加一个聊天框,而是一个多模态 Agent 创作平台:Agent 在同一张画布上理解目标,组织文字、图像、角色、分镜和视频,并把一段创作流程推进到可以验收的作品。
我也在尝试搭建一个接近这种使用体验的 AI Agent 开发工具。这里的 Agent,可以先简单理解成一种“听懂目标后,能够自己调用工具、推进任务、把结果交回来”的 AI。
原本我想解决的是一个很具体的问题:能不能让一个人不必进入 ComfyUI 这类专业生成工作台,不必手工管理角色图、场景图、镜头表、生成参数和视频文件,也能独立做完一条短片?
但在拆这套系统的过程中,我突然意识到,自己研究的可能不只是一款 AI 视频工具。
它更像是未来软件的一块切片。
过去,我们为了完成工作,要先学习软件。修图要学图层、蒙版和曲线,剪辑要学轨道、关键帧和编码,办公要学表格、公式和格式,开发要学编辑器、终端、框架和部署。
软件越专业,功能越强,学习成本往往也越高。
而我现在越来越强烈的判断是:未来的软件,不会继续要求每个人先成为软件操作专家。大量专业复杂度会被 AI 收回系统内部,用户面对的界面,可能只剩下两个核心部分:
一个对话框,用来表达需求、补充想法和做决定。
一张画布,用来看到作品、比较方案和完成验收。
这篇文章不是在预测所有软件都会消失。我更想分享自己为什么形成这个判断,以及我正在搭建的 AI 视频工作台,怎样让我第一次具体看见这种软件形态。
一条短视频,正在吞掉一整排专业软件
过去做一条完整短视频,往往需要在很多工具之间来回切换。
先找选题,再写故事;把故事改成剧本,再把剧本拆成脚本;设计角色、场景和道具;画分镜、定机位、算时长;生成或拍摄素材;最后进入剪辑软件,处理配音、字幕、音乐、转场和导出。
每一步都有自己的文件格式、操作方式和专业语言。
今天,AI 短视频行业已经开始把这条链路收进一个工作空间。一个聊天入口,可以从选题继续到小说、剧本、脚本、角色资产、道具资产、导演分镜、视频生成和后期制作。
MiniMax Design 给了我一个可以定义这种软件形态的名词:多模态 Agent 创作平台。“多模态”意味着它处理的不只是文字,还包括图像、角色、分镜、声音和视频;“Agent”意味着它不只生成一次内容,还会拆解目标、调用能力并推进流程;“创作平台”则意味着所有资产、过程和反馈,最终都围绕一件作品被组织起来。
这和把所有旧软件塞进一个“超级软件”并不一样。超级软件只是把更多按钮放在同一个地方;Agent 软件则是让系统理解目标,替人调用那些仍然存在的专业能力。
这件事最重要的变化,不是少打开几个软件。
它改变的是人与软件之间的分工。
以前,人负责记住流程、搬运文件、调整参数、衔接工具,软件负责执行命令。现在,人可以先说清楚“我想做什么”,Agent 再去组织模型、素材、流程和工具,最后把可检查的结果交还给人。
软件的基本单位,正在从“功能”变成“任务”,再从“任务”走向“结果”。
MiniMax Design 的多模态 Agent 创作平台工作台:对话负责理解目标,画布组织文本、角色、分镜、图像和视频资产。截图中的项目文字已经脱敏。
我说的“对话框”,不是给旧软件加一个聊天机器人
现在很多软件也有 AI 助手,但它们往往只是原有产品旁边多出一个聊天窗口。
菜单还在,流程还在,专业表单还在。用户问完 AI,仍然要自己找到正确按钮,把答案搬进原来的工作流。
我理解的对话框不是装饰,也不是客服入口,而是主要的决策入口。
用户先表达目标:我想做一条什么内容,给谁看,在哪个平台发布,希望是什么风格,有哪些限制,能够接受多少成本。
Agent 根据当前项目状态继续追问,但每次只问真正影响下一步的问题。能自动完成的检索、生成、检查、同步和导出,不再反复打断用户;需要主观判断、风险确认或资源授权时,再把选项交还给人。
这时,用户不再需要知道每个功能藏在哪个菜单里。
他只需要知道自己想要什么,以及眼前这个结果是不是自己要的。
我说的“画布”,也不是一块更大的白板
如果只有对话,复杂项目很快会失去空间感。
一条视频里有角色、场景、道具、镜头、台词、声音、候选片段和时间线。只靠聊天记录,人很难知道当前做到哪里,哪个镜头使用了哪个角色版本,哪段素材已经通过审核,哪一处修改会影响后面的成片。
所以第二个界面必须是画布。
这里的“画布”不一定真是一张无限白板。它也可以是一条视频时间线、一份可修改的文档、一个游戏场景、一张财务报表或一组病例记录。只要作品和关键证据能被看见、比较和验收,它就是这个领域的画布。
对话负责时间:现在发生了什么,下一步做什么,我要做哪个决定。
画布负责空间:项目里有什么,它们怎样连接,当前作品长什么样,哪些地方还没有完成。
在我设想的工作台里,画布不是另一个塞满按钮的任务面板。它首先是作品的可视化现场:角色和场景可以查看,镜头可以播放,候选方案可以并排比较,时间线可以回放,修改前后的差异可以被看见。
对话框让人表达意图,画布让人校准结果。
这两个界面组合起来,才构成我理解的 Agent 软件。
我说的“只需要”,不是指产品里真的只能有两个界面元素。专业设置、权限管理和异常处理仍然需要存在。我的意思是,用户与软件的主要关系可以收敛成两件事:通过对话表达意图,通过作品界面完成验收。
对话负责推进决策,画布负责呈现和验收作品。
我正在做的 Director Studio,就是一次现实验证
我给这套 AI 视频工作台起名叫 Director Studio。
它的目标不是再造一个更复杂的导演软件,而是让一个负责人从一句创意出发,在网页里完成创意、剧本、资产、分镜、候选生成、对白字幕、后期合成和成片验收。
第一次进入系统时,负责人只需要告诉 Agent:题材方向、目标受众和国家、发布平台、视频时长、视觉风格、禁忌与预算。
后面的流程由 Director Agent 推进。它每次只提出一个当前问题,并尽量把选择压缩在三个以内。项目画布则持续呈现角色、场景、道具、镜头、候选和时间线,让负责人随时看见作品,而不是去寻找后台任务。
例如,当我输入一个 60 秒东方奇幻短剧的想法时,我希望系统先整理创意和剧本,再规划角色与场景,拆出 8 到 15 个镜头。负责人不需要亲手建立每个节点,主要在画布上检查角色是否一致、镜头是否服务故事、候选片段是否可以采用。通过 15 秒样片的质量门以后,系统才继续走向 60 秒内部验收片。
但界面简单,不代表系统内部也简单。
每个资产、镜头、候选、声音和导出结果仍然要有稳定的编号、版本、来源、状态和责任记录。Agent 的每次决定和工具调用都要能够恢复、重试和追溯。角色不一致、台词落在错误人物画面、字幕未经确认、音乐授权不清楚,这些问题都不能因为“视频已经生成”就自动通过。
我在这个项目里形成了一个很重要的产品判断:
前台应该足够简单,让人把注意力放在创意和判断上;后台必须足够严谨,替人管理流程、证据和风险。
所谓“一个对话框和一张画布”,不是把专业性删掉,而是把专业性放到正确的位置。
未来消失的不是专业,而是操作软件的负担
说到这里,很容易产生一种误解:既然 AI 能接管流程,未来是不是不再需要专业知识?
我的判断恰恰相反。
不再稀缺的,可能是记住按钮位置、菜单层级、软件快捷键和固定操作步骤。继续稀缺的,是知道目标是什么、什么结果算好、哪里有风险、什么时候应该推翻重来。
一个没有导演判断的人,可以让 AI 生成视频,但很难判断人物是否成立、节奏是否拖沓、镜头是否服务故事。
一个不会设计的人,可以让 AI 画出很多页面,但很难判断信息层级、视觉语言和用户体验是否一致。
一个不懂财务、法律或医学边界的人,也不能因为有了 Agent,就把专业责任一并交出去。
所以未来的软件会降低操作门槛,却不会取消判断门槛。
它让新手更快开始,也让专业人士获得更长的杠杆。过去熟练操作软件的人可以比别人快几倍;未来能够定义问题、建立标准、组织 Agent 并审查结果的人,可能可以带着一套自己的 AI 工具完成过去一个团队的工作。
越来越多的知识工作者,会有自己的 AI 工作台
当我把这个结构从视频制作迁移到其他职业,很多东西就变得清楚了。
未来的程序员,可能不再从打开代码编辑器开始,而是先描述要解决的问题,在画布上查看系统结构、界面、测试结果和发布状态。
游戏开发者可以在对话里描述世界观、玩法和情绪,在画布上检查角色、地图、关卡、动画和试玩版本。
音乐创作人可以表达主题、节奏和情感,在画布上试听不同段落、比较编曲、调整人声与乐器关系。
财务、律师、医生和老师也会逐渐拥有各自的工作台。对话入口接收目标和上下文,专业画布呈现凭证、条款、证据、病例、课程和进度,Agent 在后面调用各自领域的工具与知识。
在医疗、法律、财务这类高责任领域,我更愿意先把 Agent 放在辅助位置:整理材料、查找矛盾、生成备选方案和提醒检查项。它不能因为界面变简单,就绕开资质、证据标准和专业人员的签字责任。
这些工作台不会完全相同,因为每个行业的责任、风险和验收方式不同。
但它们会共享一种结构:人负责提出意图、提供价值判断并承担最终责任;Agent 负责调度复杂流程;画布负责让过程和结果保持可见。
界面越简单,后台越需要认真设计
我对这个方向很乐观,但不会把它理解成“只要接一个大模型,一切就会自动完成”。
简单的前台背后,是严谨的编排、质量和恢复系统。
真正困难的地方至少有五个。
第一,人的想法经常是不完整的。Agent 需要知道什么时候继续推断,什么时候必须停下来问。
第二,作品不是一次生成出来的。角色、风格、事实和上下文要在很长的流程里保持一致。
第三,结果必须可以比较和验收。系统不能只给一个答案,还要保留版本、差异、来源和失败原因。
第四,真实工作涉及权限、成本和责任。花钱、发布、调用真实账号、使用敏感数据,都需要明确的确认边界。
第五,我们必须假设 Agent 可能失败。一个可用系统要允许断点恢复、局部重试和人工接管,而不是每次出错都从头再来。
这也是为什么我认为,未来软件的前台会变轻,后台反而会变重。
用户不再学习复杂软件,不等于复杂性消失了。复杂性只是从人的操作记忆,迁移到了系统的编排、状态、质量和安全设计中。
我现在看到的一张未来软件地图
如果让我把未来 Agent 软件压缩成一条最小路径,我会这样设计:
- 用户用自然语言说出目标、场景和限制;
- Agent 把模糊想法整理成可确认的提案;
- 用户接受关键方向,系统自动创建项目、资产和任务;
- Agent 调用专业工具执行,并持续检查质量与风险;
- 画布展示作品、版本、差异、来源和当前阻断;
- 用户只在需要判断时比较、修改、接受或停止;
- 系统保存全过程,最终交付作品和可追溯记录。
这里最重要的不是“聊天”本身,而是对话之后真的能完成工作;也不是画布有多漂亮,而是人可以在上面看见并控制结果。
最后:我们正在从学习工具,走向表达意图
图形界面曾经把计算机从命令行里解放出来,让更多人可以点击窗口、菜单和按钮完成工作。
AI Agent 可能会完成下一次迁移:人不再先学习工具的语言,而是让工具逐渐理解人的语言。
我不认为 Photoshop、剪辑软件、代码编辑器、财务系统和专业数据库会在短时间内消失。它们仍然会作为底层能力存在,只是越来越多的人不再需要直接操作它们的全部细节。
它们会变成 Agent 手里的工具。
而人站到更上面,负责目标、品味、判断、关系和责任。
这也是我搭建 Director Studio 时真正想验证的事情:不是能不能再做一个 AI 视频生成器,而是一个人能不能只通过表达想法、查看作品和做关键决定,就调动过去属于一个专业团队的生产流程。
这条路现在还在很早的阶段。角色一致性、质量判断、成本、版权、权限和可靠性,都需要一点点做实。
但我越来越相信,未来最好的软件,不是把越来越多的功能堆到人面前。
而是把复杂留给系统,把表达还给人,把作品放在画布中央。
到那时,我们学习软件的时间会减少,创造和判断的时间会增加。
这才是我期待的未来软件。
Loading...




