去年下半年,我系统性体验了一批 AI 产品,并整理成组内分享《AI-UX 智能交互设计》。准备过程中,最难回答的不是「哪个产品更好用」,而是开头那个问题:智能,到底是什么感觉?
靠谱、共情、主动、有逻辑、懂我、灵光一瞬——这些词指向同一种体验:系统不只执行指令,还能理解意图、预判下一步、在边界内自主行动。但落到界面上,「智能感」往往说不清、改不动、评不准。
我后来把这种感觉压成四件事。一个智能系统,应该:
- 理解:我的语言、意图、情绪
- 预见行为:在我说之前行动
- 自治推理:逻辑严谨,思虑周全
- 情境适应:设身处地待在当下情境里
这篇文章把分享里的观察收成一套可复用的设计框架。读完你会得到:
- HCI 与 AI-UX 的本质差异,以及意图为何成为新的设计重心
- 一条五阶段交互旅程:前馈 → 输入 → 输出 → 迭代 → 学习
- 每个阶段可落地的机制、案例与边界判断
从流程驱动到目标驱动
传统 HCI 里,用户告诉系统怎么做:点击、选择,一步步走完 WIMP 控件。主导权在人,界面表达的是可见按钮和流程。
AI-UX 里,用户表达要什么,系统决定怎么做。主导权转向系统——理解意图、自动行动。输入从点击变成自然语言、上下文与行动推理;界面从按钮菜单,变成对话、代理存在感等隐喻表达。
对话式界面常被当作这条分界线。豆包、千问、元宝、灵光,以及终端 CLI,形态各异,但都在用自然语言降低操作门槛。
对比表单,差异很清楚:
- 表单:字段需转译,但结构化、有方向,用户不容易迷路
- 对话:输入灵活,可多轮补全细节,但存在表达壁垒——用户未必知道该怎么说
两者不是替代关系,而是不同任务下的取舍。真正的问题不是「要不要对话」,而是在目标驱动的新范式里,如何把意图传达清楚、把系统行为变得可预期。
AI 时代,意图比入口更重要
Don Norman 的人机交互七阶段模型里,用户要花大量能量去指定动作序列、感知反馈——从目标到计划、战术、行动,再经感知、理解回到评估。知识、规则、本能三层叠在一起,执行段尤其耗能。
AI 把这条链路重新分工:
- 人:设置战略框架、关键模块、边界——「我的意图是……」
- AI:填充细节、执行战术、发散可能——「自动生成动作序列」
用户只需定目标,不必再找功能入口。Norman 模型里高耗能的执行段,被系统接管;设计重心上移到意图传达。
但意图从来不是一句话。向 AI 清楚表达目标并不简单——一个目标可以拆成许多信息元:
做一个 [应用],有 [功能],适合 [人群],界面 [风格]……
六爻算卦、明天吃什么、智能广告投放,表面不同,底层都是同一套意图分解。
意图传达还有一个循环:用户输入 → 系统响应 → 用户修正 → 系统迭代 → 输出结果。用户参与修正越少,能耗越低;系统若能从结果中自主学习调优,下一轮修正也会更少。
五阶段框架:一条简化的 AI 交互旅程
参考 aiverse.design 的归纳,我把 AI 交互旅程压成五个阶段:
前馈 → 输入 → 输出 → 迭代 → 学习
前馈让用户探索 AI 能做什么;输入是用户向 AI 提供上下文;输出是 AI 的响应方式;迭代是用户如何修正意图;学习是系统如何适应并匹配用户。
下面按阶段展开。每个阶段都落到同一组问题上:判断是什么、界面怎么做、用户得到什么、边界在哪。
前馈:打开黑箱之前,先形成预期
AI 系统是黑箱。用户常卡在五个问题上:怎么传达意图?我这样表达 AI 会怎么理解?知识范围是什么?结果风险?偏差可能?
前馈(feedforward)是在操作前让用户预期系统会做什么——有助于执行的信息,形成初步预期。它通过预期、解释、边界三件事,提升系统的可供性:用户知道能做什么、不能做什么、做了会怎样。
行动建议:用「菜谱」降低空白页焦虑
ChatBot 从空白开始很难。前馈的常见做法,是用预设模板和行动建议展示系统能力:
- 案例激发:AI 设计师类产品的模板卡片(酒单、咖啡店品牌、分镜),让用户「照着做」就能开始
- 关键词探索:Idea Bang 式的标签云,把模糊创意收敛成可执行的 prompt
- 多入口启动:粘贴文本、一句话生成、导入文件、混用模板——按用户手头素材选路径
机制是:用可见示例替代不可见的模型能力。后果是降低首次交互门槛。边界是:示例太多会变成功能货架,选项一多,决策反而变慢——精选比堆砌更重要。
输入:意图不只来自用户打字
单靠自然语言传达意图,往往太笼统。完整的意图来源分两层:
用户主动提供:直接输入的 prompt、指令、素材。
隐含、非主动提供:
- 上下文情境:时间、空间、传感器
- 推理知识库:习惯、文化、元数据
ChatBot 过于开放、门槛高。实践中四类增强输入最常见:
1. 结构化输入:可控
预定义格式——表单、变量、滑块——精准引导系统,减少歧义。限制边界、交出更细控制权、提高重复任务效率。
- Suno 的风格滑块与歌词模式
- Figma 的语气象限(简洁↔展开、专业↔随意)
- Lumalabs 可替换的提示词组件
- Adobe Firefly 从参考图提取构图、色彩、光照等属性再混合
后果是专业用户能稳定产出,而非跟模型赌运气。边界是:控件过多会把对话变成配置面板,只适合需要精确控制的场景。
2. 多模态输入:自然地输入
图片、声音、手势等富媒介,单位信息密度高,输入像自然知觉的延伸。用户不必把所见所想全部翻译成文字。
- iPad 画圈选中上下文
- Mixboard「选择即输入」
- Claude 对着文档语音提问
- 灵光「看见即输入」
边界是:多模态采集涉及隐私与误识别,需要明确的触发与确认。
3. 情境感知 + 意图识别:提前想到下一步
用户表达困难时,系统实时补充情境,增强表达,降低负担。关键是适度的主动性与有效的上下文补充。
- Hero AI 输入自动补全
- RunwayML 自动增强提示词
- ChatGPT 输入框预测续写
边界是:补全太激进会变成「系统替用户想」,打断思路;太保守则等于没有。主动性必须可忽略、可改写,思维才能和输入并行,而不是先被系统带跑。
4. 集成知识库:预先输入
定义 AI 知道什么、能做什么,把背景知识前置到交互之外,让使用无缝连贯。
- NotebookLM 的内容来源
- Meter 基于数据生成并组装 UI 组件
边界是:知识库过时或片面时,AI 会在错误前提下表现得很自信——需要来源可见与更新机制。
输出:用户低参与阶段,更要可见
AI 输出包含理解与行动:感知、理解、评估意图,形成计划与战术,最后实施。流程上是 输入 → 等待 → 输出 → 迭代。中间「等待 + 输出」是 AI 运行阶段,用户参与度低,也是体验最容易塌掉的区段。
按下之后如果长时间无响应,精神负担会陡增。更糟的是过程不可打断——用户被迫先等动画播完,再决定要不要改主意。
运行步骤:让系统「动起来」可见
把系统状态和处理步骤外显,等待时不焦虑,行动时可监督。
- v0 展示思维链:用户知道 AI 如何理解任务,可中途 Stop
- ChatGPT「Thinking…」可打断:复杂请求时状态可见、可中止
- Atlas 点阵动画 + 页面气泡:代理在网页上行动时,标注当前操作对象
边界是:思维链过长会喧宾夺主;关键场景必须保留「接管」入口。动画进行中仍可抓取、反转、改目标——这才是代理感,而不是一段播完才能点的片。
多线程 / 批量:用空间换时间
用屏幕空间承载并行可能性,打破线性聊天的吞吐瓶颈。
- Reve AI 回复队列:多条请求并行处理
- Conductor 多 Agent 并行
- Flora 图像生成矩阵:一次探索整个变体空间
边界是:并行越多,用户的比较与决策成本越高——需要筛选、排序、推荐。复杂度不会消失,只是从时间挪到了空间。
预览输出:校准大方向
在重投入前验证方向:高透明度、可控、低成本试错。
Gemini Deep Research 先给研究计划,用户可「修改方案」或「开始研究」。
边界是:预览本身也有成本;简单任务不需要两步确认。
实时生成:更快获得反馈
生成中演变、随时介入、提升代理感,把等待环节压成连续调参。
Krea 实时画布:用户改参数,画面即时变化。反馈从「等结果」变成「跟着手走」。
边界是:实时预览适合连续调参类任务,不适合长链路推理。
迭代:在上下文里微调,而不是重开对话
迭代不是「再说一遍」,而是从现有上下文和想法出发,继续优化。改哪里、改什么,应当一目了然;修正成本要远低于整段重写。
内联动作
精确上下文、指定范围——在当前对象上动手,而不是回到空白输入框。
- Polymet 设计建议一键 Apply
- Figma 批量替换内容
- Lumalabs 发散联想
- Lovart 对象标记与内容分离
画布节点:让推理过程可结构、可回溯
Flora 自由节点、AiArtSecret 脑图节点、Flowith 树状节点——用离散节点承载对话状态与语义,让 AI 的连续推理显性化。
一个节点可拆为:I 输入(用户意图)、O 输出(AI 回应)、R 隐含推理、C 上下文引用、P 模型状态 / 参数。迭代的本质是:修改部分 → 局部重算 → 保留已验证部分 → 推动整体演化。画布节点的自由度、结构化、可迁移复现,天然支持局部可控。
在此基础上,五种操作构成完整的「理解并影响 AI」工具箱:
| 操作 | 做什么 |
|---|---|
| 回溯 | 查看依赖、引用与推理链 |
| 修正 | 改内容并重新输出 |
| 插入 | 在输入与输出间增加辅助信息 |
| 分支 | 分叉更多输出,跨分支引用 |
| 聚合 | 将多路信息合并 |
机制是把历史上下文变成可见、可操控的结构模型。后果是信任、可控、可解释、可迭代同时提升。边界是:节点画布学习成本高,适合复杂创作与研发,不适合一次性轻量查询。
学习:让系统记住语境
ChatGPT Memory 是典型实现:用户声明偏好,系统更新记忆,用户可 Manage。长期 / 短期记忆支撑连续交互与个性化——说过的不用反复说,互动越多越贴合用户思维。
边界是:记忆错误会长期污染体验。信任靠三件事一起成立——用户必须能看见记住了什么、能编辑、能删除。少任何一项,个性化都会变成黑箱绑架。
边界:什么时候自动化,什么时候增强
交互的持久课题没变:让人看得清、想得明、做得到。三个老问题仍在——信息爆炸(找不着)、认知局限(想不到)、行动障碍(操作麻烦)。
AI 的价值在于三条路径:
- 推荐:理解意图与情境——给你想要的
- 决策:补充知识、预测未来、全局规划——帮你选更好的
- 代理:定目标、AI 执行——一条龙完成
但「全自动」不是默认答案。Google PAIR 的自动化 / 增强决策矩阵值得背下来:
高度自动化适合繁琐、重复、大规模的任务,指标是效率、降错、减少枯燥,设计要点是保留监督、预览、撤销。增强适合个人责任、高风险、主观判断、用户享受的任务,指标是创造力、控制感、乐趣,设计要点是用户掌控终稿,工具像「超能力」。
李继刚提过一种更贴切的分法:白盒工作流太脆,黑盒许愿太飘,人机协作的甜区是透明盒——人定战略框架与边界,AI 在框架内填充细节、执行战术;透明度随场景调节。
对应三条设计原则:
- 边界清晰:避免漫无目的许愿
- 容错空间:AI 能自我调整,用户能低成本修正
- 参与度可调:不同场景,不同力度的人机分工
IJHCI 的人机协作模型进一步提醒:除了任务信息流(感知、理解、预测),还有团队信息流——协同解释、协同理解、协同信任。界面要同时交出透明度、可理解性、可预测性,人和 AI 才谈得上共享心智模型。
AI 交互设计不只是把任务做完,还要理清人和 AI 的任务 + 关系。
回到那个问题
智能是什么感觉?
不是消息框里多一个闪烁光标,也不是把所有按钮换成一个输入框。它更接近这样一种体验:
- 你知道系统能做什么(前馈)
- 你能用自然、多模态、有情境的方式表达意图(输入)
- 等待时看得见、等得起、控得住(输出)
- 偏了能局部修、分了能合并、深了能回溯(迭代)
- 说过的不用反复说,系统记得你的语境(学习)
- 全程边界清晰,该自动时自动,该增强时给你超能力(关系)
AI-UX 不是给传统界面贴一层聊天皮肤。它是从流程驱动走向目标驱动时,一整套关于意图、可见性与协作关系的设计纪律。
能把这四个问题答清楚,「智能感」就不再是形容词,而是可以争论、可以迭代的设计方案。