多模态语言学习设计
让视觉、声音与语言任务协同工作
P2 · 90 MIN · 视觉编辑工作室

让视觉、声音与语言任务协同工作
P2 · 90 MIN · 视觉编辑工作室




观看时寻找画面、目标词和例句之间的关系。
说出人物、动作和地点。
写出三个目标词,并用一个词造句。
把其中一个词用于新的场景。
能够复述画面,却说不出目标词,说明图像帮助了情节记忆,但尚未建立语言提取路径。P2必须继续设计撤去提示后的表达任务。
设计一份让学习者完成“理解—提取—表达”的多模态作品
4—6幅关联图像
60—90秒分段视频
先确定学习者需要理解或表达什么,再选择图像、文字和声音。
减少与语言目标竞争的信息
指出语言与意义的关键关系
控制信息出现的顺序与节奏
要求学习者离开材料重新表达
Mayer (2021); Krashen (1982); Schmidt (1990); Swain and Lapkin (1995)
连贯原则认为,学习材料应排除与教学目标无关的文字、图像和声音。额外信息会占用有限的加工容量。
删掉它以后,学习者理解或表达目标语言会变差吗?
Mayer (2021)
🎵 持续音乐 · ✨ 装饰动画 · 两次中文释义
meticulous = very careful and precise
meticulous
画面只保留“逐项检查”的动作;例句说明行动及结果。
判断:音乐、中文释义和角色装饰分别应该保留、删除,还是延后?
先删除持续背景音乐、重复释义和无关装饰。保留能解释词义、动作关系或任务要求的信息。删除的依据是语言目标,不是个人审美。
信号原则使用标题、位置、颜色、箭头或停顿,引导学习者选择重要信息并看见信息之间的关系。
学习者能否在两秒内指出应该注意哪一组语言与意义关系?
Mayer (2021)
After we depart, a quick transfer transports us to the terminal.
每个词颜色不同,关系不明确After we depart, a quick transfer transports us to the terminal.
同一颜色标出目标词,并与交通动作对应判断:哪一种突出方式会改变学习者的注意方向?
第二版的信号更有效,因为颜色和位置直接连接目标词与关键动作。第一版颜色很多,却没有告诉学习者应该注意什么关系。
分段原则把连续材料划分为学习者可以控制的部分,使其先处理当前信息,再进入下一步。
学习者能否决定何时进入下一段,并在每段完成一个明确动作?
Mayer (2021)
只看情境,回答发生了什么
显示目标表达,与动作对应
暂停并预测下一步
关闭字幕,用目标表达复述
判断:如果视频只能暂停一次,应该停在哪里?这一停顿要求学习者做什么?
建议先呈现情境,再显示目标表达;随后暂停并要求预测,最后撤去字幕进行复述。分段的目的在于控制加工顺序,而不只是把视频剪短。
学习者先借助图像、字幕或句框理解语言,随后提示逐渐减少,学习者必须从记忆中提取并重新组织表达。
最后一次表达是否仍依赖原句、翻译或完整字幕?
Krashen (1982); Schmidt (1990); Swain and Lapkin (1995)
After we depart, a quick transfer transports us to the terminal.
depart · transfer · terminal
d______ · t______ · terminal image
只保留新情境图片
判断:哪一级最适合你的目标学习者?下一步怎样继续撤去帮助?
支架应从完整例句逐步减少为关键词、首字母或画面,最后全部撤去。学习者每次都要重新表达,教师才能判断语言是否可以独立提取。
| 动作 | 设计问题 | 可观察结果 |
|---|---|---|
| REMOVE | 什么会竞争注意? | 更快定位目标信息 |
| SIGNAL | 应该注意什么关系? | 能够指出语言与意义的对应 |
| SEGMENT | 信息何时出现? | 能够完成每一段的加工任务 |
| FADE | 何时撤去帮助? | 能够脱离材料重新表达 |
每种动作都必须改变材料或任务。只在设计卡中写理论名称,不构成理论应用。
研究比较生成式AI辅助数字多模态创作与传统写作,关注学生怎样规划、生成、评价与修改。
P2借鉴过程记录方式,不把过程差异解释为长期语言能力提升。
Liu et al. (2024)
这项研究适合支持学生记录规划、生成、评价与修改过程。研究中的认知过程差异不能直接证明一次多模态任务提高了长期语言能力。
110名学生组成24组制作视频纪录片。研究从策划、脚本、多模态制作与评价过程解释作品质量。
Jiang and Lai (2025)

提示模板控制人物、场景和风格的一致性。它帮助生产图片,但不能代替事实核验与语言任务设计。
字幕视频研究表明字幕能够支持听力与词汇学习,但字幕语言、学习水平与任务目标会改变效果。
Ye and Yan (2026); Montero Perez et al. (2013)
提示模板可以提高图像之间的语义一致性,但人工仍要核验事实、风格和错误联想。字幕研究则提醒我们,字幕配置必须服从学习水平与任务目标。

产品已有图像与词汇,学习流程还缺少什么?
原始产品已经建立图像、语境句和词汇表,但主要支持阅读和识别。P2的改造目标是增加遮图提取、重新表达和新情境使用。

Our weekend adventure began with a long hike; we tramped through the mud, wandered off the main trail, and every risky venture turned worthwhile as we loved to explore the unknown.
现有优势:完整情境与目标词高亮。需要补充:撤去提示后的提取、反馈与迁移。

用户要求调整构图、减少背景占比,并增加稳定的TEM-4标识。对P2而言,还要继续判断哪些释义、装饰和品牌信息应在学习的不同阶段出现。
蓝色只承担一种功能:指出本轮需要提取的目标词。教师指向画面动作,学生必须用对应词描述。
只看画面,预测旅行中发生了什么
阅读语境句,确认事件
目标词与动作对应
遮住文字,按顺序复述
换一张旅行图,再次表达
Mayer (2021)
adventure · hike · tramp · wander · venture · explore
跟随完整语境句描述画面
h___ · w___ · e___
只看关键词首字母复述
🖼️
只看新图,用至少三个目标词表达
Schmidt (1990); Swain and Lapkin (1995)
流程审查:如果只能保留三个环节,你会保留哪些?删去其他环节会损失什么?
完整流程至少包含理解、图词对应、撤去提示后的提取、根据反馈重说和新情境迁移。缺少后面三个环节时,作品仍可能只是展示材料。
知道词义,却不能在情境中提取
能选择答案,却不能用于表达
理解单句,却说不清事件顺序或关系
目标表达出现次数不足或情境单一
图片组必须形成意义关系。六张互不相关的漂亮图片不能自动构成多模态学习作品。
目标表达、难度、例句和不可改动的事实
角色锚、场景、镜头、色彩和禁止元素
图像数量、视频分段、文字层与命名规则
学习者必须完成的理解、提取和表达行为
回答一个内容问题
把表达与画面动作连接
关闭文字或字幕后表达
指出遗漏或含糊之处
修改并重说
在新情境中使用
选择题可以检查理解,但不能代替撤去提示后的语言产出。
写清学习者、语言问题和一个可观察目标
设计4—6个意义节点或视频分段
应用至少两种编辑动作
补上遮提示后的表达任务
优先记录可观察行为:目标表达是否准确、是否需要回看、在哪里停顿、反馈后怎样修正、换情境后能否继续使用。喜欢程度只能补充解释。
我们观察到
___,这影响了
___,因此把
___,复测时观察
___4—6幅关联图像或60—90秒分段视频,包含可执行学习流程。
说明语言问题、受众、编辑动作、模态选择及关键AI交互。
呈现一项试用证据、最小修改和修改前后。
图片数量、生成成本和视觉精美程度不能单独换取分数。核心问题是作品是否促成目标语言的理解、提取和表达。
Jiang, L., & Lai, C. (2025). How did the generative artificial intelligence-assisted digital multimodal composing process facilitate the production of quality digital multimodal compositions: Toward a process-genre integrated model. TESOL Quarterly, 59(S1), S52–S85. https://doi.org/10.1002/tesq.3390
Krashen, S. D. (1982). Principles and practice in second language acquisition. Pergamon Press.
Liu, M., Zhang, L. J., & Biebricher, C. (2024). Investigating students’ cognitive processes in generative AI-assisted digital multimodal composing and traditional writing. Computers & Education, 211, 104977. https://doi.org/10.1016/j.compedu.2023.104977
Mayer, R. E. (2021). Multimedia learning (3rd ed.). Cambridge University Press. https://doi.org/10.1017/9781316941355
Montero Perez, M., Van Den Noortgate, W., & Desmet, P. (2013). Captioned video for L2 listening and vocabulary learning: A meta-analysis. System, 41(3), 720–739. https://doi.org/10.1016/j.system.2013.07.013
Schmidt, R. W. (1990). The role of consciousness in second language learning. Applied Linguistics, 11(2), 129–158. https://doi.org/10.1093/applin/11.2.129
Swain, M., & Lapkin, S. (1995). Problems in output and the cognitive processes they generate. Applied Linguistics, 16(3), 371–391. https://doi.org/10.1093/applin/16.3.371
Ye, G., & Yan, S. (2026). Multimodal instruction with AI-generated images for noun retention. PLOS ONE, 21(4), e0334778. https://doi.org/10.1371/journal.pone.0334778
四种编辑动作中,哪一种最可能改变你原来的设计习惯?请用一句话说明你会怎样使用它。