VISUAL LANGUAGE STUDIO · P2

30秒观看:画面帮助你记住了什么?

快速观看 · 30秒

观看时寻找画面、目标词和例句之间的关系。

材料消失后:你能提取多少英语?

遮图提取 · 3分钟
SCENE

说出人物、动作和地点。

LANGUAGE

写出三个目标词,并用一个词造句。

TRANSFER

把其中一个词用于新的场景。

点击显示参考答案或判断依据

能够复述画面,却说不出目标词,说明图像帮助了情节记忆,但尚未建立语言提取路径。P2必须继续设计撤去提示后的表达任务。

P2项目:从一个语言问题开始

设计一份让学习者完成“理解—提取—表达”的多模态作品

图片路线

4—6幅关联图像

视频路线

60—90秒分段视频

先确定学习者需要理解或表达什么,再选择图像、文字和声音。

四种编辑动作把理论变成材料决策

REMOVE删除

减少与语言目标竞争的信息

SIGNAL突出

指出语言与意义的关键关系

SEGMENT切分

控制信息出现的顺序与节奏

FADE撤去提示

要求学习者离开材料重新表达

Mayer (2021); Krashen (1982); Schmidt (1990); Swain and Lapkin (1995)

动作一:删除竞争注意的信息

是什么

连贯原则认为,学习材料应排除与教学目标无关的文字、图像和声音。额外信息会占用有限的加工容量。

怎么用
  • 写下唯一的语言目标
  • 逐项标记保留、删除或延后
  • 说明留下的元素帮助哪一步加工
检查问题

删掉它以后,学习者理解或表达目标语言会变差吗?

Mayer (2021)

删除:同一材料的过载版与聚焦版

快速判断 · 30秒
过载版

🎵 持续音乐 · ✨ 装饰动画 · 两次中文释义

meticulous = very careful and precise

聚焦版

meticulous

画面只保留“逐项检查”的动作;例句说明行动及结果。

判断:音乐、中文释义和角色装饰分别应该保留、删除,还是延后?

点击显示参考答案或判断依据

先删除持续背景音乐、重复释义和无关装饰。保留能解释词义、动作关系或任务要求的信息。删除的依据是语言目标,不是个人审美。

动作二:突出语言与意义的关系

是什么

信号原则使用标题、位置、颜色、箭头或停顿,引导学习者选择重要信息并看见信息之间的关系。

怎么用
  • 只突出目标词和关键动作
  • 让颜色或位置承担稳定含义
  • 信号出现后安排一次语言加工
检查问题

学习者能否在两秒内指出应该注意哪一组语言与意义关系?

Mayer (2021)

突出:颜色很多,不等于信号清楚

信号判断 · 30秒
版本A

After we depart, a quick transfer transports us to the terminal.

每个词颜色不同,关系不明确
版本B

After we depart, a quick transfer transports us to the terminal.

同一颜色标出目标词,并与交通动作对应

判断:哪一种突出方式会改变学习者的注意方向?

点击显示参考答案或判断依据

第二版的信号更有效,因为颜色和位置直接连接目标词与关键动作。第一版颜色很多,却没有告诉学习者应该注意什么关系。

动作三:切分信息出现的顺序

是什么

分段原则把连续材料划分为学习者可以控制的部分,使其先处理当前信息,再进入下一步。

怎么用
  • 按意义单位切分,不按固定秒数切分
  • 在预测、选择或复述之前暂停
  • 一次只引入一项新的语言关系
检查问题

学习者能否决定何时进入下一段,并在每段完成一个明确动作?

Mayer (2021)

动作四:撤去提示,要求重新表达

是什么

学习者先借助图像、字幕或句框理解语言,随后提示逐渐减少,学习者必须从记忆中提取并重新组织表达。

怎么用
  • 先提供足够的可理解情境
  • 通过高亮或比较促使注意语言形式
  • 每撤去一层提示,都要求再次表达
检查问题

最后一次表达是否仍依赖原句、翻译或完整字幕?

Krashen (1982); Schmidt (1990); Swain and Lapkin (1995)

撤去提示:四级支架必须对应四次表达

支架判断 · 30秒
1

After we depart, a quick transfer transports us to the terminal.

2

depart · transfer · terminal

3

d______ · t______ · terminal image

4

只保留新情境图片

判断:哪一级最适合你的目标学习者?下一步怎样继续撤去帮助?

点击显示参考答案或判断依据

支架应从完整例句逐步减少为关键词、首字母或画面,最后全部撤去。学习者每次都要重新表达,教师才能判断语言是否可以独立提取。

四种动作分别回答四个设计问题

动作设计问题可观察结果
REMOVE什么会竞争注意?更快定位目标信息
SIGNAL应该注意什么关系?能够指出语言与意义的对应
SEGMENT信息何时出现?能够完成每一段的加工任务
FADE何时撤去帮助?能够脱离材料重新表达

每种动作都必须改变材料或任务。只在设计卡中写理论名称,不构成理论应用。

作品质量来自持续的选择与修改

Jiang and Lai (2025)

110名学生组成24组制作视频纪录片。研究从策划、脚本、多模态制作与评价过程解释作品质量。

P2可以借鉴
  • 记录为什么选择或拒绝AI生成结果
  • 用作品证据说明模态之间怎样配合
  • 把小组作品质量与个人语言学习分开

Jiang and Lai (2025)

图像提示词与字幕都必须服从学习目标

论文读图 · 1分钟
Ye and Yan prompt template page

Ye and Yan (2026)

提示模板控制人物、场景和风格的一致性。它帮助生产图片,但不能代替事实核验与语言任务设计。

Montero Perez et al. (2013)

字幕视频研究表明字幕能够支持听力与词汇学习,但字幕语言、学习水平与任务目标会改变效果。

Ye and Yan (2026); Montero Perez et al. (2013)

点击显示参考答案或判断依据

提示模板可以提高图像之间的语义一致性,但人工仍要核验事实、风格和错误联想。字幕研究则提醒我们,字幕配置必须服从学习水平与任务目标。

原始作品:图像、语境句和词汇表已经建立联系

original travel vocabulary comic

Our weekend adventure began with a long hike; we tramped through the mud, wandered off the main trail, and every risky venture turned worthwhile as we loved to explore the unknown.

现有优势:完整情境与目标词高亮。需要补充:撤去提示后的提取、反馈与迁移。

删除:让目标语言获得更多注意空间

user feedback on the pilot

人的判断

用户要求调整构图、减少背景占比,并增加稳定的TEM-4标识。对P2而言,还要继续判断哪些释义、装饰和品牌信息应在学习的不同阶段出现。

KEEP: 情境动作DELAY: 中文释义REMOVE: 无关装饰

突出:目标词必须与画面中的动作对应

🧭人物离开营地,进入未知路线
Our weekend adventure began with a long hike. We wandered off the main trail to explore the unknown.

蓝色只承担一种功能:指出本轮需要提取的目标词。教师指向画面动作,学生必须用对应词描述。

撤去提示:从完整语境句走向独立表达

第一次

adventure · hike · tramp · wander · venture · explore

跟随完整语境句描述画面

第二次

h___ · w___ · e___

只看关键词首字母复述

第三次

🖼️

只看新图,用至少三个目标词表达

Schmidt (1990); Swain and Lapkin (1995)

案例改造后的完整学习链

流程审查 · 3分钟
UNDERSTAND看图预测并阅读MAP把目标词与动作对应RETRIEVE遮住文字并复述REPAIR根据反馈重说TRANSFER新情境再次使用

流程审查:如果只能保留三个环节,你会保留哪些?删去其他环节会损失什么?

点击显示参考答案或判断依据

完整流程至少包含理解、图词对应、撤去提示后的提取、根据反馈重说和新情境迁移。缺少后面三个环节时,作品仍可能只是展示材料。

语言问题决定作品的起点

语言目标选择 · 3分钟
词汇

知道词义,却不能在情境中提取

语法

能选择答案,却不能用于表达

语篇

理解单句,却说不清事件顺序或关系

接触机会

目标表达出现次数不足或情境单一

我们的目标学习者是___;他们目前能___,但还不能___;作品将帮助他们___。

图片路线:六步形成可试用原型

1确定语言问题2写4—6个意义节点3固定角色、场景和风格4生成无文字底图5后期加入可编辑语言6补上提取与迁移任务

图片组必须形成意义关系。六张互不相关的漂亮图片不能自动构成多模态学习作品。

给AI的工作包需要同时约束内容与视觉

LANGUAGE

目标表达、难度、例句和不可改动的事实

VISUAL

角色锚、场景、镜头、色彩和禁止元素

STRUCTURE

图像数量、视频分段、文字层与命名规则

ACCEPTANCE

学习者必须完成的理解、提取和表达行为

先给出4—6个意义节点和每个节点的语言学习目的。我们确认后,再生成保持同一人物和风格的无文字底图。不要在图片中生成单词、音标或翻译。

作品需要一条可以实际完成的学习任务链

1 理解

回答一个内容问题

2 对应

把表达与画面动作连接

3 提取

关闭文字或字幕后表达

4 反馈

指出遗漏或含糊之处

5 再表达

修改并重说

6 迁移

在新情境中使用

选择题可以检查理解,但不能代替撤去提示后的语言产出。

同伴盲测:创作者保持沉默

核心活动:同伴盲测 · 8分钟
试用者
  • 独立浏览作品
  • 完成理解与提取任务
  • 说出卡点与自己的理解
观察者
  • 记录停顿、回看和求助
  • 不解释页面,也不提供答案
  • 记录目标表达实际出现的位置
创作者
  • 只听和记录
  • 试用结束后再提问
  • 选择一个最严重的问题
08:00

观察证据:分数之外要看语言加工

证据记录 · 3分钟
UNDERSTAND能否回答内容问题RETRIEVE能否脱离提示提取SEARCH在哪里反复寻找信息REPAIR反馈后怎样修正TRANSFER新情境能否使用
我们观察到:试用者在___时___;目标表达出现___次;反馈后___。
点击显示参考答案或判断依据

优先记录可观察行为:目标表达是否准确、是否需要回看、在哪里停顿、反馈后怎样修正、换情境后能否继续使用。喜欢程度只能补充解释。

P2只提交三个核心模块

01

最终作品

4—6幅关联图像或60—90秒分段视频,包含可执行学习流程。

02

一页设计卡

说明语言问题、受众、编辑动作、模态选择及关键AI交互。

03

一张迭代卡

呈现一项试用证据、最小修改和修改前后。

打开P2项目交付清单

评分关注语言学习流程与证据

20%目标与理论
40%作品与学习流程
25%试用证据解释
15%关键迭代

图片数量、生成成本和视觉精美程度不能单独换取分数。核心问题是作品是否促成目标语言的理解、提取和表达。

本讲核心材料

Jiang, L., & Lai, C. (2025). How did the generative artificial intelligence-assisted digital multimodal composing process facilitate the production of quality digital multimodal compositions: Toward a process-genre integrated model. TESOL Quarterly, 59(S1), S52–S85. https://doi.org/10.1002/tesq.3390

Krashen, S. D. (1982). Principles and practice in second language acquisition. Pergamon Press.

Liu, M., Zhang, L. J., & Biebricher, C. (2024). Investigating students’ cognitive processes in generative AI-assisted digital multimodal composing and traditional writing. Computers & Education, 211, 104977. https://doi.org/10.1016/j.compedu.2023.104977

Mayer, R. E. (2021). Multimedia learning (3rd ed.). Cambridge University Press. https://doi.org/10.1017/9781316941355

Montero Perez, M., Van Den Noortgate, W., & Desmet, P. (2013). Captioned video for L2 listening and vocabulary learning: A meta-analysis. System, 41(3), 720–739. https://doi.org/10.1016/j.system.2013.07.013

Schmidt, R. W. (1990). The role of consciousness in second language learning. Applied Linguistics, 11(2), 129–158. https://doi.org/10.1093/applin/11.2.129

Swain, M., & Lapkin, S. (1995). Problems in output and the cognitive processes they generate. Applied Linguistics, 16(3), 371–391. https://doi.org/10.1093/applin/16.3.371

Ye, G., & Yan, S. (2026). Multimodal instruction with AI-generated images for noun retention. PLOS ONE, 21(4), e0334778. https://doi.org/10.1371/journal.pone.0334778