说话能力的获得——十阶段与四套内部模型

前面分解的是「听懂」(听觉理解);本篇对称地分解「会说话」(语言产出)。「说话」不是把脑中的想法翻译成声音,最终能力是形成一套可以实时运行的闭环:意图 → 语言组织 → 发音动作 → 声音 → 对方反馈 → 修正。获得过程分为十阶段:发声控制 → 声音模仿 → 音系建立 → 声音—动作映射 → 词汇建立 → 组块 → 句法生成 → 实时生成 → 自我监控 → 互动生成,底层是四套互相连接的内部模型。


一、先把「说话能力」拆成结果链

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
想表达什么

形成表达意图

选择概念/信息

组织语言意义

选择词

组织句法

组织语音

规划发音动作

执行口腔动作

产生声音

自己听到自己的声音

判断是否表达成功

根据反馈修正

最底层不是「背单词」,而是:

建立从意图到声音的可执行映射。


二、第一阶段:先获得「发声—听觉」的闭环

婴儿并不是一开始就说词。首先是:

1
2
自己发声 → 听见自己的声音 → 改变发声方式 → 再次听
→ 发现声音变化 → 逐渐控制声音

例如「啊——」然后改变音高、音量、持续时间、口型、舌头位置、呼吸,逐渐形成身体动作 → 声音结果的映射。

说话不只是纯认知任务,还是一个运动控制任务。


三、第二阶段:获得「声音模仿能力」

1
2
听到别人 → 形成听觉表征 → 尝试发出类似声音 → 自己听到结果
→ 比较「目标声音」和「自己的声音」 → 调整发音动作 → 再次发音
1
2
目标声音 → 运动计划 → 身体执行 → 实际声音
→ 听觉比较 → 误差 → 运动修正

这是一个闭环控制系统。说话能力不是单纯「学会声音」,而是:

建立声音 ↔ 发音动作之间的双向模型。


四、第三阶段:建立语言声音类别

1
2
大量声音 → 发现哪些声音属于同一类别 → 建立声音类别
→ 知道自己发出的声音属于哪个类别

英语中不同人的 /p/、不同速度的 /p/、不同位置的 /p/ → 共同的 /p/ 表征。这时候才真正建立语言的音系系统。说话时反过来:目标音素 → 找到对应的发音动作 → 执行。

听和说在这里开始连接:听觉表征 ↔ 发音动作。


五、第四阶段:从声音到词

建立 概念/对象 ↔ 词 ↔ 声音

1
球 → ball → /bɔːl/

不断发生「听到 ball、看到球、自己说 ball、别人回应」,于是概念 ↔ 词 ↔ 声音 ↔ 发音动作逐渐成为一个整体。

这里非常关键:真正获得的是直接通路。

1
2
3
初学者:我要表达「球」→ 中文「球」→ 想英文 ball → 发音
熟练以后:概念「球」→ ball → 声音
实际交流中:看到球 → ball(几乎直接出来)

六、第五阶段:从单词到「组块」

如果每次说话都重新计算 I / want / to / go / to / the / store,速度会非常慢。大量使用之后会形成:

1
[I want to] + [go to the store]

再进一步,I want to go to the store. 作为一个较大的语言动作单位。这就是组块化

从一个词一个词地组装,变成调用已经形成的语言组块。 组块解决了工作记忆容量问题,是说话从慢到快的关键。


七、第六阶段:获得句子生成能力

「我想表达一个新的意思,但以前没有完整说过这句话」:

1
2
意图 → 昨天 → 我 → 买 → 杯子 → 商店 → 过去时
→ 英语词汇选择 → 英语句法组织 → 语音组织 → 发音

最终:I bought a cup at the store yesterday.

这里形成的是:

从意义结构动态生成语言结构。

背句子只能产生已经见过的句子;生成能力则允许以前没说过的新句子


八、第七阶段:获得「实时生成」能力

这是外语学习特别容易卡住的地方。

1
2
初学者:想法 → 中文句子 → 翻译 → 英语语法检查 → 找词 → 组织 → 发音(太慢)
熟练者:想法 → 英语表达 → 发音(在线进行)

熟练者的在线过程:

1
2
3
4
5
6
7
正在说第一个意群

同时规划第二个意群

同时监控自己说出来的声音

继续生成第三个意群

这才是真正的口语流利度

语言生成过程的实时化和自动化。


九、第八阶段:获得自我监控与修正

真正的说话系统不能只负责输出,它还要「说 → 听自己的声音 → 判断 → 发现问题 → 修正」:

1
I go—sorry, I went there yesterday.

再例如发现对方没理解:I mean… I went there last Friday.

成熟的说话能力本身就是一个闭环:

1
2
意图 → 生成 → 发音 → 自我听觉反馈 → 对方反馈
→ 判断 → 修正 → 继续生成

十、第九阶段:获得互动能力

真正的口语不是「一个人连续输出」,而是听 ↔ 说实时耦合:

1
2
3
4
A:Where did you go?
→ 理解问题 → 生成答案
→ B:I went to...
→ A 的反应 → 继续/改变表达

到了这里,「说话能力」已经不再只是语言生成,而是:

在共同语境中实时协调双方的信息。


十一、完整的「说话能力获得过程」

1
2
3
4
5
6
7
8
9
10
① 发声控制:身体动作 → 声音
② 声音模仿:听到目标 → 尝试产生 → 听反馈 → 修正
③ 音系建立:大量声音变式 → 抽象语言声音类别
④ 声音—动作映射:语言声音 → 发音动作
⑤ 词汇建立:概念 ↔ 词 ↔ 声音 ↔ 动作
⑥ 语言组块:词 → 高频组合 → 自动调用
⑦ 句法生成:意义结构 → 新语言结构
⑧ 实时生成:意图 → 连续语言 → 连续发音
⑨ 自我监控:输出 → 自己听 → 判断 → 修正
⑩ 互动生成:我的表达 ↔ 对方反应 ↔ 下一步表达

十二、「阶段」和「流程」还需要再分一次

阶段

回答「最终要获得哪些能力」:发声 → 模仿 → 音系 → 词 → 组块 → 生成 → 实时生成 → 监控 → 互动。

能力获得流程

回答「某一个能力是怎么长出来的」,例如英语 /r/ 的发音:

1
2
3
听目标 → 观察/感受发音 → 尝试 → 产生声音 → 自己听 → 比较
→ 发现误差 → 调整动作 → 再次尝试 → 不同词中重复
→ 不同语速中重复 → 不同环境中使用 → 自动化

实际训练流程

才是:

1
2
给材料 → 让用户模仿 → 录音 → 反馈 → 再次模仿
→ 换说话人 → 换词 → 换句子 → 自由表达 → 检测是否迁移

「获得能力」并不等于「训练步骤」。 训练步骤只是人为制造一个环境,让上面的能力形成机制不断运行。


最关键的一点:四套互相连接的内部模型

「说话能力」最底层不是记住多少单词、学过多少语法,而是逐渐建立四套互相连接的内部模型:

1
2
3
4
① 意义模型:我想表达什么?
② 语言模型:这个意义应该怎样组织成语言?
③ 发音模型:这个语言形式应该产生什么声音?
④ 运动模型:我的身体应该怎样运动才能产生这个声音?

然后形成闭环:

1
2
意义 → 语言 → 声音 → 动作 → 实际声音
→ 听觉反馈 → 与目标比较 → 修正 → 更准确的模型

再加上对方反馈 → 意义是否传达成功 → 调整语言/表达。

母语环境之所以强大,是因为它天然每天都在提供这个闭环;外语培养体系真正应该做的,不是简单地「教更多英语」,而是人为重建这个能力形成环境,并逐步增加变化、自由度和互动压力,直到脱离训练环境仍能运行。


与其他线的关系

1
2
3
4
5
6
7
8
9
10
11
12
13
本线 ←→ 认知能力分解(09-认知与语言/02)
02 分解「听懂」(听);本线对称分解「会说话」(说)
两者共用能力获得的底层机制(变式→不变性、反馈→修正)

本线 ←→ 输入端能力(09-认知与语言/07)
听的前端是语言事件检测;说的前端是发声—听觉闭环

本线 ←→ 预测机制(09-认知与语言/08)
说话 = 意图→声音→反馈→比较→修正 的预测闭环

本线 ←→ 外语表达(09-认知与语言/10)
10 讲输出的训练方法(意义重建/生成—比较—修正)
本线讲说话能力的阶段结构(十阶段/四模型)——10 是训练,本线是结构

收束

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
会说话 = 形成一套实时运行的闭环:
意图 → 语言组织 → 发音动作 → 声音 → 反馈 → 修正

十阶段:
发声控制 → 声音模仿 → 音系建立 → 声音—动作映射 → 词汇建立
→ 组块 → 句法生成 → 实时生成 → 自我监控 → 互动生成

四套内部模型:意义 / 语言 / 发音 / 运动(互相连接、形成闭环)

阶段 ≠ 能力获得流程 ≠ 训练流程:
阶段回答「要获得哪些能力」
获得流程回答「一个能力怎么长出来」
训练流程只是制造让能力形成机制运行的环境

关键机制:
直接通路(概念→声音,不经过中介语言)
组块化(解决工作记忆容量)
实时生成 + 自我监控 + 互动(流利度与适应性)

「会说话」真正形成的过程,是四套内部模型(意义/语言/发音/运动)在反馈闭环中逐渐建立连接——不是背单词,而是建立从意图到声音的可执行映射。