认知能力分解——「听懂」是结果不是阶段,能力如何逐层形成

一句话

「听懂」看起来是一瞬间,拆开是一串能力的成功运行——它是这串能力运行成功后的状态,不能当成一个可以单独训练的动作。能力分解要区分三个维度:能力是什么、能力如何形成、如何组织成课程。

主题 01(认知语言智能)只取了这条线的结论(语言理解、习得、Skill 沉淀);本线(02)展开完整推导:从听觉理解能力的逐层拆分,到能力获得的基本机制,再到三大能力 Skill 的诞生。


一、听觉理解能力的完整拆分

把一个最终结果「听懂」沿着信息被识别、组合、解析、理解的方向逐层拆开——一条从声音 → 语言结构 → 意义的流水链:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
声音

语音

音素

音素序列

词边界



多个词

意群

句法结构

词义

组合语义

句子意义

上下文关系

语篇意义

说话者意图

听懂

四个层级

声音识别层(先把连续声音分辨出来):

  1. 听见声音——把语音和环境噪声区分开
  2. 识别音素——辨认 /p/、/b/、/æ/ 等基本语音单位(还没有「词」的概念)
  3. 适应音素的变化——同一个音素由不同人/音高/语速/口音说出,连读、弱读、同化导致声音变化

声音 → 稳定的音素类别

词汇识别层(从音素连续体中识别词):

  1. 识别音素序列(k æ t → 一个连续的语音模式)
  2. 识别词边界(Iwanttogotothemarket → I / want / to / go / to / the / market)
  3. 识别词(音素组合映射到词:k æ t → cat
  4. 适应不同人的词语发音(同一个 cat,不同人/口音/快慢/连读,最终归一到同一个词)

音素 → 音素序列 → 词边界 → 词

句法/结构识别层(从多个词变成结构):

  1. 连续识别多个词
  2. 识别意群(把连续词切成有结构的单位:I went to the store / yesterday)
  3. 识别句子成分(谁、做什么、对什么做、什么时间/地点/方式/原因,以及条件、转折、因果)

这时已经从「听到词」进入了「听到结构」

语义解析层 + 语篇理解层(从结构得到意思,真正「听懂」):

  1. 词义激活(book 激活「书」的概念)
  2. 组合词义(buy + book → 买书)
  3. 组合句义(John bought a book → 一个事件)
  4. 识别上下文中的指代和省略(He → John、it → book)
  5. 结合上下文消歧(I saw a bat → 蝙蝠还是球棒)
  6. 建立当前语境
  7. 建立前后关系(因果、时间顺序、转折、条件、对比)
  8. 建立说话者意图(It’s cold in here → 暗示请关窗)
  9. 形成整体意义——不再逐词翻译,直接形成「他说了什么、发生了什么、他想表达什么」

两个维度:纵向阶段 × 横向变化

「不同人、不同时间」是横向变化维度,不是纵向阶段:

1
2
3
4
5
                    不同人

声音 → 音素 → 词 → 意群 → 句子 → 语篇 → 意图
↑ ↑ ↑ ↑ ↑ ↑
不同时间 / 语速 / 音高 / 口音 / 连读 / 弱读 / 噪声
  • 纵向:信息从声音到意义经过哪些层级
  • 横向:每一个层级都要面对哪些变化条件

听清 ≠ 听懂

听清主要是语音信息的正确识别,听懂则是在此基础上完成结构和意义的构建。 一个人可能词都听清了,却仍然没有听懂句子的意思。


二、能力获得:三种分析的分开

把三个本来分散的东西接起来:

  1. 语言学:语言输入本身由哪些结构组成
  2. 认知心理学/认知科学:人脑如何从输入逐步形成识别、表征和理解
  3. 教育/训练学:这些能力分别通过什么活动获得、自动化、迁移

关键点:「阶段」与「获得能力的过程」还不是一回事。

四层不同的问题

1
能力是什么 → 能力如何形成 → 如何组织成课程 → 如何执行课程
  • 能力拆分:问「听懂里面包含哪些能力?」
  • 能力获得:问「人是怎么获得识别 /æ/ 这个能力的?」——不是再拆语言,而是分析:接触声音 → 注意声音差异 → 建立类别 → 声音与类别对应 → 多样样本重复 → 错误得到反馈 → 类别边界稳定 → 自动识别
  • 组织与执行:问「我应该怎么安排课程?」

每个能力的获得都有共同机制

1
2
输入 → 注意 → 区分差异 → 建立表征 → 建立映射 → 组合
→ 反馈/纠错 → 重复变式 → 自动化 → 迁移

但不同能力,输入的对象不同、建立的表征不同、组合关系不同。

音素识别能力怎么形成

目标不是「知道 /p/ 是什么」,而是能够把大量不同的实际声音归入同一个 /p/ 类别。如果只训练一个人的 p p p p,获得的可能只是这个人的这个声音模式,而不是 /p/ 这个抽象类别——所以能力获得必须经过变式

从音素到词:自动化

熟练者听到 computer 并不会逐音素分析,而是直接识别出这个词——这就是自动化

词汇能力 ≠ 听觉词汇识别能力 ≠ 意群识别能力

它们应该分开。从词到意群获得的是「把连续语言输入自动组织成较大单位的能力」;从意群到句子获得的是「结构建模能力」(熟练者听到 “The man who…” 已经会预测后面大概率还在描述这个 man——语言理解开始出现预测机制)。

认识所有单词并不等于听懂句子

The dog chased the cat. 不是 dog=狗、chased=追、cat=猫 然后机械相加,而是形成事件结构:狗执行追,对象是猫。词汇 + 句法结构 → 事件结构 → 意义。


三、思考与联系能力:认知模型

前面那套「说话能力」主要解决「把已有意图编码成语言并说出来」。距离真正的人类语言能力还差一个巨大的系统:思考、概念形成、关系建立、推理、规划、想象、抽象、反思。

语言不是思考本身

语言会成为思考的重要外部化和内部操作工具,但可以有一个层级:

1
感知 → 形成简单需求 → 产生简单意图 → 选择一个已有信号 → 表达

(黑猩猩水平)vs 人类的「如果明天下雨,我就不去那里,因为路会很滑」——已经出现对象、时间、条件、因果、假设、未来、否定、计划。

认知模型的能力链

1
2
感知 → 对象 → 概念 → 关系 → 状态 → 事件 → 因果 → 时间 → 空间
→ 可能性 → 目标 → 计划 → 推理 → 决策

思考能力可以拆成 17 步

1
2
3
① 感知 → ② 对象化 → ③ 概念化 → ④ 分类 → ⑤ 建立关系 → ⑥ 建立状态
→ ⑦ 建立事件 → ⑧ 时间/空间关系 → ⑨ 因果模型 → ⑩ 预测 → ⑪ 目标
→ ⑫ 规划行动 → ⑬ 推理 → ⑭ 假设/反事实 → ⑮ 评价 → ⑯ 决策 → ⑰ 反思

语言是在这个系统上面增加了一层「符号操作」

脑中已经有「雨、地面湿、带伞」,语言可以把它编码为 “It is raining, so the ground will get wet.”。语言就不只是表达,它开始成为操作内部模型的工具——比较两个概念、暂存复杂关系、分解问题、提出假设、反事实推理、记录计划、检查自己的推理、共享模型。

真正的人类语言能力不是「能把想法说出来」,而是「能用语言参与构建、操作、检查和共享思维模型」。

三个相互连接的系统

1
2
3
① 世界建模:世界 → 感知 → 对象 → 概念 → 关系 → 事件 → 因果 → 预测
② 思维/行动:当前状态 → 目标 → 可能方案 → 预测结果 → 比较 → 选择 → 行动 → 结果 → 更新模型
③ 语言:内部模型 → 语言组织 → 声音 → 他人 → 他人的语言 → 更新自己的模型

语言和思维不能简单画成谁先谁后

一个小孩可以「想吃东西」然后「伸手」——没有语言也可以存在基本意图和思维。但语言出现以后,思维空间突然扩大:语言让他能够操作过去、未来、假设、否定、因果、条件、层级、抽象概念、复杂关系。语言不是从零创造思维,但它可以极大地扩展思维的表示空间和操作能力。

能力获得体系应该分成两条线

1
2
3
语言能力:听 → 声音类别 → 词 → 组块 → 句法 → 语义 → 表达 → 互动
认知能力:感知 → 对象 → 概念 → 分类 → 关系 → 状态 → 事件 → 因果 → 预测
→ 目标 → 规划 → 推理 → 反事实 → 评价 → 决策 → 反思

然后两者不断互相强化:世界经验 → 认知模型 ↔ 语言 ↔ 思考 → 行动 → 新的世界经验。

这才是从「会说几句话」走到「真正会思考、会联系、会表达复杂思想」的完整能力体系。 仅仅把语言输入→语言输出训练得很好,确实可能得到一个非常强的「语言行为系统」,但它不自动产生完整的人类式认知。真正的上限取决于它背后的世界模型、概念系统、关系建模、推理和行动反馈闭环。


四、意识、记忆与主体模型

比语言能力和思维能力更底层的问题:一个系统为什么会形成一个「我」,并且这个「我」能够持续地存在、积累经历、评价环境、更新自己。

记忆 ≠ 存储全部输入

记忆不是硬盘(输入什么→保存什么),更像一个不断重构的内部模型:经历 → 当前状态改变 → 部分信息留下 → 重新组织 → 与已有记忆连接 → 压缩/抽象 → 以后被重新调用 → 再次被经历修改。

一次「摔倒→疼」的经历已经变成了预测模型的一部分。记忆不是仓库,而是正在演化的知识网络/模型。

「存什么」本身就是系统判断出来的

1
2
3
4
5
6
7
8
9
输入 → 评价
├── 无关 → 很快消退
├── 熟悉 → 不需要重新编码
├── 新奇 → 高度关注
├── 有用 → 保留
├── 有威胁 → 强烈保留
├── 有奖励 → 强化
├── 与已有模型冲突 → 更新模型
└── 对未来有预测价值 → 保留

记忆形成与判断、注意、情绪、预测其实是耦合的。 惊讶的东西往往更容易成为需要学习的信息。

这就引出了「自主」

如果只有感知→识别→预测→行动,仍然像一个自动机器。真正更接近「主体」的东西是:这个系统不仅预测环境,还会判断「这个环境对我意味着什么」——出现了一个特殊的变量:

1
2
环境发生变化 → 对系统有什么影响?是否有利?是否有害?是否相关?
是否需要行动?是否值得记住?

这里已经不是单纯的「环境是什么?」,而是「环境对我是什么?」。

需要增加一个「主体模型」

1
2
我是谁 / 我在哪里 / 我能做什么 / 我正在做什么 / 我想做什么
我现在处于什么状态 / 过去发生过什么 / 未来可能发生什么

世界模型描述世界,主体模型描述「我」在世界中的位置、状态和意图——两者配合才是完整的认知系统。


五、认知与语言的匹配扩展

两套地图之间的映射

1
现实世界 → 你的认知模型 ↔ 语言模型 → 语言表达 → 他人

早期:认知范围很大,语言范围很小,所以大量东西「我知道,但说不出来」。随着发展两者都扩大,最终共同增长——语言又反过来帮助认知(语言 → 分类 → 概念 → 关系 → 新的思考)。

扩展的五条线

1
2
3
4
5
体验 → 扩大认知模型(没有经历,你甚至不知道自己不知道什么)
交流 → 暴露认知与表达的缺口(别人能不能理解你)
语言输入 → 获得别人已经形成的认知结构(共享认知模型)
思考 → 把零散经历融合起来(比较→共同点→差异→因果→抽象→模型)
表达 → 把模型外化(表达不是单纯输出知识,它本身就是一种认知检查)

这就是为什么「教别人」通常能发现自己哪里没懂。

培养真正有价值的部分

不是「老师给你知识」,而是:别人把自己的认知结构展示给你。 例如优秀的人面对「为什么这个程序会卡?」,他可能立即拆:输入 → 线程 → 锁 → 阻塞 → 等待 → 调度 → 资源竞争;而初学者只有「程序卡了」。差距不只是知识量,而是问题分解方式不同

「词不达意」可以拆成不同情况

1
2
3
4
5
6
① 没有概念            → 体验/学习
② 有概念,没有关系 → 思考/比较/分析
③ 有概念有关系,没有词 → 语言输入+词汇扩展
④ 有词,但没有结构 → 句法、组块、表达实践
⑤ 有结构,但说不清复杂关系 → 复杂表达+反复外化+反馈
⑥ 自己的模型本身就是错的 → 现实反馈/他人反馈/结果验证(最危险)

最终不是「语言追上认知」

更准确的终态:认知扩大语言的内容,语言又扩大认知的可操作空间。 成年人真正持续成长的时候,是「经历 → 思考 → 表达 → 交流 → 发现缺口 → 获取新信息 → 重构认知 → 形成更精确语言 → 再思考」。

这也解释了「掌握语言很多年以后,面对陌生事物,虽然不知道答案,却能清楚地感觉’这里缺了什么’」——这其实不是知道所有东西,而是已经形成了一个足够强的认知框架和元认知系统,它能够发现自己的模型边界。


六、第二语言的获得:概念—语言映射

不是一张词汇表,而是三层东西

1
现实/经验 → 概念与关系网络 ↔ 语言表达系统

「杯子」这个概念:中文叫杯子、英文叫 cup——两个词只是指向同一个概念的一种语言编码。但一个语言中的词可能是一个比较宽的概念,另一语言用两个词分别表示这个概念的两个部分。所以学习第二语言真正困难的不是「中文词→英文词」,而是建立:

英语形式 → 英语概念边界 → 英语使用关系,而不是永远经过第一语言。

第二语言早期为什么特别容易干扰

学英语时最方便的办法自然是 英语声音 → 英语单词 → 中文词 → 概念——英语实际上借用了中文系统。初期非常有效,但中文和英语的概念边界、词义范围、搭配关系、句法结构并不完全相同,于是 English → Chinese → Concept 和真正需要建立的 English → Concept 之间发生竞争。

第二语言真正成熟的标志:脱离第一语言中介

1
2
3
初期:apple → 苹果 → 🍎
后来:apple → 🍎
再后来:apple → 一整个概念网络(fruit/red/sweet/eat/tree/apple pie/bite an apple...)

这时候 apple 已经不是「苹果的英文」,而是英语系统中的一个节点

「失去语言」和「从未获得语言」是两件完全不同的事情

成年人突然失去已掌握的语言:世界模型、记忆、概念、经验都还在,只是从认知→原语言表达的通路暂时不可用——「我明明知道,但说不出来」,这不是认知消失。

但如果一个人从小就没有任何成熟语言,那就完全不同了——语言不仅负责表达已经存在的概念,它还参与概念的分类、稳定、组合、共享和进一步发展。长期缺少语言环境,很多高级概念、关系、抽象结构本身就很难充分形成。

第二语言真正的终点

不是「词汇量大」,而是两个语言系统之间存在转换能力,但不必每次经过中文概念中介。真正熟练的双语者会觉得:「我不是把中文翻译成英语,我就是用英语在想/表达。」

输入方向建立「外语→概念/模型」,输出方向建立「概念→外语」,两个方向的映射都要直接、不需要经过第一语言。


七、阅读理解能力的完整推导

把「语音识别→语义识别」的后半部分拿掉声音通道,换成视觉文字输入→阅读理解,就可以重新推导出一套完整的能力形成链。

完整的阅读理解阶段

1
2
3
4
5
① 区分文字 → ② 识别字符 → ③ 识别词形/词边界 → ④ 词汇识别
→ ⑤ 激活词义/概念 → ⑥ 句法结构识别 → ⑦ 句内语义关系
→ ⑧ 形成事件/状态模型 → ⑨ 跨句建立指代和关系 → ⑩ 建立篇章模型
→ ⑪ 调用背景知识 → ⑫ 推断隐含信息 → ⑬ 理解作者意图/论证
→ ⑭ 与自己的认知模型连接 → ⑮ 形成新的理解、判断和推理

它和「听懂」可以完全对应起来

1
2
听:声音 → 区分语言 → 音素 → 音节 → 词 → 意群 → 句子 → 篇章 → 语义 → 世界模型
读:视觉 → 区分文字 → 字符 → 词形 → 词 → 短语/意群 → 句子 → 篇章 → 语义 → 世界模型

真正的共同终点都是:输入 → 构建内部意义模型。 区别主要在最底层的输入编码方式。

字面语义之后的认知层

阅读理解在「字面语义」之后还要继续往上推导:

1
2
3
4
识别关系 → 时间与状态变化 → 因果链(其中有些是文章明确说的,有些是背景知识补出来的)
→ 条件逻辑/充要条件 → 因果≠相关 → 论点论据/隐藏前提
→ 反事实/概率/不确定性 → 观点/事实/推测/作者立场
→ 反驳与论证结构 → 抽象模型 → 把文本模型纳入自己的认知模型

关键的结论:后面的「逻辑、因果、推理」并不是阅读理解之外突然增加的东西,它们是从「多个概念之间是什么关系」自然递归发展出来的:

1
2
3
4
5
6
7
A 是什么?
→ A 和 B 什么关系?
→ A 为什么导致 B?
→ 如果 A 不成立呢?
→ B 这个结论凭什么成立?
→ 作者为什么认为 B?
→ 这个模型和我原来的模型有什么关系?

这条链,就是从「认字」一路走到「真正读懂并思考」的过程。


八、三大能力 Skill 的诞生

整套内容可以压缩成三个相互正交的 Skill:

  • Language Skill:语言怎么编码和组织
  • Semantic & Cognitive Understanding Skill:语言表达什么概念、关系和模型
  • Reasoning Skill:基于这些模型能推出什么、应该怎么做

但一体化更好

如果目标是给一个 Agent 直接使用,把三个拆成三个独立 Skill 反而增加了调度成本。因为实际任务往往是:

1
2
看到/收到语言 → 识别语言结构 → 理解概念和关系 → 建立当前情境模型
→ 推理 → 形成意图/结论 → 组织语言 → 输出

这不是三个彼此独立的任务,而是一个连续的语言—理解—思考—表达循环。所以更合理的是做一个大的 Language-Cognition-Reasoning Skill,内部再划分三个阶段,但 Agent 不需要自己决定「现在调用 Language 还是 Semantic 还是 Reasoning」

1
2
3
4
5
6
7
8
9
10
11
12
# 语言-认知-推理 Skill

## 角色
你是一个一体化的语言、语义理解与推理系统。
你的任务是把语言和上下文转换为内部情境模型,
在该模型上进行必要的思考与推理,
形成回答、结论、计划或行动,
再将结果转换为适合当前情境的自然语言。

内部主要执行:
语言处理 → 语义解释 → 情境建模 → 推理 → 回答/行动 → 语言生成
除非用户明确要求,不向用户展示这些内部阶段。

这正是本知识体系里「认知式写作」「语言-认知-推理」两份操作规约的来源——能力分解的完整推导沉淀成了可执行的操作流程。


与其他线的关系

  • 与同主题 01 认知语言智能:01 是这条线的浓缩结论(听懂是结果、语言习得、语言是约束不是坐标、Skill 沉淀);本线展开完整推导(能力拆分层级、能力获得机制、认知模型 17 步、阅读理解 15 阶段)
  • 与图像生成的领域模型线:两条线共享「高层语义 → 领域模型 → 执行器」结构——图像线讲图片世界,本线讲语言/意义世界
  • 与建模与逆向主题:能力分解(听懂 → 逐层拆开)就是正向建模的实例;阅读理解(文章 → 模型)就是逆向应用的实例