02-认知能力分解
认知能力分解——「听懂」是结果不是阶段,能力如何逐层形成
一句话
「听懂」看起来是一瞬间,拆开是一串能力的成功运行——它是这串能力运行成功后的状态,不能当成一个可以单独训练的动作。能力分解要区分三个维度:能力是什么、能力如何形成、如何组织成课程。
主题 01(认知语言智能)只取了这条线的结论(语言理解、习得、Skill 沉淀);本线(02)展开完整推导:从听觉理解能力的逐层拆分,到能力获得的基本机制,再到三大能力 Skill 的诞生。
一、听觉理解能力的完整拆分
把一个最终结果「听懂」沿着信息被识别、组合、解析、理解的方向逐层拆开——一条从声音 → 语言结构 → 意义的流水链:
1 | 声音 |
四个层级
声音识别层(先把连续声音分辨出来):
- 听见声音——把语音和环境噪声区分开
- 识别音素——辨认 /p/、/b/、/æ/ 等基本语音单位(还没有「词」的概念)
- 适应音素的变化——同一个音素由不同人/音高/语速/口音说出,连读、弱读、同化导致声音变化
声音 → 稳定的音素类别
词汇识别层(从音素连续体中识别词):
- 识别音素序列(
k æ t→ 一个连续的语音模式) - 识别词边界(
Iwanttogotothemarket→ I / want / to / go / to / the / market) - 识别词(音素组合映射到词:
k æ t → cat) - 适应不同人的词语发音(同一个 cat,不同人/口音/快慢/连读,最终归一到同一个词)
音素 → 音素序列 → 词边界 → 词
句法/结构识别层(从多个词变成结构):
- 连续识别多个词
- 识别意群(把连续词切成有结构的单位:I went to the store / yesterday)
- 识别句子成分(谁、做什么、对什么做、什么时间/地点/方式/原因,以及条件、转折、因果)
这时已经从「听到词」进入了「听到结构」
语义解析层 + 语篇理解层(从结构得到意思,真正「听懂」):
- 词义激活(book 激活「书」的概念)
- 组合词义(buy + book → 买书)
- 组合句义(John bought a book → 一个事件)
- 识别上下文中的指代和省略(He → John、it → book)
- 结合上下文消歧(I saw a bat → 蝙蝠还是球棒)
- 建立当前语境
- 建立前后关系(因果、时间顺序、转折、条件、对比)
- 建立说话者意图(It’s cold in here → 暗示请关窗)
- 形成整体意义——不再逐词翻译,直接形成「他说了什么、发生了什么、他想表达什么」
两个维度:纵向阶段 × 横向变化
「不同人、不同时间」是横向变化维度,不是纵向阶段:
1 | 不同人 |
- 纵向:信息从声音到意义经过哪些层级
- 横向:每一个层级都要面对哪些变化条件
听清 ≠ 听懂
听清主要是语音信息的正确识别,听懂则是在此基础上完成结构和意义的构建。 一个人可能词都听清了,却仍然没有听懂句子的意思。
二、能力获得:三种分析的分开
把三个本来分散的东西接起来:
- 语言学:语言输入本身由哪些结构组成
- 认知心理学/认知科学:人脑如何从输入逐步形成识别、表征和理解
- 教育/训练学:这些能力分别通过什么活动获得、自动化、迁移
关键点:「阶段」与「获得能力的过程」还不是一回事。
四层不同的问题
1 | 能力是什么 → 能力如何形成 → 如何组织成课程 → 如何执行课程 |
- 能力拆分:问「听懂里面包含哪些能力?」
- 能力获得:问「人是怎么获得识别 /æ/ 这个能力的?」——不是再拆语言,而是分析:接触声音 → 注意声音差异 → 建立类别 → 声音与类别对应 → 多样样本重复 → 错误得到反馈 → 类别边界稳定 → 自动识别
- 组织与执行:问「我应该怎么安排课程?」
每个能力的获得都有共同机制
1 | 输入 → 注意 → 区分差异 → 建立表征 → 建立映射 → 组合 |
但不同能力,输入的对象不同、建立的表征不同、组合关系不同。
音素识别能力怎么形成
目标不是「知道 /p/ 是什么」,而是能够把大量不同的实际声音归入同一个 /p/ 类别。如果只训练一个人的 p p p p,获得的可能只是这个人的这个声音模式,而不是 /p/ 这个抽象类别——所以能力获得必须经过变式。
从音素到词:自动化
熟练者听到 computer 并不会逐音素分析,而是直接识别出这个词——这就是自动化。
词汇能力 ≠ 听觉词汇识别能力 ≠ 意群识别能力
它们应该分开。从词到意群获得的是「把连续语言输入自动组织成较大单位的能力」;从意群到句子获得的是「结构建模能力」(熟练者听到 “The man who…” 已经会预测后面大概率还在描述这个 man——语言理解开始出现预测机制)。
认识所有单词并不等于听懂句子
The dog chased the cat. 不是 dog=狗、chased=追、cat=猫 然后机械相加,而是形成事件结构:狗执行追,对象是猫。词汇 + 句法结构 → 事件结构 → 意义。
三、思考与联系能力:认知模型
前面那套「说话能力」主要解决「把已有意图编码成语言并说出来」。距离真正的人类语言能力还差一个巨大的系统:思考、概念形成、关系建立、推理、规划、想象、抽象、反思。
语言不是思考本身
语言会成为思考的重要外部化和内部操作工具,但可以有一个层级:
1 | 感知 → 形成简单需求 → 产生简单意图 → 选择一个已有信号 → 表达 |
(黑猩猩水平)vs 人类的「如果明天下雨,我就不去那里,因为路会很滑」——已经出现对象、时间、条件、因果、假设、未来、否定、计划。
认知模型的能力链
1 | 感知 → 对象 → 概念 → 关系 → 状态 → 事件 → 因果 → 时间 → 空间 |
思考能力可以拆成 17 步
1 | ① 感知 → ② 对象化 → ③ 概念化 → ④ 分类 → ⑤ 建立关系 → ⑥ 建立状态 |
语言是在这个系统上面增加了一层「符号操作」
脑中已经有「雨、地面湿、带伞」,语言可以把它编码为 “It is raining, so the ground will get wet.”。语言就不只是表达,它开始成为操作内部模型的工具——比较两个概念、暂存复杂关系、分解问题、提出假设、反事实推理、记录计划、检查自己的推理、共享模型。
真正的人类语言能力不是「能把想法说出来」,而是「能用语言参与构建、操作、检查和共享思维模型」。
三个相互连接的系统
1 | ① 世界建模:世界 → 感知 → 对象 → 概念 → 关系 → 事件 → 因果 → 预测 |
语言和思维不能简单画成谁先谁后
一个小孩可以「想吃东西」然后「伸手」——没有语言也可以存在基本意图和思维。但语言出现以后,思维空间突然扩大:语言让他能够操作过去、未来、假设、否定、因果、条件、层级、抽象概念、复杂关系。语言不是从零创造思维,但它可以极大地扩展思维的表示空间和操作能力。
能力获得体系应该分成两条线
1 | 语言能力:听 → 声音类别 → 词 → 组块 → 句法 → 语义 → 表达 → 互动 |
然后两者不断互相强化:世界经验 → 认知模型 ↔ 语言 ↔ 思考 → 行动 → 新的世界经验。
这才是从「会说几句话」走到「真正会思考、会联系、会表达复杂思想」的完整能力体系。 仅仅把语言输入→语言输出训练得很好,确实可能得到一个非常强的「语言行为系统」,但它不自动产生完整的人类式认知。真正的上限取决于它背后的世界模型、概念系统、关系建模、推理和行动反馈闭环。
四、意识、记忆与主体模型
比语言能力和思维能力更底层的问题:一个系统为什么会形成一个「我」,并且这个「我」能够持续地存在、积累经历、评价环境、更新自己。
记忆 ≠ 存储全部输入
记忆不是硬盘(输入什么→保存什么),更像一个不断重构的内部模型:经历 → 当前状态改变 → 部分信息留下 → 重新组织 → 与已有记忆连接 → 压缩/抽象 → 以后被重新调用 → 再次被经历修改。
一次「摔倒→疼」的经历已经变成了预测模型的一部分。记忆不是仓库,而是正在演化的知识网络/模型。
「存什么」本身就是系统判断出来的
1 | 输入 → 评价 |
记忆形成与判断、注意、情绪、预测其实是耦合的。 惊讶的东西往往更容易成为需要学习的信息。
这就引出了「自主」
如果只有感知→识别→预测→行动,仍然像一个自动机器。真正更接近「主体」的东西是:这个系统不仅预测环境,还会判断「这个环境对我意味着什么」——出现了一个特殊的变量:我。
1 | 环境发生变化 → 对系统有什么影响?是否有利?是否有害?是否相关? |
这里已经不是单纯的「环境是什么?」,而是「环境对我是什么?」。
需要增加一个「主体模型」
1 | 我是谁 / 我在哪里 / 我能做什么 / 我正在做什么 / 我想做什么 |
世界模型描述世界,主体模型描述「我」在世界中的位置、状态和意图——两者配合才是完整的认知系统。
五、认知与语言的匹配扩展
两套地图之间的映射
1 | 现实世界 → 你的认知模型 ↔ 语言模型 → 语言表达 → 他人 |
早期:认知范围很大,语言范围很小,所以大量东西「我知道,但说不出来」。随着发展两者都扩大,最终共同增长——语言又反过来帮助认知(语言 → 分类 → 概念 → 关系 → 新的思考)。
扩展的五条线
1 | 体验 → 扩大认知模型(没有经历,你甚至不知道自己不知道什么) |
这就是为什么「教别人」通常能发现自己哪里没懂。
培养真正有价值的部分
不是「老师给你知识」,而是:别人把自己的认知结构展示给你。 例如优秀的人面对「为什么这个程序会卡?」,他可能立即拆:输入 → 线程 → 锁 → 阻塞 → 等待 → 调度 → 资源竞争;而初学者只有「程序卡了」。差距不只是知识量,而是问题分解方式不同。
「词不达意」可以拆成不同情况
1 | ① 没有概念 → 体验/学习 |
最终不是「语言追上认知」
更准确的终态:认知扩大语言的内容,语言又扩大认知的可操作空间。 成年人真正持续成长的时候,是「经历 → 思考 → 表达 → 交流 → 发现缺口 → 获取新信息 → 重构认知 → 形成更精确语言 → 再思考」。
这也解释了「掌握语言很多年以后,面对陌生事物,虽然不知道答案,却能清楚地感觉’这里缺了什么’」——这其实不是知道所有东西,而是已经形成了一个足够强的认知框架和元认知系统,它能够发现自己的模型边界。
六、第二语言的获得:概念—语言映射
不是一张词汇表,而是三层东西
1 | 现实/经验 → 概念与关系网络 ↔ 语言表达系统 |
「杯子」这个概念:中文叫杯子、英文叫 cup——两个词只是指向同一个概念的一种语言编码。但一个语言中的词可能是一个比较宽的概念,另一语言用两个词分别表示这个概念的两个部分。所以学习第二语言真正困难的不是「中文词→英文词」,而是建立:
英语形式 → 英语概念边界 → 英语使用关系,而不是永远经过第一语言。
第二语言早期为什么特别容易干扰
学英语时最方便的办法自然是 英语声音 → 英语单词 → 中文词 → 概念——英语实际上借用了中文系统。初期非常有效,但中文和英语的概念边界、词义范围、搭配关系、句法结构并不完全相同,于是 English → Chinese → Concept 和真正需要建立的 English → Concept 之间发生竞争。
第二语言真正成熟的标志:脱离第一语言中介
1 | 初期:apple → 苹果 → 🍎 |
这时候 apple 已经不是「苹果的英文」,而是英语系统中的一个节点。
「失去语言」和「从未获得语言」是两件完全不同的事情
成年人突然失去已掌握的语言:世界模型、记忆、概念、经验都还在,只是从认知→原语言表达的通路暂时不可用——「我明明知道,但说不出来」,这不是认知消失。
但如果一个人从小就没有任何成熟语言,那就完全不同了——语言不仅负责表达已经存在的概念,它还参与概念的分类、稳定、组合、共享和进一步发展。长期缺少语言环境,很多高级概念、关系、抽象结构本身就很难充分形成。
第二语言真正的终点
不是「词汇量大」,而是两个语言系统之间存在转换能力,但不必每次经过中文概念中介。真正熟练的双语者会觉得:「我不是把中文翻译成英语,我就是用英语在想/表达。」
输入方向建立「外语→概念/模型」,输出方向建立「概念→外语」,两个方向的映射都要直接、不需要经过第一语言。
七、阅读理解能力的完整推导
把「语音识别→语义识别」的后半部分拿掉声音通道,换成视觉文字输入→阅读理解,就可以重新推导出一套完整的能力形成链。
完整的阅读理解阶段
1 | ① 区分文字 → ② 识别字符 → ③ 识别词形/词边界 → ④ 词汇识别 |
它和「听懂」可以完全对应起来
1 | 听:声音 → 区分语言 → 音素 → 音节 → 词 → 意群 → 句子 → 篇章 → 语义 → 世界模型 |
真正的共同终点都是:输入 → 构建内部意义模型。 区别主要在最底层的输入编码方式。
字面语义之后的认知层
阅读理解在「字面语义」之后还要继续往上推导:
1 | 识别关系 → 时间与状态变化 → 因果链(其中有些是文章明确说的,有些是背景知识补出来的) |
关键的结论:后面的「逻辑、因果、推理」并不是阅读理解之外突然增加的东西,它们是从「多个概念之间是什么关系」自然递归发展出来的:
1 | A 是什么? |
这条链,就是从「认字」一路走到「真正读懂并思考」的过程。
八、三大能力 Skill 的诞生
整套内容可以压缩成三个相互正交的 Skill:
- Language Skill:语言怎么编码和组织
- Semantic & Cognitive Understanding Skill:语言表达什么概念、关系和模型
- Reasoning Skill:基于这些模型能推出什么、应该怎么做
但一体化更好
如果目标是给一个 Agent 直接使用,把三个拆成三个独立 Skill 反而增加了调度成本。因为实际任务往往是:
1 | 看到/收到语言 → 识别语言结构 → 理解概念和关系 → 建立当前情境模型 |
这不是三个彼此独立的任务,而是一个连续的语言—理解—思考—表达循环。所以更合理的是做一个大的 Language-Cognition-Reasoning Skill,内部再划分三个阶段,但 Agent 不需要自己决定「现在调用 Language 还是 Semantic 还是 Reasoning」。
1 | # 语言-认知-推理 Skill |
这正是本知识体系里「认知式写作」「语言-认知-推理」两份操作规约的来源——能力分解的完整推导沉淀成了可执行的操作流程。
与其他线的关系
- 与同主题 01 认知语言智能:01 是这条线的浓缩结论(听懂是结果、语言习得、语言是约束不是坐标、Skill 沉淀);本线展开完整推导(能力拆分层级、能力获得机制、认知模型 17 步、阅读理解 15 阶段)
- 与图像生成的领域模型线:两条线共享「高层语义 → 领域模型 → 执行器」结构——图像线讲图片世界,本线讲语言/意义世界
- 与建模与逆向主题:能力分解(听懂 → 逐层拆开)就是正向建模的实例;阅读理解(文章 → 模型)就是逆向应用的实例
