在数字世界里,一切数据、算法、模型与交互,最终都以「文字」为入口:语料的载体是文字,指令的载体是文字,人机对话的入口仍是文字。谁定义了文字的数字存在方式,谁就握住了数字文明的底层开关。汉字是当今世界使用人口最多的文字,却在数字存在方式上长期依赖外部方案——拼音转写、他国输入法内核、域外字符集规范。这带来三重失衡:输入效率受制、编码主权旁落、汉字自身价值在数字链条中被稀释。
一种文字真正的危机,不是无人使用,而是使用者不必再理解它。「提笔忘字」之所以成为集体症候,正因为文字在数字链条中从「意义与形体的统一体」退化为「拼音的输入手段」——会读不会写、会打不识形。当文字只剩声音通道,它的人文厚度与形体智慧就同时被截断。
COS 的判断是:要救的不是人们的记忆力,而是文字在数字世界里的存在方式。当每一个汉字都能被「看形取码」直接键入、每一个码都能还原字形,文字便重新成为「可理解、可计算、可继承」的对象,而不再只是语音的附庸。
COS 的选择是回到文字的形体本身:把汉字拆解为**可数的部件**,把部件映射为**正负数码**,再把数码组织为**可计算的数制**。由此获得三个直接结果——
本白皮书描述的所有技术能力,都从一个立场出发:为人类服务。它不是为一国一族的文字优越性,而是让每一种语言、每一个文明在数字时代都能被平等地书写、平等地检索、平等地传承;让信息在量子时代依然安全;让所有人学习文字的时间与成本显著下降。
COS 以 26 个码位覆盖汉字全部形体要素,与标准键盘一一对应——
| 码位类别 | 数量 | 内容 | 键位映射 |
|---|---|---|---|
| 正码 | 10 | 0 1 2 3 4 5 6 7 8 9 | 第二排 A–L + M(M=0) |
| 负码 | 10 | ⁻0 ⁻1 ⁻2 ⁻3 ⁻4 ⁻5 ⁻6 ⁻7 ⁻8 ⁻9 | 第一排 Q–P(负号在数字头顶) |
| 字母码 | 6 | Z 言(讠) / X 木 / C 土(士) / V 补充码 / B 日 / N 金(钅) | 第三排 Z X C V B N |
汉字的取码单位是部件:98 组「正负一码部件」= 85 个单数部首 + 13 个补充形码部件。每个部件对应唯一一枚码片,因此「看字形 → 拆部件 → 取码片」全程不需要读音参与,也不需要记忆字根表以外的拼音规则。
当不同汉字取到同一串数码时,采用补充码 V 补位区分(例如「八=8」与「人=8V」);常用长字的数码可放宽到 5 位,以保证高频字仍然直观可记。词组则按 3.3 取码规则(两字各取首码、三字各取首码、四字及以上取前三字首码+末字首码)形成最短可识别整数码。
字库并非静态清单,而是一条可扩展、可回归验证的生产线:单字字表 → 编码管线(部件解析、码位仲裁、重码补位)→ 字库与码位表 → 页面内嵌 → 线上运行。管线内置三重保障:
以新华字典与中文词典为标尺,字库的覆盖情况如下:
| 指标 | 实测值 | 说明 |
|---|---|---|
| 新华字典字条 | 16,142 | 字典收录汉字规模 |
| 中文词典词条 | 264,434 | 词组编码与查询的数据基础 |
| 字库直接有码 | 15,743 | 可直接键入并还原 |
| 可经繁简映射打出 | 355 | 由标准字码扩展 |
| 真正无码 | 44 | 多为域外异体/罕用字,持续补录中 |
覆盖率 ≈ 99.7%(可直接键入 + 繁简映射)。这一数字意味着:对日常书写、出版物用字与绝大多数文献用字,COS 已具备完整替代能力。
编码的价值在于「可解释」——同一个字,任何人按同一规则都能得到同一串数码。以下为实际字例(V 为补充码,⁻ 表示负码):
| 字 | 形体依据 | 数码 | 说明 |
|---|---|---|---|
| 八 | 单一部件 | 8 | 最简形态:一码成字 |
| 人 | 与「八」同码 | 8V | 以补充码 V 区分(重码补位) |
| 凸 | 同码竞争 | 0V | V 补位第二位 |
| 凹 | 同码竞争 | 0VV | V 补位第三位 |
| 森 | 木+木+木(木=X) | XXX | 三同部件:形与码完全一致 |
| 嗯 | 口+因(口=0) | 004⁻2V | 常用长字,补充码收尾 |
| 嘢 | 口+野(口=0) | 0051V | 方言常用字亦按同规则取码 |
| 絶 | 繁体「絶」= 简体「绝」形 | ⁻79V | 繁体与简体共享同一码基,以 V 区分 |
| 緑 | 繁体「緑」= 简体「绿」形 | ⁻7⁻3⁻1VV | 异体字按形体映射,兼容繁简 |
从表中可见三条规律:其一,同形同码——字形相同则数码相同;其二,繁简互通——繁体与简体共享码基,仅以补充码区分,因此同一份数码可跨字体还原;其三,可扩展——新字只需按同一部件规则取码,不改变任何既有字码。
用户在标准键盘上「看形取码」即可完成汉字输入:键位图与物理键盘一一对应,第一排为负码、第二排为正码、第三排为字母码。支持候选选择、词库联想、繁简切换、深色模式、语音播报与输入预览。全过程不依赖拼音——这对不熟悉汉语拼音的使用者、非母语学习者、以及需要在无读音环境中录入的场景,都是结构性的效率改变。
平台内置两部权威工具书的数字版:新华字典 16,142 字条与中文词典 264,434 词条,每条同时给出拼音、部首、笔画、释义与正负数码。查询支持按字、按词、按数码三向检索——这是传统字典做不到的一条通道:知道形,就能查到字;知道码,就能查到义。
长文闪送解决的是一件事:如何把一份内容安全地交给另一个人,而不让它停留在任何可被窥视的位置。当前版本的完整流程如下:
三个设计要点值得说明:
输入只是入口。围绕「学会、练熟、考核、坚持」四个环节,平台提供了配套闭环:
这套闭环的意义是:把「认字」拆成可测量的小步——看得懂(拆部件)→ 打得准(取码)→ 测得清(测评)→ 坚持得下去(排行榜与练习)。
平台的加密能力分为三档,覆盖从日常到高敏的不同需求:
| 通道 | 形态 | 适用与要点 |
|---|---|---|
| 蒸馏加密 | 12 码 | 中文加数码的常规档:密文是汉字按形蒸馏出的正负数码,无数学陷门可攻;普通用户与会员均可使用。 |
| 抗量子加密 | 24 码 + 先决条件核验 | 高敏档:发送方可设定姓名/虹膜/声纹/自主口令等多维度先决条件,提取方须逐项匹配;连续核验失败将自动销毁该项加密。 |
| 加密语音 | 音频字节数码化 | 录音后按字节转为正负数码密文入库,提取方在本页解密播放或下载音频文件,全程不落第三种格式。 |
机机密传面向指挥调度、应急系统、智能驾驶、高危物品管理等需要在机器之间直接、私密传递重要信息的场景。其机制要点:
对于「一对多」投递,平台支持向多台已确认接收机逐台定向加密投递,每台独立一次性会话密钥,各自自动解码。也可将机机密传内容导出为凭据文件交付,接收方拖入提取栏即在本机解密。
平台已按「编码层—存储层—密码层—架构层」四层纵深预置后量子能力,并规划与 NIST 后量子标准(ML-KEM/ML-DSA)的对接升级。需要强调的是:即便公钥算法被量子计算攻破,本体系的密文仍不以数学难题为唯一防线——一次性语义与提取即删的机制不因算力提升而失效。
中国红码是平台自有的码制(当前 v3 形态:37×37 垛口外圈 + 9 个 11×11 小码点,小码点各自随机旋转,保留隔离线以便稳定识别)。它承担两类工作:
把「安全」从技术承诺变成可查询、可赔付、可审计的制度安排,是 COS 在行业内的一项独特设计。数据安全保险已随加密功能上线运行。
用户中心「🛡 我的保单」提供完整的自助能力:
管理后台在「财务管理」之下设置「保单管理」,含两个视图:
| 视图 | 内容 | 用途 |
|---|---|---|
| 保单收入 | 保单总数、保金收入合计、逐单明细(保单号/归属用户/保金/状态) | 收入核对与对账 |
| 保单理赔 | 理赔笔数与合计、逐笔明细(保单号/金额/状态/时间)与赔付登记(单份上限 10 万元) | 理赔处理与风控 |
在用户侧的加密传输区,平台明确标注「丢失泄密赔 10 万」——把安全承诺写在用户看得到的地方。
因为安全不是一个技术形容词,而是一组可执行的义务:承诺要能被查询,责任要能被追溯,损失要能被赔付。保险机制把「我们很安全」翻译成「如果出事,我们按规则赔」——这是技术自信的制度化表达,也是让机构与个人敢于把重要内容交给这套通道的前提。
把保险写进产品流程,实质上是把「安全承诺」变成三项可验证的义务:
| 义务 | 落地方式 |
|---|---|
| 数据最小化 | 服务器仅存数码密文,提取即删、不可视、不缓存;平台不掌握明文内容。 |
| 责任可追溯 | 保单与提取数码一一绑定,承保、提取、结案、理赔各环节状态留痕,可查询、可导出对账。 |
| 赔付可执行 | 保额、保金、上限、结案口径均为明示规则;用户可自助发起理赔,平台按流程审核处理。 |
同时有必要明示边界,避免误读:① 保险按「一份加密文件一份保单」计算,单份保额上限 10 万元;② 保金按实名认证身份确定币种与标准;③ 保单在对方提取后 24 小时无投诉即自动结案,此后作为历史保单留存备查;④ 是否参与由用户自行选择,平台不强制。
平台提供 22 种界面语言一键切换,覆盖主要语区。更关键的一层在于:因为 COS 编码以字形为本、与读音解耦,汉字数码天然成为一种语言无关的中间表示——同一串数码,在不同的语言环境中可以对应不同的读音与释义,而字形与编码保持稳定。这为跨语言检索、跨语言教学与多语内容对齐提供了统一的数据底座。
围绕「汉字出海」,平台建立了覆盖 195 个国家与地区的授权体系:包括语言教学机构、出版与内容机构、硬件与系统集成商的合作框架,以及面向不同国家的语言研究与教学落地路径。
平台设立「华语贡献者」名录,致敬文字创制、统一与传播的先贤与专家,并向当代与在世的学者开放推荐与审核通道。当前名录共 139 位:
| 分类 | 人数 | 说明 |
|---|---|---|
| 远古文字 | 22 | 造字与文字整理的先贤 |
| 近代文字 | 35 | 近代文字改革与国语运动先驱 |
| 当代文字 | 31 | 当代文字学、语言学与信息安全领域的院士与专家 |
| 专家学者 | 51 | 推荐并审核通过的专家学者 |
| 其中:院士 18 / 学部委员 3 / 专家教授 59 | 为体系提供语言科学权威保障 | |
名录的展示规则公开透明:当代文字与专家学者两类按前一日查看数量排序,排名不分先后。每位贡献者拥有独立官网页,可由读者直接访问。
生态的可持续依赖清晰的权益与激励结构:
这套结构的取向是:让使用者得到实惠、让传播者得到回报、让合作方得到标准——生态因此不是单向推广,而是多方共建。
当文字成为数码,指令也可以成为数码。平台构建了两套面向开发者的体系:
| 体系 | 规模 | 作用 |
|---|---|---|
| DCIS(数码指令集) | 97 条编码 × 8 种语言 | 以数码为核心的指令表达,覆盖常用程序逻辑;8 种语言绑定便于跨语言实现与教学 |
| DCUL(数码接口层) | 37 个接口 | 为外部系统接入提供标准接口,使汉字数码能力可被调用、可被集成 |
其意义不在于替代现有编程语言,而在于提供一条以汉字/数码为原语的表达路径:让中文使用者可以用母语的字形与数序思维组织逻辑,也让教学场景可以用同一套符号贯通「识字—算术—编程」。
26 个码位不仅是一套输入法,也是一种数制:以 26 为基,正负对称,免进位负担。其实测指标如下:
这些数值来自实际换算与压力测试:在 100,007 例整数与 26 码位(数码片)互转中零误差;在可比较的语料与数据规模上,采用数码化表达后的存储与传输量出现数量级改善。需要说明的是,甲子六十进制与二进制彼此兼容而非互斥:它可以在现有计算体系之上运行,作为面向「文字—数码」场景的更高效表达层。
文字、算术与逻辑原本是三条学习路径,在 COS 中它们共用同一套符号:识字用码位、算术用数制、逻辑用指令集。对教育场景而言,这意味着学习者不必在三套彼此割裂的符号系统之间反复切换——学习成本显著下降,而迁移能力显著提高。
传统识字路径以读音为入口:先记音,再由音联想形与义。COS 提供了另一条路径——以形体为入口:看字形 → 拆部件 → 取数码 → 得字义。其价值在于三方面:
平台提出阶段性目标:进入教育体系后,全人类学习文字的时间平均减少 90%(远期愿景 99%)。为使这一目标可被检验,平台给出三条验证路径与一组量化指标:
| 验证路径 | 方法 | 观测指标 |
|---|---|---|
| 试点前后测 | 同一批学习者在同一课程标准下,采用 COS 路径前后各进行一次测评 | 达标用时、单位时间识字量、留存率 |
| 机构数据对照 | 与教学机构合作,在平行班之间进行路径对照 | 课堂学时、作业正确率、教师工作量 |
| 等级测评对照 | 以 HSK 1–6 级为标尺,比较达到同一等级所需训练时长 | 等级通过率、等级用时 |
平台向语言学研究机构提出「共建五请」:标准研究、联合教学实验、学术论证、数据开放、人才培养。可交付成果包括:字库与码表、测评题库、标准建议稿,以及与教学机构共研的实验数据。
下表汇总本白皮书涉及的核心实测指标,供评估与验收对照。
| 类别 | 指标 | 实测值 |
|---|---|---|
| 编码与字库 | 已编码汉字 | 14,833 字 |
| 唯一码位 | 14,833 个(重码位 0) | |
| 正负一码部件 | 98 组(85 单数部首 + 13 补充形码部件) | |
| 码位 | 26(正码 10 + 负码 10 + 字母码 6) | |
| 部首码表 | 257 条 | |
| 码长合规 | 数码码片常规 ≤4(补充码 V 不计入),常用长字可 5 位 | |
| 字典词典 | 新华字典字条 | 16,142 |
| 中文词典词条 | 264,434 | |
| 字库直接有码 | 15,743 | |
| 真正无码 | 44 | |
| 闪送与加密 | 数码压缩传输容量 | 实测达 400 万码 |
| 加密通道 | 蒸馏 12 码/抗量子 24 码+先决条件/加密语音 | |
| 机机密传时效 | 3 分钟,对方本机自动解码 | |
| 数据安全保险 | 每份文件保额 | 10 万元 |
| 保金 | 10 元(中国籍人民币/外籍美元,按实名国籍) | |
| 自动结案 | 对方提取后 24 小时无投诉自动结案转历史保单 | |
| 理赔 | 用户可发起申请 → 待审核 → 已赔付/已驳回(单份上限 10 万元) | |
| 生态与国际 | 界面语言 | 22 语 |
| 授权体系 | 195 个国家与地区 | |
| 华语贡献者 | 139 位(远古 22/近代 35/当代 31/专家 51;院士 18/学部委员 3/专家教授 59) | |
| 编程与算力 | DCIS | 97 条编码 × 8 种语言 |
| DCUL | 37 个接口 | |
| 数制效率 | 26³=17,576;4.70 bit/击;进位 −92.3%;储运约 −79%;较 UTF-8 省 40–60% | |
| 换算准确性 | 100,007 例零误差 | |
| 教育与学术 | 测评体系 | HSK 1–6 级;12 个学习视频 |
| 阶段目标 | 进入教育体系后学习文字时间平均减少 90%(远期 99%) | |
| 平台与知产 | 双站架构 | 商用站与安全版独立运行,用户与数据相互隔离 |
| 知识产权 | 主专利 202610784807.1;12 项发明专利;24 项软件著作权 |
围绕编码体系、加密方法、传输机制与算力架构,平台已形成体系化的知识产权组合:
| 类别 | 数量 | 说明 |
|---|---|---|
| 主专利 | 202610784807.1 | 基于正负杂合数的汉字数码化编码模型 |
| 发明专利 | 12 项 | 覆盖编码、加密、传输、机机密传等方向 |
| 软件著作权 | 24 项 | 覆盖字库、输入、闪送、字典、后台、加密与安全、运营与资料等模块 |
平台提出的编码标准方向(CSCII,Chinese Standard Code for Ideographic Input)参照 ASCII 的历史角色:让每一个汉字拥有紧凑、可解释、可逆的数码身份,并可与现有字符集互为映射,从而在不破坏既有生态的前提下获得更优的中文表达层。
平台已越过「技术验证」阶段:编码、字库、字典、闪送、加密、机机密传、保险与生态体系均已上线运行。后续工作沿三条主线推进。
| 主线 | 近期(已上线/进行中) | 中期 | 远期 |
|---|---|---|---|
| 编码与字库 | 14,833 字零重码;部首码表 257 条;旧密文兼容层 | 补齐剩余 44 个无码字;扩充异体字与域外汉字;持续人工校订扩库 | 形成完整汉字数码编码规范与字符集建议稿 |
| 安全与保险 | 三档加密、机机密传、一次性密钥语义、数据安全保险(10 万保额/10 元保金/24 小时结案/理赔全流程) | 后量子算法对接(ML-KEM/ML-DSA);理赔证据附件;机构级保单汇总与审计视图 | 面向关键行业的合规加密通道与保险机制常态化 |
| 教育与国际 | HSK 1–6 级测评;22 语界面;195 国授权;华语贡献者 139 位;学习排行榜与书法大赛 | 试点校与教学机构合作,形成「九成之验」前后测数据集 | 进入多国教育体系,实现学习文字时间显著下降的可复现证据链 |
| 术语 | 释义 |
|---|---|
| COS | 华文生态系统(Chinese operating system · 华文操作系统):以汉字部件正负形为本源的数码编码体系与生态总称。 |
| 正码 | 0–9 十个正数码位,对应键盘第二排(A–L 与 M=0)。 |
| 负码 | ⁻0–⁻9 十个负数码位,对应键盘第一排(Q–P),负号显示在数字头顶。 |
| 字母码 | Z 言(讠)/X 木/C 土(士)/V 补充码/B 日/N 金(钅) 六个字母码位。 |
| 正负一码部件 | 对应唯一一枚码片的汉字部件,共 98 组(85 单数部首 + 13 补充形码部件)。 |
| 补充码 V | 重码区分机制:不同汉字取到同一数码时,以 V 补位区分(如「八=8」「人=8V」)。 |
| 3.3 词组取码 | 词组最短码规则:二字词各取首码;三字词各取首码;四字及以上取前三字首码+末字首码。 |
| 凭据包 | 加密完成后生成的交付物:数码与多维度条件一并打包,可复制凭据文本或下载凭据文件;对方粘贴或拖入提取栏即自动匹配解密。 |
| 先决条件 | 抗量子加密的多维度核验条件(姓名/虹膜/声纹/口令),提取方须逐项匹配。 |
| 一次性密钥语义 | 提取即删、不可视、不缓存;对方成功接收后该数码自动失效。 |
| 机机密传 | 两台计算机之间的全自动加密互认传输:机器码互认、IP 比对、会话密钥一次性传递、3 分钟时效、本机自动解码。 |
| 中国红码 | 平台自有码制(当前 v3:37×37 垛口外圈+9 个 11×11 小码点),用于内容分享与设备邀请直连。 |
| 电子保单 | 数据安全保险的凭证:每份加密文件一份,与提取数码一一绑定,含保额、保金、币种与承保状态。 |
| DCIS/DCUL | 数码指令集(97 条编码 × 8 种语言)与数码接口层(37 个接口)。 |
| 太极算 | 以 26 码位为基的算力表达方式,正负对称、免进位;26³=17,576 状态空间,单次击键 4.70 bit。 |
| CSCII | 汉字数码编码标准方向(Chinese Standard Code for Ideographic Input),三步走推进:团体→行业→国家与国际。 |
汉字正负数码不是一项孤立的技术发明,而是一次关于「文字如何在数字世界继续存在」的回答:让每一个汉字都能被看形取出、被计算、被安全传送、被平等学习。它所连接的是四件事——文字的尊严、信息的安全、教育的效率、文明的互通。
本白皮书所载的每一项指标,都对应着线上正在运行的功能;所承诺的每一项安全义务,都有可查询的保单与可执行的理解赔付流程。我们愿意把它放在公开的标准之下接受检验,因为文化复兴的底座是文字复兴,而文字复兴的底座,是每一个普通人都能更轻松地读懂、写出并传递自己的语言。