技 术 地 图

汉字正负数码 · 技术地图

七层技术栈 · 五大指标维度 · 从编码内核到标准路径
以汉字构形为码源,把「文字本体」直接变成「数字底座」——一套编码内核,贯通输入、教育、安全、智能、生态与标准。
本图用途:按「能力 — 关键指标 — 依赖关系 — 成熟度」四要素,把汉字正负数码(COS)全线技术资产画成一张可打印的分层地图。数据口径与《白皮书(华文生态系统 COS)》《立项报告书(发改委·汉字正负数码自主可控数字底座)V2.0》一致;标注「(口径以白皮书为准)」处为尚在推进、暂无定值的事项。

地图导航

一、分层总览(自下而上・依赖逐层收敛)

七层结构自上而下互为支撑:L1 是唯一内核,L2 承载数据资产,L3—L5 是能力的三个出口(学、传、算),L6 把能力组织为平台与生态,L7 把已实现的事实固化为可被广泛采纳的规范。

L7标准路径层企业标准 → 团体/行业/国家/国际标准编制中/规划 L6平台与生态层双站、会员、机构与授权、贡献者体系已上线 L5智能与应用层AI 客服、22 语、DCIS/DCUL、双轨数制(甲子六十进制底层/人侧 26 码位)已上线 L4安全层蒸馏 12 码/抗量子 24 码/机机密传/数据安全保险已上线 L3输入与教学层26 键键位图、英语键盘、HSK 测评、练习与考核已上线 L2字库与数据层全量码表、字典词典、词组句码、题库与内容库已上线 L1编码内核层26 码位 · 98 组部件 · 部首码表 257 条 · 3.3 取码已上线
图 1 汉字正负数码技术分层(共七层)

二、逐层能力地图

L1

编码内核层 · 全体系唯一内核,无外部依赖

能力以汉字部件「正形/负形」的拓扑对偶定义数码:正码 0—9 取同形近形部件,负码 ⁻0—⁻9 取反形变形部件,字母 Z X C B N 补足形码,共 26 码位构成封闭体系。部件拆解后按取码顺序生成字形码;同码字以 V 补充码消解,实现字与码一一对应;词组按 3.3 规则取最短码;CSCII 码表把 98 个部件各映射为唯一 8 位二进制码(单字节存储)。
关键指标26 码位(10 正码 + 10 负码 + 6 字母码);98 组正负一码部件(85 单数部首 + 13 补充形码部件);部首码表 257 条(基础 211 条 + 按学术论证与实证数据补录 46 条);词组取码 3.3 规则;码长规范 ≤4 码片(常用长字经论证放宽至 5 位);部件表约 784 字节 + CSCII 码表 208 字节,合计不足 1 KB。
依赖关系无下层依赖,为 L2—L7 的唯一码源;对上层提供码位定义、部件表、取码规则与 CSCII 码表四项接口。
成熟度已上线部件表、部首码表与取码规则已固化并在线上运行;标准文本化(CSCII 标准草案)见 L7。
L2

字库与数据层 · 可复现、可核验的数据资产

能力全量单字码表(字—码一一对应、可逆还原);新华字典级字典与 26 万词条中文词典(含拼音、部首、释义、例证,支持在线与缓存查询);3.3 规则词组/句码库;国学文库九大分类内容库;练习与等级测评题库;旧密文兼容层保证历史码位可解。
关键指标14,833 字 / 14,833 码位 / 零重码(基础字库 7,038 字 + 变体映射 114 字 + 兼容汉字 234 字 + 经核验扩充 7,447 字);新华字典 16,142 字条,直接有码 15,743 字、真正无码 44 字(多为域外异体字),覆盖率 97.5%(可经繁简映射再补 355 字);中文词典 264,434 词条;词组校验 3,049 条通过;历史密文 8,341 条回放全部正确还原。
依赖关系完全依赖 L1 的码位与部件定义;为 L3、L4、L5 提供查码、候选、词库与语料底座。
成熟度已上线字库、字典、词典、题库、内容库均已上线运行;后续按批次持续扩充。
L3

输入与教学层 · 见字识码,零硬件改动

能力26 键键位图输入(屏幕键位图与物理键盘一一对应,点击或按键输入码片);英语键盘(中英双修)——英语键位直接输入英文,回车即译成华语并播报;码片条与候选区、前缀候选与联想、繁简切换、单字查码与词语查码、导入文档批量取码;练习模式(含简易模式)、HSK 等级测评、专项练习与段位证书、学习排行榜、共享词库与生词本、取码教学。
关键指标26 键位图与物理键盘一一对应(零硬件改动);HSK 等级测评覆盖 1—6 级并输出练习报告;专项练习按「26 码位换算/数码指令/汉字取码/跨语言转译」各 8 题成组;随机测试每次 10 题;段位证书成绩码为得分之 26 码位编码,可反解验证;测试与挑战题库持续运营。
依赖关系依赖 L1 取码规则与 L2 字库/字典词库;为 L5 的编程教学与 L6 的会员权益、排行榜提供行为入口。
成熟度已上线输入、练习、测评与证书闭环已上线;学习激励体系持续运营。
L4

安全层 · 编码即安全,四层纵深

能力蒸馏加密(密文即正负数码密文,服务器仅存数码、不可视、不缓存);抗量子加密(24 码 + 先决条件核验:姓名/虹膜/声纹/口令,并支持限时、限地址、限 IP);加密语音(录音→纯正负数码密文入库→在线播放或下载);机机密传(机器码自动互认 + IP 比对 → 强隔离私密连接 → 一次性会话密钥随连接传递 → 收方本机自动解码,不经服务器);提取即删/收讫失效一次性语义;数据安全保险(每份密文自动生成电子保单,与提取数码一一绑定)。
关键指标蒸馏加密 12 码/抗量子加密 24 码(组合空间 10³⁴ 量级);先决条件核验 4 类;机机密传时效 3 分钟、超时自动失效、本机解码不经服务器;单条密文上限 400 万码(超大文件自动数码压缩,提取端自动解压复原);数据安全保险 保额 10 万元/保金 10 元,提取后 24 小时无投诉自动结案;四层纵深=编码层无数学陷门 → 存储层提取即删 → 密码层后量子路线(ML-KEM/ML-DSA)→ 架构层 26 维量子态映射探索。
依赖关系依赖 L1(数码即密文本体)与 L2(码表与兼容层);向 L5 智能体场景、L6 会员权益与安全站输出加密通道能力。
成熟度已上线蒸馏、抗量子、加密语音、机机密传与保险均已上线;在建后量子标准(ML-KEM/ML-DSA)工程化与第三方安全测评。
L5

智能与应用层 · 数码即代码,语言无关中间表示

能力AI 智能客服(多模型路由、多智能体协同,解答使用与理论问题,密钥与调用在后端);22 语界面与翻译、外文播报(语种以本名标注,默认华语);DCIS 数码指令集(中文指令 ↔ 数码中间表示 ↔ 八种编程语言);DCUL 通用底层库(统一以数码编号调用);双轨数制(甲子六十进制底层/人侧 26 码位)(键盘完备+满则累进+免进位并行);数码编程测试与段位证书、中文数码编程圈子。
关键指标DCIS 97 编码 × 8 语言(Python/JavaScript/Java/C++/C#/Go/Rust/PHP);DCUL 37 个数码接口(含智能体接口 90—99),开放接口合计 134;26 码位换算 100,007 例往返零误差;键盘完备 26 键 ≡ 26 码片,输入熵 log₂26 = 4.70 bit/击;满则累进使进位概率降幅 92.3%、传播期望 −96%、批处理调度 −99.9%、储存与传输约 −79%、汉字较 UTF-8 省 40—60%;22 语界面与翻译播报。
依赖关系依赖 L1、L2 的码表与词典,依赖 L3 的输入与教学入口;向 L6 输出可授权的接口与工具链,向 L7 输出标准必要技术。
成熟度已上线DCIS/DCUL、换算器、编程测试与圈子已上线;在建面向大模型与智能体厂商的接口授权与代码生成服务。
L6

平台与生态层 · 双站承载、自增长运营

能力双站:商用站 ai.arpa.top(输入·教育·传送·文化·会员·商城)与安全版/安全站 anquan.arpa.top(安全加密通道、场景化开通),两站数据域、用户域与管理域相互隔离;会员体系三档订阅 + 五项专属权益;实名认证(中国籍身份证/外籍护照);推广奖励(每正式会员 50 元,配二维码、红码与专属链接);商城与财务在线账本;机构与高校入口;国家/地区合作授权;华语贡献者体系;学习排行榜与华文书法大赛。
关键指标会员三档:月度 ¥99/季度 ¥240/年度 ¥720(外籍同价美元);五项专属权益=抗量子加密、加密语音、HSK 测评、22 语种翻译、国学文库全文;合作授权体系覆盖 195 个国家/地区;华语贡献者收录 139 位(远古文字 22/近代文字 35/当代文字 31/专家学者 51,含院士 18 位、学部委员 3 位);推广奖励 50 元/正式会员;机构与高校入口支持教学试点与科研合作。
依赖关系依赖 L3(获客与学习行为)、L4(付费硬核权益)、L5(开放接口与开发者生态);向 L7 输出真实运营与覆盖数据作为标准论证依据。
成熟度已上线双站、会员、实名、推广、机构授权与贡献者体系均已上线运行。
L7

标准路径层 · 把已实现的事实固化为可采纳的规范

能力CSCII 中国信息交换标准码(对标 ASCII 的自主路径):以 98 个正负一码部件为原子,将部件映射为唯一 8 位二进制码,实现单字节存储的中文信息交换标准;《汉字正负数码编码规范》企业标准;团体标准 → 行业标准 → 国家/国际标准的分级推进;配套一致性测试集与参考实现,供企业验证;在存储与交换层与国际标准兼容共存,在中文处理与安全层发挥构形编码优势。
关键指标技术判据:字库数据可复现可核验;取码规则经 14,833 字全量实测;有院士、学部委员与专家教授组成的学术顾问网络;有 12 项发明专利与 24 套软件著作权作为权属基础。推进目标:《汉字正负数码编码规范》企业标准 1 套、团体标准立项 1 项、CSCII 预研报告 1 份;部件表、码表、接口规范、测试规范各 1 套(口径以立项报告书与白皮书为准)。
依赖关系技术上依赖 L1 的部件与码表定义,论证上依赖 L2—L6 的实测数据、安全实证、接口生态与运营规模。
成熟度在建企业标准与 CSCII 标准草案编制;规划团体标准立项、行业/国家标准申报与国际提案。

三、技术栈一览表

层关键组件/资产关键指标成熟度
L1 编码内核26 码位;98 组部件;部首码表;CSCII 码表26 码位;85 单数部首+13 补充形码部件;部首码表 257 条;部件表+码表不足 1 KB已上线
L2 字库与数据全量单字码表;字典;词典;词组句码库;国学文库;题库14,833 字 / 14,833 码位 / 零重码;字典 16,142 字条(直接有码 15,743);词典 264,434 词条已上线
L3 输入与教学26 键键位图;英语键盘;练习与测评;段位证书零硬件改动;HSK 1—6 级测评;专项练习各 8 题;成绩码可反解验证已上线
L4 安全蒸馏通道;抗量子通道;加密语音;机机密传;数据安全保险蒸馏 12 码/抗量子 24 码;机机密传 3 分钟;提取即删;保额 10 万元・保金 10 元已上线(PQC 在建)
L5 智能与应用AI 智能客服;22 语界面;DCIS;DCUL;双轨数制(甲子六十进制底层/人侧 26 码位)DCIS 97×8;DCUL 37;开放接口 134;100,007 例往返零误差;4.70 bit/击已上线(授权在建)
L6 平台与生态商用站;安全站;会员体系;机构与授权;贡献者体系双站数据域隔离;会员三档;195 国授权体系;贡献者 139 位已上线
L7 标准路径CSCII 标准码表;编码规范;一致性测试集98 部件各映射唯一 8 位二进制码;标准文本与团体立项为目标值在建/规划
表 1 技术栈一览(层—组件—指标—成熟度)

四、关键指标速查表

指标实测值说明与验证方式
码位/键位26 个10 正码 + 10 负码 + 6 字母码(含 V 补充码);平台键位图与标准草案口径一致
正负一码部件98 组85 单数部首 + 13 补充形码部件;线上组件库与手册表核对
部首码表257 条基础 211 条 + 按学术论证与实证数据补录 46 条,按码位分 26 组
全量单字码表14,833 字 / 14,833 码位 / 零重码含基础字库、变体映射、兼容汉字与经核验扩充字;字库数据与审计报告
字典覆盖16,142 字条中直接有码 15,743(97.5%)真正无码 44 字,多为域外异体字;可经繁简映射再补 355 字
词典规模264,434 词条含拼音、部首、释义、例证,支持在线与缓存查询
词组取码规则3.3 规则两字取各首码/三字取各首码/四字及以上取前三字+末字首码;3,049 条词组校验通过
码长规范≤4 码片(常用长字放宽至 5)全量码长审计;重码以 V 补充码消解(曾有 610 个重码位,现为 0)
历史密文兼容8,341 条回放全部正确还原旧密文兼容性回归测试
字库存储量98 部件 × 8 字节 = 784 字节,+ 码表 208 字节合计不足 1 KB;四字体合计约 3 KB,远小于传统单字体字库
加密通道蒸馏 12 码/抗量子 24 码抗量子附先决条件核验(姓名/虹膜/声纹/口令)与限时、限地址、限 IP
机机密传3 分钟时效机器码互认 + IP 比对;一次性会话密钥随连接传递;收方本机解码,不经服务器
一次性语义提取即删・收讫失效・不可视・不缓存对方成功接收后该数码自动失效;同内容再次入库前系统自动分析并复用原数码
数据安全保险保额 10 万元/保金 10 元每份密文自动生成电子保单并与提取数码一一绑定;提取后 24 小时无投诉自动结案
开放接口DCIS 97 + DCUL 37 = 134DCIS 覆盖 8 种编程语言;DCUL 统一以数码编号调用
双轨数制架构100,007 例往返零误差输入熵 4.70 bit/击;进位概率降幅 92.3%;储运约 −79%;汉字较 UTF-8 省 40—60%
多语与授权22 语界面 · 195 国授权体系同一站点一键切换 22 种界面语言;语种以本名标注,默认华语
贡献者与生态华语贡献者 139 位远古 22/近代 35/当代 31/专家 51,一人一独立页面,持续扩充
表 2 关键指标速查(口径与白皮书、立项报告书一致;尚无定值处已标注)

五、技术护城河:三点结论

一、编码本体原创

以汉字部件「正形/负形」的拓扑对偶关系定义数码,编码依据来自文字本体而非外部编号——98 组部件、26 码位构成封闭体系,属于原始创新,不与既有字符集编号范式同构,且不排斥与既有标准兼容共存。

二、数据资产可核验

14,833 字零重码、字典 16,142 字条中直接有码 15,743(97.5%)、词典 264,434 词条、历史密文 8,341 条全部正确还原——规模与质量均可复现、可审计,不是纸面指标。

三、安全范式前置

把抗量子能力预置在编码层与架构层,而非仅在密码算法层补强:编码层无数学陷门、存储层提取即删、密码层对接后量子标准路线、架构层探索 26 维映射——形成「编码即安全」的新路径。

六、下一步技术路线

近期 · 标准化与通道工程化完成《汉字正负数码编码规范》企业标准编制并推动团体标准立项;建设 CSCII 一致性测试集与参考实现;把抗量子 24 码通道与机机密传推向第三方安全测评与行业适配;字库在 14,833 字基础上按批次持续扩充(建设目标 ≥15,000 字)。
中期 · 接口开放与生态扩张数码编程平台正式开放并完善 26 码位工具链;面向大模型与 AI 智能体厂商提供接口授权与代码生成服务;形成机构私有化部署方案;教育机构与高校试点规模化,构建开发者开放生态。
长期 · 架构前沿与国际标准推进 26 维量子态映射(Qudit-26)、部件级中文智能与端侧轻量模型研究;通过学术论文、白皮书与国际交流推动 CSCII 的国际认知与采纳;扩大 22 语界面与 195 国授权网络的落地覆盖(路线口径以立项报告书与白皮书为准)。
北京正数负数科技有限公司 | 定位:成为语言产业的科技领军企业 | 线上平台:ai.arpa.top(商用)/ anquan.arpa.top(安全版) | 主专利 202610784807.1 | 12 项发明专利 · 软件著作权 24 套 | 返回项目资料库