国内几乎每家公司都宣布过自己的大模型,多数只留下一篇新闻稿。子曰值得单独讲,是因为它留下了可下载、可复现、可被外部质疑的东西——开源权重和同行评议的论文。
基本事实
| 项目 | 内容 |
|---|---|
| 中文名 / 英文名 | 子曰 / Confucius(早期英文报道也写作 Ziyue) |
| 发布时间 | 2023 年 7 月,对外称「China's first LLM in education」 |
| 监管备案 | 2023 年 11 月进入首批教育类大模型备案 |
| 第三方评估 | 官方称通过中国信息通信研究院(CAICT)首批系列评估并获最高等级 |
| 应用范围 | 教育为主,官方称已延伸至医疗、传媒、互联网行业 |
| 驱动的产品 | Hi Echo、有道小P(Mr. P AI Tutor)、有道领世作文批改、词典笔 X7 系列、有道龙虾、有道宝库等 |
垂类模型 vs 通用模型
通用模型(ChatGPT、DeepSeek、Qwen 等)追求覆盖面:写代码、写文案、聊天、翻译都要能做。垂类模型放弃覆盖面,换取单一场景下的准确率和成本优势。
有道对此的表述是遵循「scene first」(场景优先)原则。以答疑为例,其产品逻辑是「first provide the problem-solving, then provide the answer」——先给解题过程,再给答案。这在通用模型上只是一个提示词技巧,但在教育产品里是必须保证的行为,因为直接给答案对学生没有价值。
开源的三个模型
Confucius-o1-14B(2025-01-22)
14B 参数的推理模型,有道称其为「中国首个分步讲解推理模型」,可在单张消费级显卡上部署。官方称这个 14B 模型「matches the single-model inference capabilities of OpenAI's o1」。
Confucius3-Math(2025-06)
这是证据最扎实的一个:14B 参数(Safetensors 显示 15B),面向 K12 数学,基于 DeepSeek-R1-Distill-Qwen-14B 做纯强化学习后训练,MIT 许可,配套论文 arXiv:2506.18330。官方称可在单张 RTX 4090D 上高效运行。
| 基准 | Confucius3-Math | 对比中的最佳竞品 |
|---|---|---|
| CK12-MATH | 96.24 | 94.04(Qwen3-14B) |
| GAOKAO-Bench(数学) | 98.46 | 94.93(QwQ-32B) |
| MathBench(K12) | 95.10 | 96.57(QwQ-32B) |
| CMATH | 96.13 | 95.95(QwQ-32B) |
| MATH-500 | 98.80 | 98.00(QwQ-32B) |
| AIME 2024 | 81.15 | 79.80(DeepSeek-R1) |
| AIME 2025 | 69.95 | 70.40(Qwen3-14B) |
七个基准里赢五个,且对手包含参数量两倍以上的 QwQ-32B 和满血 DeepSeek-R1。这是「垂类小模型能在窄领域打赢通用大模型」的一个实证案例。
Confucius4(27B 多模态)
最新一代,27B 参数,多模态(可读图),基于 Qwen3.5-27B 微调,Apache 2.0 许可,主攻高阶数学推理。技术手段包括图像增益筛选、纯文本推理数据混入 SFT、长度感知的 RL 优势机制(用于抑制过度思考)。官方报告的两个数字:Math-Hard-500 上 +23.2%,思维链长度缩短 43.2%。
| 基准 | Confucius4 | Qwen3.6-27B |
|---|---|---|
| Math-Hard-500 | 0.814 | 0.756 |
| Math-Figure | 0.907 | 0.865 |
| MathVision (testmini) | 0.724 | 0.648 |
| logicVista | 0.779 | 0.743 |
| MathVerse | 0.876 | 0.865 |
| DynaMath | 0.893 | 0.856 |

还开源了什么
除模型外,有道还开源了 RAG 工程:QAnything(本地知识库问答系统,AGPL-3.0,GitHub 约 14.1k stars)和 BCEmbedding(双语 embedding 与 reranker 模型)。官方称 QAnything 被「hundreds of companies across more than 20 industries」采用、用户「over 30,000」。
QAnything 的技术要点是两阶段检索:先向量召回,再 rerank 重排。其理由是纯向量检索的准确率会随数据量增大而下降,加入重排后反而「the more data, the better the performance」。这套做法后来在 RAG 工程里已相当主流。

实拍:有道词典 实际运行界面。
资料来源
- Youdao's Large Language Model Ziyue Takes Center Stage at World AI Conference(2023-07 发布、2023-11 备案、CAICT 评估、QAnything 采用规模,2024-07-11)
- Youdao Launches Lightweight Inference Model "Confucius-o1"(2025-01-22 发布、14B、单卡部署、对标 o1 的自述)
- netease-youdao/Confucius3-Math · Hugging Face(基准成绩、MIT 许可、局限说明)
- Confucius3-Math: A Lightweight High-Performance Reasoning LLM for Chinese K-12 Mathematics Learning(arXiv:2506.18330,2025-06-23)
- netease-youdao/Confucius4 · Hugging Face(27B 多模态、Qwen3.5-27B 基座、Apache 2.0、自建基准说明)
- netease-youdao/QAnything · GitHub(两阶段检索、AGPL-3.0、约 14.1k stars)