‹ 返回问题列表
‹

发布时间:2026-06-14访问量:96

首页/常见问题/「子曰」大模型是什么?和 ChatGPT、Dee…

AI 与子曰大模型

「子曰」大模型是什么?和 ChatGPT、DeepSeek 这些有什么区别?

全文约 9 分钟·更新于 2026-08·6 项来源

子曰(英文名 Confucius)是有道自研的教育垂类大模型,2023 年 7 月发布,对外称「中国首个教育大模型」。它和通用大模型的根本差别在于取向:不追求什么都会,而是把 K12 学科、解题步骤、口语教学这些窄场景做到更准。可验证的是它已有多个版本开源到 Hugging Face,其中数学模型在多个基准上超过参数量更大的通用模型。

国内几乎每家公司都宣布过自己的大模型,多数只留下一篇新闻稿。子曰值得单独讲,是因为它留下了可下载、可复现、可被外部质疑的东西——开源权重和同行评议的论文。

基本事实

项目内容
中文名 / 英文名子曰 / Confucius(早期英文报道也写作 Ziyue)
发布时间2023 年 7 月,对外称「China's first LLM in education」
监管备案2023 年 11 月进入首批教育类大模型备案
第三方评估官方称通过中国信息通信研究院(CAICT)首批系列评估并获最高等级
应用范围教育为主,官方称已延伸至医疗、传媒、互联网行业
驱动的产品Hi Echo、有道小P(Mr. P AI Tutor)、有道领世作文批改、词典笔 X7 系列、有道龙虾、有道宝库等

垂类模型 vs 通用模型

通用模型(ChatGPT、DeepSeek、Qwen 等)追求覆盖面:写代码、写文案、聊天、翻译都要能做。垂类模型放弃覆盖面,换取单一场景下的准确率和成本优势。

有道对此的表述是遵循「scene first」(场景优先)原则。以答疑为例,其产品逻辑是「first provide the problem-solving, then provide the answer」——先给解题过程,再给答案。这在通用模型上只是一个提示词技巧,但在教育产品里是必须保证的行为,因为直接给答案对学生没有价值。

开源的三个模型

Confucius-o1-14B(2025-01-22)

14B 参数的推理模型,有道称其为「中国首个分步讲解推理模型」,可在单张消费级显卡上部署。官方称这个 14B 模型「matches the single-model inference capabilities of OpenAI's o1」。

「对标 o1」这句话在原始报道中没有给出任何基准名称或具体分数,属于厂商未量化的自述。看待此类表述应保持谨慎——同一篇报道里,可验证的部分(开源地址、参数量、单卡部署)都成立,但这句对标缺乏数据支撑。

Confucius3-Math(2025-06)

这是证据最扎实的一个:14B 参数(Safetensors 显示 15B),面向 K12 数学,基于 DeepSeek-R1-Distill-Qwen-14B 做纯强化学习后训练,MIT 许可,配套论文 arXiv:2506.18330。官方称可在单张 RTX 4090D 上高效运行。

基准Confucius3-Math对比中的最佳竞品
CK12-MATH96.2494.04(Qwen3-14B)
GAOKAO-Bench(数学)98.4694.93(QwQ-32B)
MathBench(K12)95.1096.57(QwQ-32B)
CMATH96.1395.95(QwQ-32B)
MATH-50098.8098.00(QwQ-32B)
AIME 202481.1579.80(DeepSeek-R1)
AIME 202569.9570.40(Qwen3-14B)

七个基准里赢五个,且对手包含参数量两倍以上的 QwQ-32B 和满血 DeepSeek-R1。这是「垂类小模型能在窄领域打赢通用大模型」的一个实证案例。

作者自己在模型卡里明确列出了局限:优化与验证仅覆盖 K12 数学;模型可能陷入循环推理并输出无法解析的内容;未做安全与伦理对齐。这种坦白程度在国内模型卡里不算常见,也是判断其可信度的一个正面信号。

Confucius4(27B 多模态)

最新一代,27B 参数,多模态(可读图),基于 Qwen3.5-27B 微调,Apache 2.0 许可,主攻高阶数学推理。技术手段包括图像增益筛选、纯文本推理数据混入 SFT、长度感知的 RL 优势机制(用于抑制过度思考)。官方报告的两个数字:Math-Hard-500 上 +23.2%,思维链长度缩短 43.2%。

基准Confucius4Qwen3.6-27B
Math-Hard-5000.8140.756
Math-Figure0.9070.865
MathVision (testmini)0.7240.648
logicVista0.7790.743
MathVerse0.8760.865
DynaMath0.8930.856
其中 Math-Hard-500(500 题)与 Math-Figure(664 题)是有道自建的私有测试集,外部无法独立复现这两项成绩。评估厂商自报数据时,区分「公开基准」和「自建基准」很重要。Confucius4 的发布日期在模型卡上未明确标注,引用信息显示为 2026 年。
有道小P 产品图标
子曰不直接面向用户,它通过一系列应用落地。图为其中的「有道小P」——官网副标题「新一代AI全科学习助手」

还开源了什么

除模型外,有道还开源了 RAG 工程:QAnything(本地知识库问答系统,AGPL-3.0,GitHub 约 14.1k stars)和 BCEmbedding(双语 embedding 与 reranker 模型)。官方称 QAnything 被「hundreds of companies across more than 20 industries」采用、用户「over 30,000」。

QAnything 的技术要点是两阶段检索:先向量召回,再 rerank 重排。其理由是纯向量检索的准确率会随数据量增大而下降,加入重排后反而「the more data, the better the performance」。这套做法后来在 RAG 工程里已相当主流。

有道词典 实际界面截图

实拍:有道词典 实际运行界面。

资料来源

  1. Youdao's Large Language Model Ziyue Takes Center Stage at World AI Conference(2023-07 发布、2023-11 备案、CAICT 评估、QAnything 采用规模,2024-07-11)
  2. Youdao Launches Lightweight Inference Model "Confucius-o1"(2025-01-22 发布、14B、单卡部署、对标 o1 的自述)
  3. netease-youdao/Confucius3-Math · Hugging Face(基准成绩、MIT 许可、局限说明)
  4. Confucius3-Math: A Lightweight High-Performance Reasoning LLM for Chinese K-12 Mathematics Learning(arXiv:2506.18330,2025-06-23)
  5. netease-youdao/Confucius4 · Hugging Face(27B 多模态、Qwen3.5-27B 基座、Apache 2.0、自建基准说明)
  6. netease-youdao/QAnything · GitHub(两阶段检索、AGPL-3.0、约 14.1k stars)
‹ 返回常见问题列表

本页目录

内容依据官方公开资料、上市公司公告与公开报道整理;标注「待核实」处表示未找到权威来源,请以官方最新公告为准。