跨语言大模型评测

LangMatch语言本身,能不能压缩 Prompt?

一项受控实证研究:固定任务、模型后端和输出预算,只把系统提示分别写成英文、精简现代中文与文言文,观察质量–成本前沿如何移动。

LangMatch 项目主视觉,对比英文、简体中文与文言文提示
文言文并非处处更省、处处更强;但在足够强的模型上,它确实可能成为真正的 Pareto 候选。
4个模型覆盖闭源与开源模型家族
3种语言英文、简体中文、文言文
3个基准IFEval、MATH-500、MMLU-Pro
2048token 预算修正后统一预算,并显式审计截断

实验真正发现了什么

结论不是“某种语言全面获胜”。提示语言会与模型能力、任务类型和推理可见形式发生明显交互。

稳健默认项

精简现代中文迁移性最好。

zh_compact 在不同模型家族间最稳定,常能保持任务质量,同时控制输出长度。

条件性收益

文言文只在特定条件下获益。

修正后的主矩阵中,文言文是 GPT-5.4 的总体最优条件;但这一优势没有稳定迁移到较小的开源模型。

推理形式

是否展示推理也会改变前沿。

隐藏推理主要压低可见 token;紧凑可见推理则以比显式过程更低的成本,保留了最强的 GPT-5.4 / 文言组合。

同一任务,三种提示语言

只改 system prompt 的语言;任务子集、模型后端、评分器与输出预算全部固定。

base

精简英文

传统控制组:清楚、简洁,也是所有受测模型最熟悉的提示语言。

“Follow the user’s instructions carefully… eliminate redundancy and aim for compact, clear expression.”

zh_compact

简体中文

精简中文控制组,用来把一般语言效应与文言文特殊文体效应区分开。

“请严格遵循用户要求……删繁就简,要求表达精炼、意思清楚。”

wy

文言文

高信息密度、强省略、语法凝练,因此可能成为一种天然的自然语言 prompt compression 形式。

“凡码与引文外,释理叙事宜从简。禁绝白话冗词,务求辞约义明。”

一条评测样本长什么样?

这道公开 Manifest 中的 MATH-500 题保持数学问题与正确答案不变,只改变推理和作答所用语言。下面的输出示意可以直接看出文言表达的压缩幅度。

共同任务 · MATH-500 number-theory/820

正整数 ab 满足 gcd(a,b) = 210、lcm(a,b) = 210³ 且 a < b,求 a 有多少个可能值。正确答案为 8。

English题面 143 · 输出 182
公开 Manifest 中的题面

Problem / 题目: If a and b are positive integers such that gcd(a,b)=210, lcm(a,b)=210³, and a<b, how many possible values are there for a?

输出示意 · 非空白字符

Let a=210x and b=210y. Then gcd(x,y)=1 and xy=210²=2²·3²·5²·7². Each prime-square factor must go wholly to one of x,y, giving 2⁴=16 ordered assignments. Since a<b, exactly half remain. <answer>8</answer>

简体中文题面 98 · 输出 165
公开 Manifest 中的题面

题目 / Problem: 如果 a 和 b 是正整数,且 gcd(a,b)=210,lcm(a,b)=210³,并且 a<b,那么 a 有多少个可能的取值?

输出示意 · 非空白字符

令 a=210x,b=210y。由 gcd(a,b)=210 可知 gcd(x,y)=1;再由 lcm(a,b)=210³ 得 xy=210²=2²·3²·5²·7²。因为 x 与 y 互质,每个素因子的平方必须整体分配给其中一方,共有 2⁴=16 种有序分配。条件 a<b 恰好保留一半,所以 a 有 8 个可能值。<answer>8</answer>

文言文题面 86 · 输出 95
公開 Manifest 中之題面

題目: 若 a 與 b 為正整數,且 gcd(a,b)=210,lcm(a,b)=210³,並且 a<b,則 a 之可能值有幾何?

輸出示意 · 非空白字符

令 a=210x,b=210y,則 (x,y)=1,而 xy=210²=2²·3²·5²·7²。四素之方各歸一數,凡 2⁴ 配;以 a<b,取其半,故八。<answer>8</answer>

题面字符数只统计上方实际展示的题面;输出字符数包含必须保留的 answer 标签。三条回答仅用于展示输出形式,不作为新增实测结果。

修正后的主矩阵

2048-token 重跑消除了 pilot 中最大的截断伪影,并把任务分数与总推理 token 放在同一张图上报告。

MATH-500 提示语言比较
MATH-500。GPT-4o 偏好精简中文;GPT-5.4 偏好文言文。
IFEval 提示语言比较
IFEval。高能力模型能在多种提示语言下完成全部约束。
MMLU-Pro 提示语言比较
MMLU-Pro。最保守的一组结果,语言效应依然强烈依赖模型。

完整数据表

切换总体与三个基准,查看每个模型–语言组合的得分、词元成本和单位成本效率。排名先按得分降序,再按总词元升序。

排名模型提示语言样本数得分提示词元输出词元总词元每千词元得分
1gpt-5.4文言文590.763BEST186.9345.15232.083.286
2gpt-5.4简体中文590.746199.9349.05248.982.995
3gpt-5.4英文590.729181.9354.64236.583.081
4gpt-4o简体中文590.627200.9329.59230.532.720
5gpt-4o英文590.593182.9337.12220.052.696
6gpt-4o文言文590.576187.9332.86220.802.610
7qwen3-4b简体中文590.475203.8569.98273.831.733
8qwen3-4b文言文590.475197.8598.71296.561.600
9qwen3-4b英文590.441197.85121.95319.801.378
10qwen3-1.7b英文590.339197.85127.00324.851.044
11qwen3-1.7b简体中文590.271203.85125.20329.050.824
12qwen3-1.7b文言文590.254197.85228.12425.970.597
排名模型提示语言样本数得分提示词元输出词元总词元每千词元得分
1qwen3-4b简体中文111.000BEST107.00129.64236.644.226
2qwen3-4b文言文111.000BEST101.00151.73252.733.957
3qwen3-4b英文111.000BEST101.00177.82278.823.587
4gpt-5.4文言文111.000BEST96.45218.18314.643.178
5gpt-5.4简体中文111.000BEST109.45239.09348.552.869
6gpt-5.4英文111.000BEST91.45269.36360.822.771
7qwen3-1.7b文言文111.000BEST101.00391.45492.452.031
8gpt-4o简体中文110.909110.45141.82252.273.604
9gpt-4o英文110.90992.45182.36274.823.308
10qwen3-1.7b英文110.909101.00314.55415.552.188
11qwen3-1.7b简体中文110.909107.00319.91426.912.129
12gpt-4o文言文110.81897.45161.45258.913.160
排名模型提示语言样本数得分提示词元输出词元总词元每千词元得分
1gpt-5.4文言文240.708BEST150.796.00156.794.518
2gpt-4o简体中文240.708BEST164.795.46170.254.161
3gpt-5.4简体中文240.667163.796.00169.793.926
4gpt-5.4英文240.625145.795.88151.674.121
5gpt-4o文言文240.583151.794.71156.503.727
6gpt-4o英文240.542146.795.29152.083.562
7qwen3-4b文言文240.292158.21165.50323.710.901
8qwen3-4b简体中文240.250164.21108.46272.670.917
9qwen3-4b英文240.250158.21155.62313.830.797
10qwen3-1.7b英文240.208158.2178.12236.330.882
11qwen3-1.7b简体中文240.083164.2123.54187.750.444
12qwen3-1.7b文言文240.000158.21120.92279.120.000
排名模型提示语言样本数得分提示词元输出词元总词元每千词元得分
1gpt-5.4英文240.708BEST259.545.00264.542.678
2gpt-5.4文言文240.708BEST264.545.00269.542.628
3gpt-5.4简体中文240.708BEST277.545.00282.542.507
4gpt-4o英文240.500260.542.38262.921.902
5gpt-4o文言文240.458265.542.08267.621.713
6qwen3-4b简体中文240.458287.884.17292.041.569
7gpt-4o简体中文240.417278.542.29280.831.484
8qwen3-4b文言文240.417281.887.62289.501.439
9qwen3-4b英文240.375281.8862.67344.541.088
10qwen3-1.7b英文240.208281.8889.92371.790.560
11qwen3-1.7b简体中文240.167287.88137.62425.500.392
12qwen3-1.7b文言文240.167281.88260.46542.330.307

主矩阵采用统一的 2048 输出预算。除 qwen3-1.7b 尚有 4 次长度截断外,其余模型没有触顶或空输出。词元统计应主要在同一模型与后端内部比较。

推理可见性同样重要

第二轮三组实验固定语言条件,改为比较显式过程、隐藏推理与紧凑可见推理。

显式过程总体结果
显式过程。GPT-5.4 / 文言达到 0.833 SR。
隐藏推理总体结果
隐藏推理。闭源模型显著省 token,但语言差异被压平。
紧凑可见推理总体结果
紧凑可见。同样达到 0.833,但从 578.42 token 降至 381.92。

基于 Manifest,完整可审计

每次运行都记录确切任务子集、提示条件、token 上限、finish reason、用量和评分结果。执行、聚合与画图彼此分离,截断不会再被静默当成模型失败。

固定 manifest
  → 任务 × 语言 × 模型运行
  → results.jsonl + 用量元数据
  → 截断审计
  → 跨运行聚合
  → 分数 / token Pareto 图
解释边界。LangMatch 是研究性探索,并不能证明文言文普遍优于其他提示语言。不同后端的 token 统计应主要在同一模型内部比较;GPT-5.4 上的文言收益在当前结果中成立,但它是高度条件化的。

报告与复现材料

公开仓库包含实验 manifest、runner、聚合报告、绘图脚本和可公开结果产物。