问题1(质量评价 + 冲突消解 + 配比建模):三个小题递进。① 质量评分 Q:22 个质量指标方向不一(教育价值越高越好、广告含量越低越好),先做方向统一(负向指标 Min-Max 后取 1−x),多维列表型指标先压成标量,再加权/打分聚合成样本级 → 语料级 → 领域级 Q,聚合方式要有论证;题目硬性要求全量使用抽样集 A1 与扩展集 A2、A3,并给出域级 Q 与抽样集结果对照。② 冲突消解:同一文本上"教育价值高"与"广告含量高"并存时怎么算?先定义冲突(如指标间标准化评分之差超阈值、或加权总分与单指标排序矛盾),再给消解规则(优先级仲裁、加权调和、剔除),结论要在抽样集上得出、扩展集上复核。③ 17 域配比回归:用 A4–A15 的配方实验表(RegMix 风格的"配比 → Loss"数据),在单纯形约束 pi≥0、Σpi=1 下拟合配比与交叉熵损失的定量关系——softmax 参数化 + 神经网络/回归树,或 Dirichlet 回归、约束最小二乘都行;A6–A11 当检验集,A12–A15 外推表验证结论稳健性。质量信息与配比体系分属两套域分类,若要打通需借 A16 的参考映射并说明假设。
问题2(广义标度律):把 Q 与 p 写进 L(N,D)。最自然的两种设计:改写有效数据量 Deff=D·h(Q)(质量打折),或在经典式上加质量修正项 B·D−β·g(Q);配比 p 可以进成各域损失的加权和。多数队伍会加一条"Q=1 时退化为经典形式"的约束——加了就要论证依据。用 B1(Pythia 训练轨迹)做主拟合,B2 或 B3 做同族验证,B4、B5 做跨族/文献验证,B9、B10 讨论百亿参数以上的外推。然后做经济学作业:弹性系数 ε=∂lnL/∂lnN、∂lnL/∂lnQ 逐个算出来,回答"同样加一倍算力,堆参数还是提质量划算",并推导"质量提升 0.1 等价于参数增加多少"的解析条件(令 A·ΔN−α 与质量项的增量相等即可解出 ΔN)。领域间的替代/互补用交叉弹性讨论。
问题3(预算优化与结构性转移):总成本三件套——基础训练 Ctrain=6ND、质量提升 CQ=D·[g(Q)−g(Q0)]+(三类成本函数:指数型 γ=107,λ=6.0;幂函数型 γ=5×109,λ=4.0;对数渐进型 γ=2×109,λ=10.0)、长文本注意力 Cattn=ηND·Lctx(η=2×10−4,Lctx 外生给定、可行值依据 C7,不是寻优变量)。在 C≤1019、1022、1024 FLOPs 三档下最小化由问题 1、2 得到的损失函数,KKT 条件一写,"低预算先顾温饱(堆 D)、高预算讲究生活质量(提 Q)"的直觉会自己浮现。两个解析考点别丢:临界上下文 Lctxcrit=6/η=3×104——超过 3 万 token,注意力开销就反超基础训练开销,须在可行取值上做敏感性分析;结构性转移要给数学定义(如最优解 active set 变化、拉格朗日乘子排序颠倒、目标函数分段拟合的断点)与识别方法(预算扫描 + 断点检测),不能只讲故事。三类 g(Q) 的曲率差异对最优解的影响,正适合做成对比实验。
问题4(技术演进分解与前沿预测):回到经济增长核算的经典套路——索洛残差。用附件 C 的开源榜单数据(参数量、提交日期、许可证、模型类型、六项基准得分),把能力增长拆成"规模扩张贡献"与"非规模技术进步贡献":回归 log(能力) ~ a·log(算力) + 时间趋势,趋势项就是技术进步;或建动力学模型 dA/dt 分项量化。桥接环节:前三问的 Loss 要翻译成榜单分数,用 C5/C6 的 Loss–Benchmark 桥接数据(自带可比性等级字段,须按等级区分使用)或可核验文献建立映射,并讨论映射误差的影响。预测未来 12/24 个月的前沿边界须附不确定性分析(bootstrap 置信带或多情景推演),且三套口径声明缺一不可:开源筛选规则(权重是否开源、许可证是否允许复现)、模型类型(pretrained 基础模型 vs chat/finetuned)、时间轴(提交/发布/版本日期)。