BENCHMARK / DASHBOARD
模型测试档案▋
// 从延迟到作品表现,比较你真正拿到的模型能力。
模型档案00个地址 / Key / 模型组合
累计测试00每轮独立保留
运行队列00最多 2 个模型并发
测试方案04可扩展 · 固定提示词
## 测试记录 0
$ lab.run --your-model
第一份模型档案,从一次测试开始。
填入地址、Key 和模型,选择测试方案。
作品、延迟和完整回答会一起留在这里。
PROTOCOLS / VERSIONED
测试方案库▋
// 内置方案保持题目一致,自定义方案自动加入结果表格。
README / EVALUATION
读懂测试结果▋
// 每一个指标,都应该能解释它是怎么得到的。
01 / 四类证据
- 鹈鹕骑车
- 观察长喙与喉囊、骑乘关系、轮子与脚踏协调、循环动画。模型生成页面可预览,视觉质量由你评分。
- 贪吃蛇
- 实际检查键盘与手机控制、计分、暂停、重启、碰撞、禁止反向移动和食物位置。生成成功不代表游戏功能正确。
- 客观推理
- 5 道自编题:排序、求和、路径计数、逻辑蕴含、顺序去重。按正确项比例计分。
- 指令遵循
- 4 条可核验约束:严格 JSON、键集合、标题、数组顺序与数字类型(数组和数字分项核验)。不是官方 IFEval 分数。
02 / 时间与分数
首字延迟 TTFT:发出请求到收到第一段正文,不含隐藏推理。总耗时:到响应结束。非流式接口只记录总耗时。tokens/s:只有上游返回 completion_tokens 才计算,缺少用量不会伪造速度。位置:展开档案 → 每轮详情。
表格的客观正确率只统计本轮客观方案。失败或未返回答案的客观题计 0 分;视觉测试的人工评分独立显示。输出到达 Token 上限会标记“可能截断”。
03 / 如何公平比较
保持相同方案版本、输出上限、温度和流式设置。单次结果会波动,可以重测并检查历史。首字和耗时测量发生在狗云服务器,与你电脑到接口的延迟不同。提示词全部可查看。
这是一套个人轻量能力探针。表现好坏、接口返回的模型名,都不能证明上游使用的真实模型身份。它也不等同于标准化 IQ 测量。
04 / 研究依据
LiveBench ↗ 的客观真值与多维任务,IFEval ↗ 的可验证指令约束,HumanEval ↗ 的功能正确性思路。本台使用自编题目,不复制官方榜单分数。
05 / 下一步可审核的功能
配对盲评、相同参数三轮稳定性对比、可信基准回答对照、模型单价与成本估算。需要你确认后加入。