测一个模型
README 里那张表说的是哪些模型真的能干这个活儿。它短,是因为它只放跑过的,而它靠人 去跑才会变长。这就是那个任务。大约五分钟。
为什么是这个任务,而不是一个跑分
问题不是这个模型有多聪明。 是它有工具的时候会不会用、会不会读完整个文件而不是第一屏、 以及会不会按规则报出一条发现而不是描述这个文件。
通不过的模型不是坏模型。 它是一个没往 agent 方向训练过的模型 —— 而在下载 20GB 之前知道这一点,就是重点。
准备
一个目录,两个文件。六行,其中三行是错的:
invoices.csv
row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02
rules.md
# 发票规则
- 超过 10000 的必须有采购单号。
- 每张发票必须有金额。
- 日期是 YYYY-MM-DD,而且必须是真实存在的日期。
埋的三个问题是第 2 行(超额、无采购单号)、第 5 行(没有金额)、第 6 行(月份是 13)。 第 4 行既超额又有采购单号 —— 它在那里,是为了让「把所有大额都报一遍」的模型不被算作 正确。
跑
opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <你的模型> "用 spreadsheet-review 技能处理 invoices.csv"
评分
| 会调工具 | 它是用工具读的文件,还是让你把内容粘过去? |
| 三个全中 | 三个都找到,而且只有三个。四个说明它编了一个。 |
| 有引用 | 每一条都说出行号并且引出它违反的那条规则 |
| 数对了 | 结尾那句说的是六行。说五行,就是凭记忆数的 |
一个找到三个却说不出是哪几行的模型,没有完成这项工作:一份核查的全部产出,就是 「去哪里看」。
交上来
开一个 PR 往 README 那张表里加一行,或者开一个 issue 把输出贴进去。请包含:
- 模型,用它的运行时怎么叫它就怎么写(
qwen3-coder:30b,不是「Qwen」) - 运行时 —— Ollama、LM Studio、vLLM、llama.cpp、或者某家在线服务
- 你配的上下文窗口
- 那四栏没覆盖到、但它做过的事
负面结果和正面结果一样有价值,而且更难得 —— 没人会去发帖说那个不管用的模型。 一行「这个模型不会调用工具」,能替所有读到的人省下一次下载。