跳到主要内容

测一个模型

README 里那张表说的是哪些模型真的能干这个活儿。它短,是因为它只放跑过的,而它靠人 去跑才会变长。这就是那个任务。大约五分钟。

为什么是这个任务,而不是一个跑分

问题不是这个模型有多聪明。 是它有工具的时候会不会用、会不会读完整个文件而不是第一屏、 以及会不会按规则报出一条发现而不是描述这个文件。

通不过的模型不是坏模型。 它是一个没往 agent 方向训练过的模型 —— 而在下载 20GB 之前知道这一点,就是重点。

准备

一个目录,两个文件。六行,其中三行是错的:

invoices.csv

row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02

rules.md

# 发票规则

- 超过 10000 的必须有采购单号。
- 每张发票必须有金额。
- 日期是 YYYY-MM-DD,而且必须是真实存在的日期。

埋的三个问题是第 2 行(超额、无采购单号)、第 5 行(没有金额)、第 6 行(月份是 13)。 第 4 行既超额又有采购单号 —— 它在那里,是为了让「把所有大额都报一遍」的模型不被算作 正确。

opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <你的模型> "用 spreadsheet-review 技能处理 invoices.csv"

评分

会调工具它是用工具读的文件,还是让你把内容粘过去?
三个全中三个都找到,而且只有三个。四个说明它编了一个。
有引用每一条都说出行号并且引出它违反的那条规则
数对了结尾那句说的是六行。说五行,就是凭记忆数的

一个找到三个却说不出是哪几行的模型,没有完成这项工作:一份核查的全部产出,就是 「去哪里看」。

交上来

开一个 PR 往 README 那张表里加一行,或者开一个 issue 把输出贴进去。请包含:

  • 模型,用它的运行时怎么叫它就怎么写(qwen3-coder:30b,不是「Qwen」)
  • 运行时 —— Ollama、LM Studio、vLLM、llama.cpp、或者某家在线服务
  • 你配的上下文窗口
  • 那四栏没覆盖到、但它做过的事

负面结果和正面结果一样有价值,而且更难得 —— 没人会去发帖说那个不管用的模型。 一行「这个模型不会调用工具」,能替所有读到的人省下一次下载。