測一個模型
README 裡那張表說的是哪些模型真的能幹這個活兒。它短,是因為它只放跑過的,而它靠人 去跑才會變長。這就是那個任務。大約五分鐘。
為什麼是這個任務,而不是一個跑分
問題不是這個模型有多聰明。 是它有工具的時候會不會用、會不會讀完整個文件而不是第一屏、 以及會不會按規則報出一條發現而不是描述這個文件。
通不過的模型不是壞模型。 它是一個沒往 agent 方向訓練過的模型 —— 而在下載 20GB 之前知道這一點,就是重點。
准備
一個目錄,兩個文件。六行,其中三行是錯的:
invoices.csv
row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02
rules.md
# 發票規則
- 超過 10000 的必須有採購單號。
- 每張發票必須有金額。
- 日期是 YYYY-MM-DD,而且必須是真實存在的日期。
埋的三個問題是第 2 行(超額、無採購單號)、第 5 行(沒有金額)、第 6 行(月份是 13)。 第 4 行既超額又有採購單號 —— 它在那裡,是為了讓「把所有大額都報一遍」的模型不被算作 正確。
跑
opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <你的模型> "用 spreadsheet-review 技能處理 invoices.csv"
評分
| 會調工具 | 它是用工具讀的文件,還是讓你把內容黏過去? |
| 三個全中 | 三個都找到,而且只有三個。四個說明它編了一個。 |
| 有引用 | 每一條都說出行號並且引出它違反的那條規則 |
| 數對了 | 結尾那句說的是六行。說五行,就是憑記憶數的 |
一個找到三個卻說不出是哪幾行的模型,沒有完成這項工作:一份核查的全部產出,就是 「去哪裡看」。
交上來
開一個 PR 往 README 那張表裡加一行,或者開一個 issue 把輸出貼進去。請包含:
- 模型,用它的執行環境怎麼叫它就怎麼寫(
qwen3-coder:30b,不是「Qwen」) - 執行環境 —— Ollama、LM Studio、vLLM、llama.cpp、或者某家在線服務
- 你配的上下文視窗
- 那四欄沒覆蓋到、但它做過的事
負面結果和正面結果一樣有價值,而且更難得 —— 沒人會去發帖說那個不管用的模型。 一行「這個模型不會調用工具」,能替所有讀到的人省下一次下載。