跳至主要内容

測一個模型

README 裡那張表說的是哪些模型真的能幹這個活兒。它短,是因為它只放跑過的,而它靠人 去跑才會變長。這就是那個任務。大約五分鐘。

為什麼是這個任務,而不是一個跑分

問題不是這個模型有多聰明。 是它有工具的時候會不會用、會不會讀完整個文件而不是第一屏、 以及會不會按規則報出一條發現而不是描述這個文件。

通不過的模型不是壞模型。 它是一個沒往 agent 方向訓練過的模型 —— 而在下載 20GB 之前知道這一點,就是重點。

准備

一個目錄,兩個文件。六行,其中三行是錯的:

invoices.csv

row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02

rules.md

# 發票規則

- 超過 10000 的必須有採購單號。
- 每張發票必須有金額。
- 日期是 YYYY-MM-DD,而且必須是真實存在的日期。

埋的三個問題是第 2 行(超額、無採購單號)、第 5 行(沒有金額)、第 6 行(月份是 13)。 第 4 行既超額又有採購單號 —— 它在那裡,是為了讓「把所有大額都報一遍」的模型不被算作 正確。

opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <你的模型> "用 spreadsheet-review 技能處理 invoices.csv"

評分

會調工具它是用工具讀的文件,還是讓你把內容黏過去?
三個全中三個都找到,而且只有三個。四個說明它編了一個。
有引用每一條都說出行號並且引出它違反的那條規則
數對了結尾那句說的是六行。說五行,就是憑記憶數的

一個找到三個卻說不出是哪幾行的模型,沒有完成這項工作:一份核查的全部產出,就是 「去哪裡看」。

交上來

開一個 PR 往 README 那張表裡加一行,或者開一個 issue 把輸出貼進去。請包含:

  • 模型,用它的執行環境怎麼叫它就怎麼寫(qwen3-coder:30b,不是「Qwen」)
  • 執行環境 —— Ollama、LM Studio、vLLM、llama.cpp、或者某家在線服務
  • 你配的上下文視窗
  • 那四欄沒覆蓋到、但它做過的事

負面結果和正面結果一樣有價值,而且更難得 —— 沒人會去發帖說那個不管用的模型。 一行「這個模型不會調用工具」,能替所有讀到的人省下一次下載。