본문으로 건너뛰기

모델 시험하기

README의 그 표는 어떤 모델이 실제로 이 일을 할 수 있는지를 말합니다. 짧은 이유는 돌려 본 것만 담기 때문이고, 사람들이 돌려 봄으로써 길어집니다. 이것이 그 과제입니다. 약 5분.

왜 벤치마크가 아니라 이 과제인가

묻는 것은 모델이 얼마나 똑똑한가가 아닙니다. 도구가 있을 때 그것을 쓰는지, 첫 화면이 아니라 파일 전체를 읽는지, 그리고 파일을 설명하는 대신 규칙에 비추어 발견을 보고하는지입니다.

여기서 떨어지는 모델은 나쁜 모델이 아닙니다. 에이전트 쪽으로 훈련되지 않은 모델입니다 —— 그리고 20GB를 내려받기 전에 그걸 아는 것이 핵심입니다.

준비하기

디렉터리 하나에 파일 둘. 여섯 줄, 그중 셋이 틀렸습니다:

invoices.csv

row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02

rules.md

# 청구서 규칙

- 10,000 을 넘는 것에는 발주 번호가 있어야 한다.
- 모든 청구서에는 금액이 있어야 한다.
- 날짜는 YYYY-MM-DD 이고 실제 있는 날짜여야 한다.

심어 둔 문제는 셋: 2행(한도 초과, 발주 번호 없음), 5행(금액 없음), 6행(13월). 4행은 한도를 넘고 동시에 발주 번호가 있습니다 —— 큰 금액을 전부 보고하는 모델이 정답으로 채점되지 않도록 거기 둔 것입니다.

돌리기

opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <your-model> "Use the spreadsheet-review skill on invoices.csv"

채점하기

도구를 부르는가도구로 파일을 읽었는가, 아니면 내용을 붙여 달라고 했는가?
3/3 을 찾았는가셋 다, 그리고 셋만. 넷이면 하나를 지어낸 것입니다.
인용했는가각 발견이 행 번호를 대고 또한 어긴 규칙을 인용하는가
셌는가마무리 줄이 여섯 줄이라고 말한다. 다섯이면 기억으로 센 것입니다

셋을 찾고도 어느 줄인지 말하지 못하는 모델은 일을 한 게 아닙니다: 검토의 산출물 전부가 「어디를 볼지」입니다.

보내기

README의 표에 한 줄 더하는 풀 리퀘스트를, 또는 출력을 붙인 이슈를 열어 주세요. 넣을 것:

  • 모델 이름을 그 런타임이 부르는 그대로 정확히(qwen3-coder:30b, 「Qwen」이 아니라)
  • 런타임 —— Ollama, LM Studio, vLLM, llama.cpp, 호스팅 엔드포인트
  • 당신이 설정한 컨텍스트 창
  • 네 칸이 담지 못한, 그 모델이 한 일

부정적 결과는 긍정적 결과와 같은 값어치가 있고, 얻기는 더 어렵습니다 —— 되지 않은 모델에 대해서는 아무도 글을 쓰지 않으니까요. 「이 모델은 도구를 부르지 못한다」는 한 줄이, 읽는 모든 사람의 다운로드 한 번을 아껴 줍니다.