Перейти к основному содержимому

Проверка модели

Таблица в README говорит, какие модели действительно могут делать эту работу. Она короткая, потому что в ней только то, что запускали, и она растёт оттого, что люди запускают. Вот эта задача. Занимает около пяти минут.

Почему эта задача, а не бенчмарк

Вопрос не в том, насколько модель умна. Вопрос в том, воспользуется ли она инструментом, когда он есть, прочитает ли весь файл, а не первый экран, и сообщит ли о находке относительно правила, вместо того чтобы описывать файл.

Модель, которая это проваливает, — не плохая модель. Это модель, которую не обучали агентной работе, и узнать это до того, как ставить 20 ГБ, — в этом весь смысл.

Подготовка

Каталог с двумя файлами. Шесть строк, три из них неверные:

invoices.csv

row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02

rules.md

# Правила по счетам

- Всему, что больше 10 000, нужен номер заказа.
- У каждого счёта должна быть сумма.
- Даты в формате YYYY-MM-DD и должны быть реально существующими.

Три заложенные проблемы — это строка 2 (сверх лимита, без заказа), строка 5 (без суммы) и строка 6 (месяц 13). Строка 4 и превышает лимит, и имеет номер заказа — она там для того, чтобы модель, докладывающая обо всех крупных суммах, не была засчитана как правильная.

Запуск

opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <your-model> "Use the spreadsheet-review skill on invoices.csv"

Оценка

Вызывает инструментыПрочитала ли она файл инструментом или попросила вставить содержимое?
Нашла 3 из 3Все три и только три. Четыре — значит, одну она выдумала.
Со ссылкойКаждая находка называет свою строку и цитирует нарушенное правило
ПосчиталаЗаключительная строка говорит: шесть строк. Пять — значит, считала по памяти

Модель, которая нашла три, но не может сказать какие строки, работу не сделала: весь итог проверки — это место, куда посмотреть.

Отправить результат

Откройте pull request, добавляющий строку в таблицу в README, или issue со вставленным выводом. Укажите:

  • модель — ровно так, как её называет её среда выполнения (qwen3-coder:30b, а не «Qwen»)
  • среду выполнения — Ollama, LM Studio, vLLM, llama.cpp, размещённую точку доступа
  • окно контекста, которое вы настроили
  • всё, что она сделала и чего эти четыре столбца не улавливают

Отрицательные результаты стоят столько же, сколько положительные, и достаются труднеео модели, которая не сработала, никто не пишет. Строка о том, что модель не умеет вызывать инструменты, экономит по загрузке каждому, кто её прочтёт.