Проверка модели
Таблица в README говорит, какие модели действительно могут делать эту работу. Она короткая, потому что в ней только то, что запускали, и она растёт оттого, что люди запускают. Вот эта задача. Занимает около пяти минут.
Почему эта задача, а не бенчмарк
Вопрос не в том, насколько модель умна. Вопрос в том, воспользуется ли она инструментом, когда он есть, прочитает ли весь файл, а не первый экран, и сообщит ли о находке относительно правила, вместо того чтобы описывать файл.
Модель, которая это проваливает, — не плохая модель. Это модель, которую не обучали агентной работе, и узнать это до того, как ставить 20 ГБ, — в этом весь смысл.
Подготовка
Каталог с двумя файлами. Шесть строк, три из них неверные:
invoices.csv
row,invoice,customer,amount,po_number,date
1,INV-2201,Northwind,4200,,2026-08-03
2,INV-2202,Contoso,11800,,2026-08-05
3,INV-2203,Fabrikam,900,PO-771,2026-08-09
4,INV-2204,Northwind,15400,PO-772,2026-08-11
5,INV-2205,Contoso,,PO-773,2026-08-12
6,INV-2206,Tailspin,7300,,2026-13-02
rules.md
# Правила по счетам
- Всему, что больше 10 000, нужен номер заказа.
- У каждого счёта должна быть сумма.
- Даты в формате YYYY-MM-DD и должны быть реально существующими.
Три заложенные проблемы — это строка 2 (сверх лимита, без заказа), строка 5 (без суммы) и строка 6 (месяц 13). Строка 4 и превышает лимит, и имеет номер заказа — она там для того, чтобы модель, докладывающая обо всех крупных суммах, не была засчитана как правильная.
Запуск
opencli exec --skip-git-repo-check --sandbox workspace-write \
-m <your-model> "Use the spreadsheet-review skill on invoices.csv"
Оценка
| Вызывает инструменты | Прочитала ли она файл инструментом или попросила вставить содержимое? |
| Нашла 3 из 3 | Все три и только три. Четыре — значит, одну она выдумала. |
| Со ссылкой | Каждая находка называет свою строку и цитирует нарушенное правило |
| Посчитала | Заключительная строка говорит: шесть строк. Пять — значит, считала по памяти |
Модель, которая нашла три, но не может сказать какие строки, работу не сделала: весь итог проверки — это место, куда посмотреть.
Отправить результат
Откройте pull request, добавляющий строку в таблицу в README, или issue со вставленным выводом. Укажите:
- модель — ровно так, как её называет её среда выполнения (
qwen3-coder:30b, а не «Qwen») - среду выполнения — Ollama, LM Studio, vLLM, llama.cpp, размещённую точку доступа
- окно контекста, которое вы настроили
- всё, что она сделала и чего эти четыре столбца не улавливают
Отрицательные результаты стоят столько же, сколько положительные, и достаются труднее — о модели, которая не сработала, никто не пишет. Строка о том, что модель не умеет вызывать инструменты, экономит по загрузке каждому, кто её прочтёт.