icon
Personal Website

Кодить каждую неделю 8 часов • 2026-07-19

Сравнение AI моделей в конкретной ситуации

Задумал провести code review для моего проекта с помощью LLM. На этот раз эксперимент был с проектом, который я писал на заказ по моей платной работе. Задача LLM была такая: проверить каждый файл. При необходимости: читать связанные файлы, чтобы лучше понять контекст. На каждый файл запускался отдельный агент, ибо в локальном варианте экономить токены не нужно 👌 Поначалу я не знал, чего ожидать. Но после завершения процесса меня привлёк один конкретный кусок кода: показан🖼️на приложенном скриншоте.

Код, в целом, корректный: пытаемся что-то сделать, а если не получилось - кидаем последний Exception. Вызываем onSuccess() только для успешных операций. Но некоторые AI-модели здесь споткнулись:

  • Qwen 3.6 27B 🔴
    • Cразу выдал критическое замечание, даже не прочитав код функции retryWithCatch()
  • Qwen 3.5 27b Claude Opus 4.6 reasoning distilled 🔴
    • Прочитал код retryWithCatch(), но выдал критическое замечание. Прочитал и не понял? Хм…
  • Gemma 4 31B QAT 🟢
    • Прочитал код retryWithCatch(), всё ОК. Работает медленно, но тщательно
  • Qwen 3.6 35B A3B 🟢
    • Прочитал код retryWithCatch(), всё ОК. Работает быстро, ошибается тоже быстро…

Как видим, Qwen 27B имеет некоторые проблемы с пониманием кода… Думаю, человек в этой ситуации мог бы легко сделать такую же ошибку из-за невнимательности: мельком глянуть код, и подумать, что onSuccess() после retryWithCatch() отмечает все операции без разбора как “успешные” 🥴

При этом, Qwen 27B имеет высокую оценку в бенчмарке Artificial Analysis Intelligence Index 🤔💭 Но на мой взгляд, логика у двух других моделей из списка идёт получше. Впрочем, ничего удивительного - ведь у них больше параметров: 27B < 31B < 35B

Остальной кодинг в свободное время

Кроме теста LLM, делал на прошлой неделе ещё такие вещи по моим проектам в свободное время:

  1. Новый рефакторинг персонального веб-сайта: убрал промежуточный веб-сервер для генерации статического HTML контента. Лишнего кода станет чуть меньше - это хорошо…
  2. Настройка песочницы для pi.dev: запуск без доступа в интернет. Доступ к локальной файловой системе тоже ограничен: только одна папка с проектом. Дотянуться до других файлов агент теперь не сможет, даже если захочет…

P.S.: Главный разработчик в команде заказчика сказал, что AI code review - теперь обязательная стадия разработки для каждой фичи. Причём, делать это надо сразу, ещё до открытия PR: сам пишешь код, сам запускаешь LLM, сам читаешь и исправляешь замечания 💻🧐 Лишь после этого открываешь PR, а человеку, читающему твой код - остаётся только проверить, стоит ли галочка “прошло проверку в LLM” ☑️🛫