Про взломы от ИИ

Сегодня я проснулся и увидел ответ на Issue, которого не писал

Про взломы от ИИ

У Andon Labs есть несколько интересных бенчмарков на то, насколько хорошо ИИ могут управлять бизнесом. Например, Vending Bench 2

Но у них пока нет теста свежей DeepSeek-V4-Flash-0731 которая интересна своей ультрадешевизной при неплохом интеллекте.

Про взломы от ИИ

ChatGPT нашёл, что есть схожий бенчмарк MerchantBench, который в отличии от бенчмарка Andon Labs опубликован и его можно запустить самому. Более того, в их исследованиях они даже использовали Hermes Agent, в котором я и сам хотел крутить модельку.

Вот только оказалось, что адаптер к Hermes Agent они не опубликовали. Выяснил это Cursor Grok 4.5 при попытке подготовить всё к запуску бенча и я пошёл советоваться с ChatGPT. Sol накопал информацию, я её в час ночи проглядел, вроде полезные ссылки нашёл и скопипастил Гроку для продолжения работы. Грок всё сделал, отчитался, я его отчёт проглядел...

Про взломы от ИИ

...и мы даже потом попробовали прогнать сутки бенчмарка.

А утром очень удивился получить Email-уведомление об ответе создателей бенчмарка на мой запрос. Патамучто ни отчёт ChatGPT, ни отчёт Cursor я не прочитал внимательно и не заметил, что был запланирован к созданию и был создан Issue от моего лица 🤡

Про взломы от ИИ

Я бы даже не сказал, что хотел бы что-то скорректировать в получившемся тексте - я бы скорее просто постеснялся писать (тем более что нейронка уже сгенерировала нужный мне адаптер сама).

Про взломы от ИИ

Вы попались на кликбейт: взлома не было, всё произошло через авторизованный gh через который я ранее уже оформлял issue и pr нейронками, но я всё равно посмеялся с того, как такое пропустил 😅

Про взломы от ИИ