Про взломы от ИИ
Сегодня я проснулся и увидел ответ на Issue, которого не писал
У Andon Labs есть несколько интересных бенчмарков на то, насколько хорошо ИИ могут управлять бизнесом. Например, Vending Bench 2
Но у них пока нет теста свежей DeepSeek-V4-Flash-0731 которая интересна своей ультрадешевизной при неплохом интеллекте.
ChatGPT нашёл, что есть схожий бенчмарк MerchantBench, который в отличии от бенчмарка Andon Labs опубликован и его можно запустить самому. Более того, в их исследованиях они даже использовали Hermes Agent, в котором я и сам хотел крутить модельку.
Вот только оказалось, что адаптер к Hermes Agent они не опубликовали. Выяснил это Cursor Grok 4.5 при попытке подготовить всё к запуску бенча и я пошёл советоваться с ChatGPT. Sol накопал информацию, я её в час ночи проглядел, вроде полезные ссылки нашёл и скопипастил Гроку для продолжения работы. Грок всё сделал, отчитался, я его отчёт проглядел...
...и мы даже потом попробовали прогнать сутки бенчмарка.
А утром очень удивился получить Email-уведомление об ответе создателей бенчмарка на мой запрос. Патамучто ни отчёт ChatGPT, ни отчёт Cursor я не прочитал внимательно и не заметил, что был запланирован к созданию и был создан Issue от моего лица 🤡
Я бы даже не сказал, что хотел бы что-то скорректировать в получившемся тексте - я бы скорее просто постеснялся писать (тем более что нейронка уже сгенерировала нужный мне адаптер сама).
Вы попались на кликбейт: взлома не было, всё произошло через авторизованный gh через который я ранее уже оформлял issue и pr нейронками, но я всё равно посмеялся с того, как такое пропустил 😅