DuctGPT: как ИИ перестал гадать и начал считать физику сплавов

DuctGPT: ИИ, который понимает физику, а не статистику. Разбираем архитектуру и риски
DuctGPT: ИИ, который понимает физику, а не статистику. Разбираем архитектуру и риски

Когда ChatGPT — не панецея: почему стандартные LLM буквально врут про реальный мир

Берём конкретный кейс. Я прошу ChatGPT подобрать сплав на основе вольфрама — чтобы держал 2000°C, был пластичным, а не хрупким как стекло, и желательно с титаном в составе. Ответ выглядит убедительно: «Рекомендую W-Ti-Zr с ОЦК-структурой, температура плавления около 2100°C». Звучит как дипломная работа. А теперь проверяем.

Фазовая диаграмма W-Ti-Zr говорит обратное: при таких пропорциях вы получите интерметаллидную кашу, которая рассыплется при первой же нагрузке. ChatGPT не врёт намеренно — он вообще не знает, что такое фазовая диаграмма. Он предсказал статистически правдоподобную последовательность токенов на основе статей, где обсуждались эти элементы по отдельности. Дело не просто в галлюцинациях — всё куда запущеннее.

Стандартные LLM — это автокоррекция на стероидах. Модель не моделирует физический мир. Она моделирует тексты о физическом мире. Разница колоссальная. Когда я прошу предсказать предел текучести нового композита, мне нужен не средневзвешенный ответ из похожих абстрактов на arXiv. Мне нужна цифра, которая не убьёт прототип.

Вот где собака-то и зарыта. В инженерном дизайне материалов цена ошибки — не кривой абзац, который можно переписать. Это месяцы работы, сожжённые образцы и бюджет, улетевший в трубу. Ты не можешь позволить себе «примерно похоже». Тебе нужен forward design: задаёшь желаемые свойства — получаешь состав и технологические режимы, которые реально работают.

ChatGPT с этим справляется на уровне «ну вы держитесь». Я гонял его на задачах по правилу фаз Гиббса — он выдаёт формулы, но путает степени свободы уже на трёхкомпонентной системе. Почему? Потому что в обучающем корпусе было больше кулинарных рецептов, чем термодинамических расчётов. Статистический перекос.

Именно поэтому появляются специализированные архитектуры вроде DuctGPT. Они не пытаются объять необъятное — вместо этого скрещивают языковую модель с физическим симулятором. Модель работает как интерфейс на естественном языке, а расчёты идут на движке, который реально интегрирует уравнения состояния. Не «похоже на правду», а «совпадает с экспериментом».

Кому-то это кажется нишевой историей. Но когда речь о тугоплавких сплавах для аэрокосмоса, ставки совсем другие. Там нельзя сказать «извините, галлюцинация».

Идея DuctGPT: скрестить трансформер с симулятором, чтобы ИИ «почувствовал» сопротивление материала

Всё оказывается на удивление просто. Вместо того чтобы скармливать модели горы научных статей и надеяться, что она вызубрит физику, ей дают в руки калькулятор. В данном случае — физический симулятор.

DuctGPT задуман не как генератор текста, а как диалоговый слой над движком, который честно обсчитывает межатомные взаимодействия. Вы пишете модели на естественном языке: «Найди мне сплав на основе вольфрама, чтобы был пластичным при высоких температурах и не разваливался». Модель не шарит по интернету в поисках похожих статей, а запускает цепочку симуляций, перебирая комбинации титана, циркония и гафния.

В этом и есть главный перелом: модель больше не гадает на основе статистики, а напрямую запускает физические симуляции, просто следуя текстовой команде.

Я бы сравнил это с тем, как если бы вы дали ChatGPT не доступ к Википедии, а доступ к MATLAB с полным набором тулбоксов. Модель не вспоминает, что «похожие задачи решали так-то». Она формулирует запрос к движку, получает численный результат и интерпретирует его обратно в человеческий язык. Никаких галлюцинаций про несуществующие свойства материалов — либо симуляция сошлась, либо нет.

Разработчики из Ames Laboratory пошли ещё дальше. Они заточили трансформер под конкретный класс задач — поиск пластичных тугоплавких многоосновных сплавов (ductile refractory MPEAs). Это не general-purpose болталка. Это domain-specific инструмент, который знает контекст: какие элементы вообще имеет смысл перебирать, какие диапазоны концентраций физически осмысленны, на какие параметры симуляции обращать внимание.

А теперь — самая интересная часть. Заявлено, что DuctGPT радикально сокращает время с месяцев до дней или даже часов. Причём на обычном настольном компьютере, без суперкомпьютерных кластеров. Если это правда (а проверить пока не на чем — открытого бенчмарка нет), то мы говорим о снижении порога входа в материаловедение на порядок.

Раньше чтобы перебрать сотню комбинаций легирующих элементов для тугоплавкого сплава, вам нужна была команда PhD-шников, лицензия на софт вроде VASP и пара месяцев расчётов. Теперь — текстовый промпт и чашка кофе, пока крутится симуляция.

Понятно, что есть нюансы. Где граница между «модель понимает физику» и «модель дёргает API симулятора» — вопрос открытый. В пресс-релизах звучит красиво, но под капотом это скорее оркестратор: трансформер разбирает intent пользователя, генерирует конфигурации для симулятора, запускает их и агрегирует результаты. Физику «понимает» движок, а не сама нейронка.

Но с практической точки зрения это не важно. Важно, что схема работает и даёт результат там, где чистые LLM врут как дышат.

Как это работает под капотом: архитектура, которая экономит месяцы работы на обычном ПК

Разработчики не стали изобретать велосипед с нуля. DuctGPT — это проблемно-ориентированная модель на базе классического трансформера, заточенная под конкретный класс задач: поиск пластичных тугоплавких многоосновных сплавов (MPEAs). Никакой магии, никакого AGI в коробке. Просто грамотная инженерная сборка.

Трансформер здесь выступает в роли умного диспетчера. Он не «думает» над физикой — он понимает ваш запрос на естественном языке, декомпозирует его на серию вычислительных экспериментов и интерпретирует результаты симулятора обратно в человеческий ответ. По сути, это оркестратор между вами и физическим движком.

Схема примерно такая:

Вы пишете: «Найди сплав на основе вольфрама с добавлением титана и циркония, чтобы был пластичным при высоких температурах». Модель не пытается угадать ответ на основе的训练 данных — она генерирует конфигурации для симулятора, запускает расчёты и возвращает вам осмысленный результат. Симулятор считает реальные термодинамические параметры, модель лишь интерпретирует цифры.

И вот тут самое вкусное — производительность. Разработчики заявляют, что поиск сокращается с месяцев до дней или даже часов. Месяцев, Карл! Если вы хоть раз ждали результатов DFT-расчётов на кластере, вы понимаете масштаб.

Но вишенка на торте — системные требования. Вся эта мощь не требует кластера с GPU на сотню тысяч долларов. DuctGPT способен работать на обычном настольном компьютере. Не на игровом монстре с RTX 4090 — на обычной рабочей станции.

По-моему, это здоровенный булыжник в огород классических HPC-систем, на которых считают только в больших лабораториях. Серьёзно, я видел ребят, которые арендуют время на суперкомпьютерах ради подбора состава сплава. А тут тебе говорят: «Запускай на своём десктопе».

Как именно они добились такой оптимизации — открытый вопрос. В пресс-релизах деталей кот наплакал. Возможно, используется дистилляция модели и квантование. Возможно, симулятор оперирует упрощёнными потенциалами вместо полноценных DFT-расчётов. Но факт остаётся фактом: заявленная производительность впечатляет.

Отдельно отмечу диалоговый режим взаимодействия. Никакого программирования, никаких скриптов на Python для запуска симуляций. Вы общаетесь с моделью как с коллегой-материаловедом, только этот коллега способен за час перебрать комбинации, на которые у вас ушёл бы квартал.

Где палево: разбираем реальные риски и размытость маркетинговых формулировок

А теперь без прикрас. Самое важное начнётся после того, как вы копнёте глубже заявлений о «понимании физики».

В открытых источниках пока кот наплакал конкретных цифр. Я перерыл всё, что нашлось по DuctGPT — и знаете что? Мы не знаем ни точности предсказаний в процентах, ни объёма датасета для обучения, ни даже количества параметров модели. Вообще. Ames Laboratory упоминается в новостях, но никаких технических деталей — ни тебе perplexity, ни размерности эмбеддингов. Это серьёзный звоночек. Когда вам показывают красивую демку без метрик — держите руку на кошельке.

Второй нюанс — само понятие «понимания». А вот тут кроется самый занятный момент.

Если модель просто дёргает API внешнего симулятора, это не понимание физики, а грамотное использование костыля. Это как сказать, что калькулятор понимает математику. Разница принципиальная: одно дело — когда модель сама вывела закон Гука из данных, и совсем другое — когда она просто подставила цифры в заранее написанный человеком код.

Пока что, судя по интеграции с фреймворками вроде AtomAgents, мы имеем дело именно со вторым сценарием. Мультиагентная система, где LLM выступает оркестратором, а физику считает старый добрый софт с упрощёнными потенциалами. Я не говорю, что это плохо — наоборот, рабочий подход. Но называть это «ИИ понимает сопротивление материала» — маркетинговая натяжка.

По-моему, настоящее понимание физики выглядит иначе: модель учится на голых данных молекулярной динамики, а потом сама предсказывает, как поведёт себя незнакомый материал — безо всяких внешних симуляторов. А то, что мы видим сейчас — скорее умный интерфейс к проверенным инженерным инструментам. Спорное решение, но для ускорения перебора комбинаций — самое то.

Поэтому когда в следующий раз увидите кричащий заголовок про очередную революцию в материаловедении — не спешите верить на слово. Поэтому в следующий раз, когда увидите кричащий заголовок про очередную революцию в материаловедении, — притормозите. Спросите себя: а где тут нейросеть, а где обычный софт, который инженеры гоняли ещё десять лет назад? И главное — ищите цифры. Без них любая громкая история остаётся просто громкой историей.

Итог: кому это реально зайдет и когда ждать релиза

DuctGPT — это не просто очередной хайп, под который пилят бюджеты. Это реальный симптом. По нему видно, куда дрейфует вся тема новых материалов. И катится оно в сторону, где один инженер с десктопом сможет делать работу, на которую раньше сажали команду из пяти PhD-шников на полгода. Я лично очень жду этой демократизации.

Кому это зайдет прямо сейчас — или в момент релиза — так это R&D-отделам средних контор. Тем, кто не может позволить себе ни кластер на тысячу ядер, ни армию расчётчиков для метода Монте-Карло. У тебя есть задача: перебрать 2000 комбинаций тугоплавких сплавов на основе вольфрама с титаном, цирконием и гафнием. Раньше ты бы нанимал людей, писал скрипты, ждал неделями. С DuctGPT ты формулируешь задачу в чате и через пару дней — а то и часов — получаешь список кандидатов. Без единой строчки кода.

Это реально круто. Спорно, сыро, но круто.

Однако я бы не стал пока бежать внедрять это в production, где ставки высоки. Инструмент больше похож на умную обёртку над классическими симуляторами. Не на прорывной ИИ, который «интуитивно чувствует сопротивление материала», а на продвинутый оркестратор. Он берёт твои хотелки на естественном языке, прогоняет через physics-based simulator и выдаёт результат. Где заканчивается магия трансформера и начинается старый добрый инженерный софт — пока непонятно. Цифр нет. Метрик нет. Ни точности предсказаний, ни размера датасета — кот наплакал информации.

Среди тех, кто поведётся на громкие заголовки про «ИИ, который понимает физику», будет много разочарованных. Потому что если ты ждёшь, что модель сама выучила уравнение Навье-Стокса — нет. Она научилась дёргать за ручку симулятор. Это разные вещи.

Когда ждать релиза? Чёткой даты нет. Ames Laboratory что-то показывала, какие-то новости мелькали, но без конкретики. Ни v1, ни публичной беты я не видел. Думаю, год-полтора до вменяемого публичного доступа. Может, больше. Если вы в академии или плотно сидите в теме — мониторьте их публикации, возможно, получите ранний доступ.

Моё мнение: юзать однозначно стоит, как только дадут. Хотя бы чтобы пощупать. Но засовывать в критически важный пайплайн без собственных тестов и цифр — так себе идея. Всегда проверяйте, где заканчивается ИИ и начинается старый добрый инженерный софт. И требуйте цифр. Без них любой хайп — просто хайп.