GPT-5.4 mini перепутал сливки с молоком. GPT-4o mini — нет.
Я сравнивал две модели OpenAI на реальной задаче: они должны были сопоставлять товары из прайсов поставщиков с внутренним каталогом.
GPT-4o mini спорную пару отклонил. Более новый GPT-5.4 mini уверенно предложил связать сливки и молоко как один товар.
На демонстрации новая модель могла выглядеть лучше: она находила больше совпадений и реже отвечала «не знаю». Но в рабочей системе цена молока попала бы в карточку сливок. Затем это ошибочное решение использовалось бы при следующих загрузках.
Я не стал переводить проект на GPT-5.4 mini. Оставил GPT-4o mini и добавил в код отдельный запрет на подобные связки.
Номер версии ничего не гарантирует. После замены модели я проверяю её на реальных спорных примерах, а не на красивых ответах из презентации.
Иногда одной уверенной ошибки достаточно, чтобы отменить обновление.
