CGD - Crypto Government Department logo CGD - Crypto Government Department logo
Forklog 2025-04-21 11:10:45

Топовые ИИ-модели не осилили видеоигры девяностых

Даже самые продвинутые ИИ-модели не способны эффективно играть в классический шутер от первого лица Doom. К такому выводу пришли эксперты после проверки нейросетей в новом бенчмарке VideoGameBench.  Claude can play Pokemon, but can it play DOOM?With a simple agent, we let VLMs play it, and found Sonnet 3.7 to get the furthest, finding the blue room!Our VideoGameBench (twenty games from the 90s) and agent are open source so you can try it yourself now --> 🧵 pic.twitter.com/vl9NNZPBHY— Alex Zhang (@a1zhang) April 17, 2025 Тест призван проверить способность современных нейросетей играть и побеждать в 20 популярных видеоиграх. Использовать они могут только информацию с экрана.  «Современные модели VLM с трудом справляются с видеоиграми из-за высокой задержки вывода. Когда агент делает снимок экрана и запрашивает VLM о том, какое действие ему следует предпринять, к моменту получения ответа состояние игры значительно меняется, и действие уже неактуально», — отметили исследователи.  Для теста использовались классические игры из 1990 годов из-за простых визуальных эффектов и различных стилей ввода вроде мыши, клавиатуры и игрового контроллера. Такой подход позволяет проверить у модели пространственное мышление и «зрение». VideoGameBench разработан ученым и ИИ-исследователем Алексом Чжаном. В бенчмарк входят Warcraft II, Age of Empires, Prince of Persia и другие игры.  Список игр из бенчмарка VideoGameBench. Данные: сайт vgbench. Sonnet 3.7 справилась с Doom лучше остальных — нейросеть нашла синюю комнату.  Исследователи подчеркнули, что задержка реакции — главная проблема в шутерах от первого лица. В быстро меняющейся обстановке враг может переместиться или даже добраться до игрока раньше его реакции на происходящее.  Помимо проблем с пониманием игрового окружения, модели также не могли выполнить основные действия. «Мы часто наблюдали случаи, когда агент не мог понять, как его действия вроде движения вправо будут отображаться на экране. Самой распространенной ошибкой среди всех протестированных нами пограничных моделей оказалась неспособность надежно управлять мышью в таких играх, как Civilization и Warcraft II, где очень важны точные и частые движения», — отметили эксперты.  Также модели не всегда понимают игровые механики, когда нет прямой инструкции о необходимых действиях.  Напомним, в феврале ИИ-стартап Anthropic представил свою «самую интеллектуальную модель» Claude 3.7 Sonnet, которая прошла игру Pokemon.

Διαβάστε την Αποποίηση Ευθυνών : Όλο το περιεχόμενο που παρέχεται εδώ στον ιστότοπό μας, τους υπερσυνδεδεμένους ιστότοπους, τις σχετικές εφαρμογές, τα φόρουμ, τα ιστολόγια, τους λογαριασμούς κοινωνικών μέσων και άλλες πλατφόρμες (“Site”) προορίζεται μόνο για τις γενικές πληροφορίες σας, που προέρχονται από τρίτες πηγές. Δεν κάνουμε καμία εγγύηση οποιουδήποτε είδους σε σχέση με το περιεχόμενό μας, συμπεριλαμβανομένης ενδεικτικά της ακρίβειας και της ενημέρωσης. Κανένα μέρος του περιεχομένου που παρέχουμε δεν αποτελεί οικονομική συμβουλή, νομική συμβουλή ή οποιαδήποτε άλλη μορφή συμβουλών που προορίζεται για τη συγκεκριμένη εμπιστοσύνη σας για οποιονδήποτε σκοπό. Οποιαδήποτε χρήση ή εξάρτηση από το περιεχόμενό μας είναι αποκλειστικά με δική σας ευθύνη και διακριτική ευχέρεια. Πρέπει να πραγματοποιήσετε τη δική σας έρευνα, να ελέγξετε, να αναλύσετε και να επαληθεύσετε το περιεχόμενό μας προτού βασιστείτε σε αυτά. Η διαπραγμάτευση είναι μια εξαιρετικά επικίνδυνη δραστηριότητα που μπορεί να οδηγήσει σε μεγάλες απώλειες, επομένως συμβουλευτείτε τον οικονομικό σας σύμβουλο πριν λάβετε οποιαδήποτε απόφαση. Κανένα περιεχόμενο στον ιστότοπό μας δεν προορίζεται να είναι παράκληση ή προσφορά