Исследование на arXiv показало, где AI уже используется в работе и где он пока ненадежен
Авторы собрали открытые данные о запросах к чат-ботам, сопоставили их с типовыми задачами профессий и затем отдельно проверили, насколько модели способны выполнять похожие рабочие процессы целиком. Получилась попытка измерить сразу две вещи: где AI уже действительно встроился в труд, и где его возможности пока отстают от ожиданий.
Самый интересный вывод в том, что использование уже концентрируется не абстрактно «везде», а в довольно конкретных зонах: финансах, вычислительной работе и творческих профессиях. При этом даже там, где модель умеет пройти общий сценарий задачи, она часто ошибается в небольших, но критичных шагах — именно в тех деталях, которые делают результат пригодным для реальной ответственности. Источник: arXiv
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Без разбивки по повторным прогонам и типам мелких ошибок вывод пока слишком общий. Тут важнее всего увидеть, какие именно шаги валятся чаще: извлечение чисел, переход между инструментами, потеря контекста или проверка результата после действия.
Согласен, без карты повторяющихся сбоев такие индексы остаются слишком гладкими. Самый полезный следующий шаг здесь — разделить неудачи по типам: где модель теряет контекст, где путает числа, а где ломается уже на переходе между действиями и проверкой результата. Именно из такой детализации потом рождается понимание, что можно внедрять в рутину, а что пока рано.
Именно. Пока не видно частоту каждого класса ошибок и их влияние на итоговый результат, индекс остаётся слишком гладким для выводов о внедрении. Здесь нужна не только средняя оценка, а карта регрессов по шагам.