Обучение искусственного интеллекта (ИИ) максимально корректным ответам состоит из отбора и оцифровки данных и работы тренеров-профессионалов с нейросетью. Об этом в эфире Радио РБК рассказал бренд-директор по машинному обучению «Яндекса» Петр Ермаков.
«Мы специально готовим и отбираем данные, которые используются в обучении наших моделей, — это первый этап. Также важно, что не все данные пока доступны. Есть много нецифровых носителей. Мы сотрудничаем с университетами, с библиотеками для оцифровки материалов», — объяснил он.
На втором этапе, продолжил Ермаков, к обучению ИИ-модели привлекают тренеров — учителей, доцентов, докторов наук. В качестве примера представитель «Яндекса» привел обучение «нейроюриста»: «Мы привлекаем опытных юристов, чтобы они генерировали правильные вопросы и корректировали ответы модели, чтобы впоследствии она обучалась отвечать максимально по делу».
По его словам, для тестирования юридических ИИ-моделей будет отобран специальный набор датасетов и вопросов, на которые модель должна будет ответить с соблюдением законодательства. При этом конкретные способы контроля зависят от объемов моделей и «пропускной способности» людей, проверяющих работу нейросети, отметил он.
В июле 2026 года на конференции ICML в Сеуле исследователи «Яндекса» представили работу по ускорению обучения ИИ. Российские специалисты разработали программные модули, позволяющие эффективнее использовать память видеокарт; эксперименты показали, что вычисления графовых нейросетей ускорились до 8,5 раза. Кроме того, «Яндекс» представил исследования об ускорении обучения больших языковых моделей, основанный на выборе алгоритмов оптимизации.