Открыть сервисСервис

Нейросети в системах искусственного интеллекта

Нейросеть (искусственная нейронная сеть, ИНС) — математическая модель и её программная или аппаратная реализация, построенная по принципу организации биологических нейронных сетей — совокупностей связанных между собой нервных клеток живого организма. В контексте искусственного интеллекта (ИИ, AI — от англ. artificial intelligence) нейросеть выступает основным инструментом машинного обучения: она не программируется напрямую под конкретную задачу, а обучается на данных, подстраивая внутренние параметры.

Термин «AI нейросеть» объединяет два близких, но не тождественных понятия. Искусственный интеллект — общая область информатики, охватывающая любые методы моделирования интеллектуальной деятельности. Нейросеть — один из подходов внутри этой области, наряду с символьными системами, экспертными системами и логическим выводом. С начала 2010-х годов нейросетевой подход стал доминирующим в большинстве прикладных задач ИИ.

История

Первая математическая модель нейрона предложена в 1943 году Уорреном Мак-Каллоком и Уолтером Питтсом. В 1958 году Фрэнк Розенблатт создал перцептрон — однослойную сеть, способную обучаться классификации. В 1969 году Марвин Минский и Сеймур Паперт показали принципиальные ограничения однослойных сетей, что привело к первому «зимнему периоду» в развитии направления.

Возрождение началось в 1986 году после публикации метода обратного распространения ошибки (backpropagation), позволившего эффективно обучать многослойные сети. В 1990-х и 2000-х развивались свёрточные сети для обработки изображений и рекуррентные — для последовательностей. Переломным стал 2012 год, когда свёрточная сеть AlexNet победила в соревновании ImageNet, а с 2017 года, после появления архитектуры трансформер, начался этап больших языковых моделей.

В России исследования в области нейросетей велись с 1960–1970-х годов в институтах Академии наук СССР; современные разработки включают модели машинного перевода, распознавания речи и генеративные системы, создаваемые как государственными центрами, так и частными компаниями.

Устройство

Базовая единица сети — искусственный нейрон, который принимает входные сигналы, умножает их на веса, суммирует и пропускает через функцию активации. Нейроны объединяются в слои:

  • входной слой — принимает исходные данные;
  • скрытые слои — выполняют промежуточные преобразования;
  • выходной слой — выдаёт результат.

Связи между нейронами характеризуются весами — числовыми параметрами, которые изменяются в процессе обучения. Чем больше слоёв и параметров, тем выше вычислительная сложность модели и её способность улавливать тонкие закономерности.

Виды и архитектуры

ТипНазначение
Полносвязные (MLP)Табличные данные, простые задачи классификации
Свёрточные (CNN)Обработка изображений, видео, распознавание образов
Рекуррентные (RNN, LSTM)Последовательности: речь, временные ряды
ТрансформерыЯзыковые модели, перевод, генерация текста
Генеративно-состязательные (GAN)Синтез изображений, видео, аудио

Отдельно выделяют генеративные модели, создающие новый контент, и дискриминативные, различающие классы объектов.

Обучение

Обучение бывает с учителем (на размеченных парах «вход — правильный ответ»), без учителя (поиск структуры в неразмеченных данных) и с подкреплением (оптимизация поведения через награды). Ключевые этапы: инициализация весов, прямой проход, вычисление ошибки, обратное распространение и корректировка весов. Для больших моделей применяются методы предобучения на массивах текстов и последующей тонкой настройки.

Применение

Нейросети используются в распознавании речи и изображений, машинном переводе, медицинской диагностике, рекомендательных системах, беспилотном транспорте, промышленной автоматизации, финансовом анализе и генерации текста, кода и графики. В России они применяются в системах городского видеонаблюдения, банковском скоринге, голосовых ассистентах и сервисах обработки документов.

Ограничения и критика

Нейросети требуют больших объёмов данных и вычислительных ресурсов, склонны к переобучению и могут воспроизводить предвзятость, содержащуюся в обучающих выборках. Результаты работы больших моделей не всегда интерпретируемы: внутренние решения сети трудно объяснить. Существуют также вопросы авторских прав на обучающие данные и риски генерации недостоверной информации.

Значение

Нейросетевой подход изменил методы обработки информации, обеспечив прорыв в задачах, которые долго не поддавались формализации: распознавание образов, понимание естественного языка, синтез контента. Развитие направления связано с ростом вычислительных мощностей, накоплением цифровых данных и совершенствованием алгоритмов обучения.

Источники: работы У. Мак-Каллока и У. Питтса; Ф. Розенблатта; М. Минского и С. Паперта; публикации по методу обратного распространения ошибки; материалы конференции ImageNet; обзоры по архитектуре трансформер.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru