Открыть сервисСервис

Нейронная сеть в информатике

Нейронная сеть (в разговорной речи — «нейронка») — это математическая модель и программная система, построенная по принципу организации биологических нейронных сетей, то есть совокупности связанных между собой простых вычислительных элементов (искусственных нейронов). Такие системы применяются для решения задач, которые плохо поддаются алгоритмическому описанию: распознавания образов, обработки естественного языка, прогнозирования, управления. В обиходе словом «нейронка» чаще всего называют либо саму модель машинного обучения, либо сервис на её основе — генератор текста, изображений, кода или голоса.

История

Идея искусственного нейрона была предложена в 1943 году Уорреном Мак-Каллоком и Уолтером Питтсом: они описали формальную модель, в которой нейрон суммирует входные сигналы и выдаёт результат при превышении порога. В 1958 году Фрэнк Розенблатт создал перцептрон — первую обучаемую однослойную сеть, способную распознавать простые изображения.

В 1969 году Марвин Минский и Сеймур Паперт показали ограничения однослойного перцептрона, что привело к периоду спада интереса. Возрождение началось в 1980-х с распространением метода обратного распространения ошибки (backpropagation), а окончательный прорыв произошёл после 2010-х годов, когда рост вычислительных мощностей (графические процессоры) и объёмов данных позволил обучать глубокие многослойные сети.

Устройство

Базовая единица сети — искусственный нейрон. Он получает несколько входных значений, каждое умножается на свой вес, результаты суммируются, к сумме добавляется смещение, и полученная величина пропускается через функцию активации. Нейроны объединяются в слои:

  • входной слой — принимает исходные данные;
  • скрытые слои — выполняют промежуточные преобразования;
  • выходной слой — выдаёт итоговый результат.

Связи между нейронами характеризуются весами, которые и являются обучаемыми параметрами. Обучение состоит в подборе весов так, чтобы ошибка на обучающей выборке была минимальной.

Основные виды

ТипНазначение
Полносвязные (MLP)Табличные данные, простые задачи классификации
Свёрточные (CNN)Обработка изображений, видео
Рекуррентные (RNN, LSTM)Последовательности, временные ряды
ТрансформерыТекст, перевод, генеративные модели
Генеративно-состязательные (GAN)Синтез изображений

Отдельно выделяют большие языковые модели — трансформеры с миллиардами параметров, обученные на огромных текстовых корпусах. Именно они лежат в основе большинства современных чат-ботов и генераторов текста.

Обучение

Различают несколько подходов:

Ключевые этапы: подготовка данных, инициализация весов, прямой проход, вычисление ошибки, обратное распространение и корректировка весов. Процесс повторяется многократно. Для ускорения применяют стохастический градиентный спуск и его модификации.

Применение

Нейронные сети используются в распознавании речи и изображений, машинном переводе, рекомендательных системах, медицинской диагностике, финансовом прогнозировании, автономном транспорте, компьютерных играх. В России технологии применяются в системах распознавания документов, голосовых ассистентах, промышленной аналитике и научных исследованиях.

Ограничения и критика

Среди основных проблем:

  • непрозрачность — решение сети трудно объяснить, что критично в медицине и юриспруденции;
  • требовательность к данным и вычислениям — обучение крупных моделей дорого;
  • переобучение — сеть запоминает примеры вместо обобщения;
  • ошибки и галлюцинации — генеративные модели могут выдавать правдоподобные, но неверные сведения;
  • вопросы этики — предвзятость данных, авторские права, использование в дезинформации.

Нейронные сети и искусственный интеллект

Нейросети — одно из направлений искусственного интеллекта, а не его синоним. Помимо них, в ИИ применяются логические и экспертные системы, поисковые методы, символьные вычисления. Термин «нейронка» в бытовой речи закрепился за прикладными сервисами, тогда как в научной литературе используют уточнённые названия: «искусственная нейронная сеть», «глубокая нейронная сеть», «большая языковая модель».

Источники: работы У. Мак-Каллока и У. Питтса, Ф. Розенблатта, М. Минского и С. Паперта; учебные курсы по машинному обучению; обзоры по глубокому обучению.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru