135 событий

Хронология ИИ

Хронология, которая показывает: ИИ объявляли мёртвым минимум трижды — и каждый раз он возвращался.

1837Вехи

Аналитическая машина Бэббиджа: идея компьютера

История ИИ начинается не с компьютеров, а с идеи компьютера. В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину и впервые подробно описал её в 1837 году — на бумаге это был первый универсальный программируемый вычислительный прибор в мире. Его проект на целый век опережал своё время: в нём уже были арифметическое устройство, которое Бэббидж называл 'мельницей' (mill), память (store), программирование с помощью перфокарт и даже условные переходы — основные строительные блоки любого современного компьютера. При жизни изобретателя машина так и не была построена: она оказалась слишком сложной для механики XIX века. Тем не менее она является далёкой прародительницей каждого вычислительного устройства — а значит, и того оборудования, на котором вообще может работать искусственный интеллект. Если подходить честно: Аналитическая машина осталась незавершённым проектом, и она была вычислительным, а не мыслящим устройством. Она заложила фундамент — способность вычислять, но не мыслить.

В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину, которую впервые описал в 1837 году, — первый проект универсального программируемого вычислителя.
Его проект уже содержал строительные блоки современных компьютеров: арифметическое устройство (mill), память (store), программирование с помощью перфокарт и даже условные переходы.
Машина Бэббиджа — далёкая прародительница каждого компьютера, а значит, и того оборудования, на котором вообще может работать ИИ.
Аналитическая машина при жизни Бэббиджа так и не была достроена — она осталась чертежом на бумаге. И она была вычислителем, а не ИИ: фундамент, но не само мышление.

Персоны:Charles Babbage

1843Публикации

Ада Лавлейс: первая программа — и смелое видение

Чарльз Бэббидж спроектировал машину — но именно Ада Лавлейс поняла, на что та способна. В 1843 году британская математик перевела статью об Аналитической машине Бэббиджа и добавила собственные примечания, которые значительно превзошли оригинал по объёму и глубине. В своей заметке G она описала процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой. Ещё дальновиднее оказалось второе открытие: машина не обязана работать только с числами — она может обрабатывать символы любого рода и даже сочинять музыку. Тем самым Лавлейс на целый век опередила идею универсальной обработки данных. Если подходить честно: была ли она первым программистом — спорный вопрос: сам Бэббидж набрасывал программы раньше, а процедура вычисления чисел Бернулли создавалась в диалоге с ним. При этом Лавлейс полагала, что машина не способна создать ничего подлинно нового — возражение, которому Алан Тьюринг открыто противопоставил своё мнение в 1950 году.

В 1843 году Ада Лавлейс перевела статью об Аналитической машине Бэббиджа и дополнила её обширными собственными примечаниями, далеко превзошедшими оригинал.
Её заметка G содержит процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой.
Провидчески она увидела: машина способна на большее, чем вычисления — она может обрабатывать символы и даже сочинять музыку, то есть реализовывать идею универсальной обработки данных.
Спорно, была ли Лавлейс первым программистом (Бэббидж писал программы раньше; процедура вычисления чисел Бернулли создавалась вместе с ним). Кроме того, она считала, что машина не способна создавать что-то подлинно новое, — с чем Тьюринг поспорил в 1950 году.

Персоны:Ada Lovelace

1936Публикации

Машина Тьюринга: что такое вычисление

Прежде чем задаться вопросом, могут ли машины думать, нужно было выяснить, что вообще способна вычислить машина. На этот вопрос ответил британский математик Алан Тьюринг в 1936 году в своей статье 'On Computable Numbers'. В ней он описал удивительно простую мысленную модель — лента, читающая-записывающая головка, несколько правил, — получившую позднее название машины Тьюринга. С её помощью Тьюринг точно установил, что является вычислимым, а что нет. Его важнейшее открытие: одна универсальная машина Тьюринга способна имитировать любую другую. Это теоретический прообраз универсального компьютера — машины, которая при наличии нужной программы может выполнить любое вычислимое действие. Тем самым Тьюринг стал основоположником информатики и создал фундамент, на котором только и стала возможной идея мыслящих машин. Важная оговорка: машина Тьюринга — математическая идея, а не построенное устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само же название 'машина Тьюринга' ввели другие.

В 1936 году Алан Тьюринг опубликовал статью 'On Computable Numbers' и описал в ней простую мысленную вычислительную модель — впоследствии названную машиной Тьюринга.
С её помощью Тьюринг установил, что вообще является вычислимым. Универсальная машина Тьюринга способна имитировать любую другую — теоретический прообраз универсального компьютера.
Тем самым Тьюринг стал основоположником информатики. То, что одна машина способна выполнить любое вычислимое действие, составляет основу, на которой машины впоследствии должны были научиться думать.
Важная оговорка: машина Тьюринга — математическая идея, а не устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само название ввели другие.

Персоны:Alan Turing

1943Публикации

Маккалок и Питтс: первый искусственный нейрон

За тринадцать лет до Дартмутской конференции, в разгар войны, вышло истинное свидетельство о рождении искусственных нейронных сетей. Нейрофизиолог Уоррен Маккалок и самоучка-логик Уолтер Питтс — которому едва исполнилось двадцать лет и у которого не было никакой учёной степени — опубликовали в 1943 году в Bulletin of Mathematical Biophysics статью 'A Logical Calculus of the Ideas Immanent in Nervous Activity'. Их идея была радикально простой: нейрон можно описать как бинарный переключатель, который срабатывает по принципу 'всё или ничего', когда сумма его входных сигналов превышает порог. На основе чистой пропозициональной логики они доказали, что сети из таких элементов способны вычислять любую логическую функцию, а сети с петлями обратной связи обладают даже своеобразной памятью. В заключительной части авторы указали, что их сети способны вычислить то же, что и машина Тьюринга. Тем самым они создали первую математическую модель нейрона как логического вычислительного элемента. Главный изъян, определивший следующее десятилетие: их нейрон не умел учиться.

Первая математическая модель нейрона как логического вычислительного элемента: Маккалок и Питтс облекли работу нервной системы в формальную пропозициональную логику.
Всё или ничего: нейрон срабатывает, когда сумма входных сигналов превышает порог. Сети таких элементов вычисляют любую логическую функцию; петли обратной связи создают память.
Принципиальное ограничение: нет обучения. Веса и пороги были фиксированы, сеть нужно было проектировать вручную. Лишь правило Хебба (1949) и перцептрон Розенблатта (1957) принесли правила обучения.
Влияние вышло далеко за пределы биологии: архитектура компьютера фон Неймана (EDVAC, 1945), кибернетика Винера и, в конечном счёте, каждая искусственная нейронная сеть опираются на эту работу.

Персоны:Warren S. McCulloch, Walter Pitts

Организации:University of Illinois, College of Medicine, University of Chicago

1948Публикации

Теория информации Шеннона: рождение бита

В 1948 году в Bell Labs вышла статья, заложившая основы цифрового мира: 'A Mathematical Theory of Communication' Клода Шеннона. Шеннон показал, как можно измерить информацию математически — безотносительно её смысла. Он ввёл бит как наименьшую единицу информации и ввёл понятие энтропии: меру того, сколько неопределённости в среднем снимает сообщение. Тем самым он заложил фундамент для сжатия данных, безошибочной передачи информации и в конечном счёте для каждого компьютера. Для ИИ это нечто большее, чем просто предыстория: такие понятия, как перекрёстная энтропия и дивергенция Кульбака — Лейблера, которые сегодня служат целевыми функциями при обучении нейронных сетей, уходят корнями прямо в теорию Шеннона. Важная оговорка: Шеннон описывал передачу сообщений, а не мышление. Теория информации — математический инструмент, на котором строится ИИ, но сама она не является искусственным интеллектом.

В 1948 году Клод Шеннон опубликовал в Bell Labs статью 'A Mathematical Theory of Communication' и заложил основы теории информации.
Он ввёл бит как единицу измерения информации и определил энтропию — меру того, сколько неопределённости в среднем снимает сообщение.
Центральное значение для ИИ: перекрёстная энтропия и KL-дивергенция — прямо из теории Шеннона — сегодня являются стандартными целевыми функциями при машинном обучении.
Важная оговорка: Шеннон описывал передачу сообщений, а не интеллект. Теория информации — фундамент, на котором строится ИИ, а не результат работы ИИ. (Термин 'бит' предложил коллега Джон Тьюки.)

Персоны:Claude Shannon

Организации:Bell Labs

1949Публикации

Правило Хебба: как рождается обучение в мозге

В 1949 году канадский психолог Дональд Хебб опубликовал книгу 'The Organization of Behavior' и выдвинул простую, но важную идею: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется. Тем самым Хебб впервые предложил конкретный механизм того, как обучение может работать на уровне отдельных синапсов. Для ИИ это стало основополагающим принципом: обучение означает изменение силы связей — именно это делают искусственные нейронные сети, в том числе более поздние сети Хопфилда. Если подходить честно: знаменитый афоризм о том, что нейроны, возбуждающиеся вместе, соединяются вместе, принадлежит вовсе не Хеббу — его приписывают нейробиологу Карле Шатц (1992). И правило Хебба само по себе ещё не объясняет современное глубокое обучение, поскольку в нём отсутствует целенаправленная коррекция ошибок.

В 1949 году психолог Дональд Хебб опубликовал 'The Organization of Behavior' и сформулировал возможный механизм обучения в мозге на уровне синапсов.
Правило Хебба: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется.
Идея — обучение означает изменение силы связей — стала основополагающим принципом обучающихся нейронных сетей (например, в сетях Хопфилда).
Знаменитый афоризм (нейроны, которые возбуждаются вместе, соединяются вместе) принадлежит не Хеббу, а приписывается Карле Шатц (1992). Правило Хебба само по себе не объясняет современное глубокое обучение — для этого нужна коррекция ошибок.

Персоны:Donald Hebb

1950Публикации

Тест Тьюринга: игра в имитацию

Философская основа машинного интеллекта и первый эталонный тест ИИ. В 1950 году Алан Тьюринг опубликовал в журнале Mind статью 'Computing Machinery and Intelligence' и по-новому сформулировал вопрос 'Могут ли машины мыслить?'. Вместо философских определений Тьюринг предложил практическую 'Игру в имитацию': человек-оценщик анализирует текстовые расшифровки диалогов между человеком и машиной. Оценщик пытается определить, кто из собеседников является машиной; машина считается выдержавшей тест, если оценщик не может надёжно это определить. Решающим является не правильность ответов, а то, насколько они похожи на ответы человека. Этот тест на неотличимость можно распространить на все виды человеческой деятельности — как вербальные, так и невербальные (робототехника). Поведенческий подход Тьюринга заложил концептуальный фундамент для всей науки об ИИ и повлиял на ELIZA, ChatGPT и все современные системы разговорного ИИ.

Тест на неотличимость: оценщик пытается отличить машину от человека с помощью текстового диалога
Перенёс акцент с философских определений на поведенческие демонстрации интеллекта
Сформулировал основополагающий вопрос 'Могут ли машины мыслить?' и предложил операциональный подход
Установил первый эталонный тест ИИ и повлиял на все последующие разработки в области разговорного ИИ

Персоны:Alan Turing

Организации:University of Manchester, Mind Journal

1956Прорывы

Logic Theorist: первая программа для логического вывода

В то же лето, когда в Дартмуте был введён термин 'искусственный интеллект', Аллен Ньюэлл, Херберт Саймон и нередко забытый программист Клифф Шоу представили то, что принято называть 'первой программой ИИ' — с одной оговоркой. Их Logic Theorist доказывал математические теоремы: программа взялась за пропозициональную логику из 'Principia Mathematica' Уайтхеда и Рассела и самостоятельно нашла доказательства для 38 из первых 52 теорем. Примечательным был сам подход: вместо того чтобы перебирать все варианты подряд, программа использовала эвристический поиск — она оценивала, какие шаги перспективны, и работала от цели назад. Для одной теоремы она даже нашла более короткое доказательство, чем в оригинале; по имеющимся сведениям, Рассел был доволен, тогда как научный журнал отклонил представленное доказательство. Всё было написано на IPL — языке списков, предвосхитившем LISP Маккарти. Ограничение: игровые программы вроде дамок Самуэля работали раньше — Logic Theorist стал первой программой, целенаправленно воспроизводившей человеческое рассуждение на открытой интеллектуальной задаче.

Нередко называемая 'первой программой ИИ' — точнее: первая программа, которая должна была воспроизвести человеческое рассуждение на открытой интеллектуальной задаче (игровые программы появились раньше).
Эвристический поиск вместо грубой силы: от цели назад, с оценкой перспективных шагов (подстановка, отделение, сцепление) — под влиянием эвристики Пойа.
Доказала 38 из первых 52 теорем из главы 2 'Principia Mathematica' — для одной теоремы даже короче, чем в оригинале.
Написана на языке списков IPL (главным образом Шоу), который повлиял на LISP Маккарти; эвристический подход привёл непосредственно к General Problem Solver (1957).

Персоны:Allen Newell, Herbert A. Simon, John Clifford Shaw

Организации:RAND Corporation, Carnegie Institute of Technology

1956Конференции

Дартмутская конференция: рождение ИИ

Исторический момент, когда искусственный интеллект родился как научная область. С 18 июня по 17 августа 1956 года в Дартмутском колледже прошла первая летняя исследовательская конференция по ИИ. Джон Маккарти, Марвин Минский, Натаниэль Рочестер и Клод Шеннон разделяли смелое видение: 'Каждый аспект обучения или любую другую характеристику интеллекта можно описать достаточно точно, чтобы машина могла её смоделировать.' На этом восьминедельном семинаре Маккарти ввёл термин 'Artificial Intelligence' и тем самым заложил основу новой научной дисциплины. Некоторые участники приезжали лишь на несколько недель, другие присутствовали постоянно: Херберт Саймон и Аллен Ньюэлл в первые недели демонстрировали свой Logic Theorist, тогда как Рэй Соломонофф провёл все восемь недель на месте — обсуждения велись на верхнем этаже математического факультета. Из этой конференции выросли три исторических центра ИИ: Университет Карнеги — Меллон с Ньюэллом и Саймоном, MIT с Минским и Стэнфорд с Маккарти.

Рождение ИИ как самостоятельной исследовательской дисциплины благодаря 8-недельному семинару с ведущими учёными
Джон Маккарти ввёл термин 'Artificial Intelligence' и тем самым определил новую область исследований
Заложена исследовательская программа: машинный язык, абстракция, решение задач и самосовершенствование
Собрал отцов-основателей ИИ: Маккарти, Минского, Шеннона, Рочестера и будущего лауреата Нобелевской премии Херберта Саймона

Персоны:John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon

Организации:Dartmouth College, IBM, Bell Labs

1957Публикации

Перцептрон: первая обучающаяся нейронная сеть

Рождение машинного обучения — первый обучаемый искусственный нейрон. В 1957 году Фрэнк Розенблатт в Cornell Aeronautical Laboratory разработал перцептрон — первую нейронную сеть, способную учиться на опыте. В январе 1957 года он опубликовал технический отчёт 'The Perceptron: A Perceiving and Recognizing Automaton' (Project PARA, Report 85-460-1). Формальная научная публикация вышла в ноябре 1958 года в журнале Psychological Review. Вдохновлённый биологическими нейронами, перцептрон объединял взвешенные входные данные через функцию Хевисайда, выдавая бинарные выходные значения. Новаторское правило обучения перцептрона корректировало веса каждый раз, когда пример классифицировался неверно, — ранний предшественник обучения в современных нейронных сетях (его не следует путать с более поздним дельта-правилом Уидроу и Хоффа, 1960 года). Сначала смоделированный на IBM 704 и публично анонсированный в 1958 году, аппаратный Mark I Perceptron был завершён лишь около 1960 года. Несмотря на ограниченность линейно разделимыми задачами, перцептрон заложил концептуальный фундамент для всех последующих нейронных архитектур.

Первый обучаемый искусственный нейрон со взвешенными входами и функцией Хевисайда
Бинарная классификация через пороговое решение, эффективная для линейно разделимых паттернов
Правило обучения перцептрона Фрэнка Розенблатта корректировало веса при каждой ошибке классификации, обеспечивая автоматическое обучение
Ограниченность линейно разделимыми задачами впоследствии вызвала критику XOR со стороны Минского и Пейперта

Персоны:Frank Rosenblatt

Организации:Cornell Aeronautical Laboratory, US Navy

1958Прорывы

LISP: язык ИИ

В 1958 году Джон Маккарти в Массачусетском технологическом институте разработал язык программирования, ставящий символьные вычисления в центр: LISP, сокращение от List Processing. Вместо того чтобы преимущественно обрабатывать числа, LISP манипулировал списками символов — именно то, что требовалось символическому ИИ. На протяжении десятилетий LISP оставался языком исследований в области ИИ: экспертные системы, обработка естественного языка и системы планирования создавались на нём. Язык Маккарти ввёл также идеи, которые сегодня стали само собой разумеющимися: рекурсию, автоматическую сборку мусора (garbage collection), функции как данные и интерактивное вычисление выражений. Стив Расселл реализовал теоретический механизм вычисления eval Маккарти в виде первого интерпретатора — и тем самым сделал LISP работающим. Если подходить честно: LISP не был первым языком высокого уровня (Fortran появился в 1957 году), но он второй по возрасту из тех, что используются до сих пор, — и самый значимый для ИИ.

Джон Маккарти разработал LISP в 1958 году в MIT для символьных вычислений (списки вместо чисел) — на протяжении десятилетий ГЛАВНЫЙ язык исследований ИИ (экспертные системы, NLP, планирование).
Ввёл идеи, ставшие сегодня стандартом: рекурсию, автоматическую сборку мусора, функции как данные, интерактивное вычисление выражений (REPL).
Опирался на обработку списков из IPL; Стив Расселл реализовал eval Маккарти в виде первого интерпретатора и сделал LISP работающим.
Не первый язык высокого уровня (Fortran 1957 появился раньше) — но второй по возрасту из тех, что используются до сих пор, и самый значимый для ИИ.

Персоны:John McCarthy, Steve Russell

Организации:MIT

1959Прорывы

Артур Самуэль: самообучающийся ИИ и термин 'машинное обучение'

За несколько лет до Дартмутской конференции Артур Самуэль в IBM научил машину играть в шашки — и заодно учиться. Его программа работала с 1952 года на IBM 701; главным, однако, стало то, что он изложил в своей статье 1959 года 'Some Studies in Machine Learning Using the Game of Checkers'. Программа совершенствовалась сама: она сыграла десятки тысяч партий против самой себя и корректировала веса своей оценочной функции по итогам игр. В названии этой статьи термин 'машинное обучение' (Machine Learning) зафиксирован в современном значении впервые — Самуэль считается его создателем. Ричард Саттон позднее оценил самоигру Самуэля как первое применение обучения с временными разностями (Temporal-Difference Learning), лежащего в основе современного обучения с подкреплением. Телевизионная демонстрация 1956 года и широко цитируемая победа над предполагаемым мастером попали в заголовки газет — однако оба события были значительно преувеличены: против действительно сильных игроков программа проигрывала, и шашки были полностью решены лишь несколько десятилетий спустя.

В названии статьи 1959 года Самуэль использовал термин 'Machine Learning' (машинное обучение) — первое задокументированное употребление в современном значении; он считается его создателем.
Первая публично продемонстрированная самообучающаяся программа: она самостоятельно корректировала веса своей оценочной функции и запоминала позиции (метод ротации).
Сыграв десятки тысяч партий против самой себя, программа предвосхитила самоигру, доведённую до совершенства в AlphaZero, — по оценке Саттона, это первое применение обучения с временными разностями (Temporal-Difference Learning).
Важная оговорка: прославленная победа 1962 года была одержана над переоценённым соперником; против мировых лидеров программа проигрывала. Шашки были полностью решены лишь в 2007 году (Chinook).

Персоны:Arthur Lee Samuel

Организации:IBM

1965Вехи

DENDRAL: пионер экспертных систем

В середине 1960-х годов ИИ сделал принципиальный поворот. В Стэнфордском университете Эдвард Фейгенбаум и генетик, лауреат Нобелевской премии Джошуа Ледерберг приступили к работе над DENDRAL — программой, которую часто называют первой экспертной системой и которая в любом случае стала первой, применившей ИИ к научному рассуждению. Вместо того чтобы действовать общим поиском, как прежние системы, DENDRAL использовала специализированные знания химиков: по данным масс-спектрометра она выводила структуру органических молекул. Вынесенный урок определил целое десятилетие развития ИИ: знание — это сила. Победит не самый умный общий алгоритм, а тот, кто располагает наибольшей экспертизой. Тем самым DENDRAL проложила путь к буму экспертных систем в 1980-х. Если подходить честно: DENDRAL сам по себе был успешным многолетним исследовательским проектом, а не отдельным продуктом. Однако его метод — утомительного ручного ввода всех знаний — впоследствии стал ахиллесовой пятой: он сделал коммерческие экспертные системы 1980-х годов ненадёжными и дорогостоящими, что способствовало наступлению зимы ИИ.

С середины 1960-х годов Эдвард Фейгенбаум, Джошуа Ледерберг и коллеги в Стэнфордском университете разрабатывали DENDRAL — часто называемый первой экспертной системой и первой программой, применившей ИИ к научному рассуждению.
DENDRAL выводил структуру органических молекул по данным масс-спектрометрии — используя специализированные знания химиков вместо общего поиска.
Вынесенный урок: знание — это сила. Вместо универсальных решателей задач ИИ сосредоточился на узко ограниченных, насыщенных знаниями областях — начало эпохи экспертных систем.
DENDRAL сам по себе был успешным многолетним проектом. Однако его метод — ручное кодирование знаний — стал слабым местом коммерческих экспертных систем 1980-х и способствовал зиме ИИ.

Персоны:Edward Feigenbaum, Joshua Lederberg, Bruce Buchanan

Организации:Stanford University

1965Публикации

Нечёткая логика: логика неточности

Важный математический прорыв в работе с неопределённостью и приближёнными рассуждениями. В 1965 году Лотфи Заде из Калифорнийского университета в Беркли опубликовал основополагающую статью 'Fuzzy Sets' — ответ на неспособность классической логики справляться с расплывчатой и неполной информацией. Его открытие состояло в осознании того, что люди принимают решения на основе неточных, нечисловых данных. Нечёткая логика допускает степени принадлежности от 0 до 1, в отличие от бинарной логики 'да/нет'. Сегодня работа Заде насчитывает более 100 000 цитирований и стала основой для мягких вычислений (Soft Computing) и современных подходов к ИИ. 'Точная логика неточности' позволила математически моделировать неопределённость, неполноту и противоречивую информацию. Нечёткая логика нашла применение в экспертных системах, системах управления и впоследствии в современных архитектурах ИИ для нечётких процессов принятия решений.

Статья Лотфи Заде 'Fuzzy Sets' 1965 года с более чем 100 000 цитирований существенно изменила подход к работе с неопределённостью
Обеспечила математическое моделирование неточности, неполноты и противоречивой информации
Нашла применение в экспертных системах, системах управления и приближённых процессах принятия решений
Заложила основу для мягких вычислений (Soft Computing) и современных подходов ИИ к работе с несовершенной информацией

Персоны:Lotfi Zadeh

Организации:UC Berkeley, Information and Control

1966Прорывы

ELIZA: первый чат-бот

Рождение разговора человека с машиной и непреднамеренный эксперимент в области человеческой психологии. Приблизительно с 1964 по 1966 год Джозеф Вейценбаум в MIT разработал ELIZA — первую программу, явно созданную для общения с людьми. С удивительно лаконичным кодом и простой технологией сопоставления шаблонов (Pattern Matching) ELIZA имитировала разговоры, особенно в варианте DOCTOR — в роли терапевта по методу Роджерса. Неожиданность крылась не в технологии, а в реакции людей: пользователи, включая собственную секретаршу Вейценбаума, формировали эмоциональные привязанности к программе и даже требовали конфиденциальности для своих 'сеансов терапии'. Вейценбаум рано описал и подверг критике это явление — тенденцию приписывать рудиментарным программам человеческие качества. Сам термин 'эффект ELIZA' был введён и популяризирован позже, в 1990-е годы. ELIZA доказала силу простой иллюзии и заложила основу для всех современных чат-ботов.

Первая компьютерная программа, явно разработанная для общения человека с машиной, завершена в 1966 году
Использовала простую технологию сопоставления шаблонов и подстановки — программа обходилась удивительно небольшим объёмом кода
Создавала иллюзию понимания и эмоционального интеллекта без реального понимания языка
Обнаружила то, что впоследствии назвали 'эффектом ELIZA', и предостерегла от приписывания человеческих качеств рудиментарным программам

Персоны:Joseph Weizenbaum

Организации:MIT, MIT AI Laboratory

1969Публикации

Perceptrons: книга, которая спровоцировала зиму ИИ

В 1969 году исследователи Массачусетского технологического института Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons. С математической строгостью они показали, что может, а чего не может однослойный перцептрон — простейшая форма нейронной сети. Их самый известный результат: такая сеть не способна выучить даже простую функцию XOR, потому что она не является линейно разделимой. Влияние оказалось огромным: доверие к нейронным сетям рухнуло, финансирование прекратилось более чем на десятилетие — книга стала важным фактором первой зимы ИИ. Важная оговорка: Минский и Пейперт отнюдь не опровергли нейронные сети. Они проанализировали лишь однослойный вариант; многослойные сети решают XOR без труда — что позднее, с 1986 года, стало практически применимым благодаря методу обратного распространения ошибки. Рассказ о том, что книга в одиночку уничтожила исследования, — отчасти миф. Однако резкое сокращение финансирования и внимания было вполне реальным.

В 1969 году Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons и математически проанализировали, что может, а чего не может однослойный перцептрон.
Их знаменитый результат: однослойный перцептрон не способен выучить простую функцию XOR, поскольку она не является линейно разделимой.
Книга считается одной из причин первой зимы ИИ: финансирование нейронных сетей прекратилось более чем на десятилетие.
Важная оговорка: Минский и Пейперт не опровергли нейронные сети как таковые — многослойные сети решают XOR (позднее с помощью метода обратного распространения, 1986). Утверждение, что книга в одиночку уничтожила область, отчасти является мифом; однако реальное сокращение финансирования было ощутимым.

Персоны:Marvin Minsky, Seymour Papert

Организации:MIT

1969Прорывы

Shakey: первый разумный мобильный робот

Рождение автономной робототехники через интеграцию логического мышления, планирования и физического действия. С 1966 по 1972 год команда Чарльза Розена в SRI International разрабатывала Shakey — первого мобильного робота, способного осмысливать собственные действия. Двухметровый робот объединял телекамеру, сонарный дальномер, процессоры и 'кошачьи усы' в качестве датчиков столкновения в единую автономную систему. Выдающиеся возможности Shakey включали восприятие окружающей среды, построение выводов из неявных фактов, составление планов и компенсацию ошибок — всё это управлялось с помощью естественного английского языка. Финансируемый ARPA (ныне DARPA) проект впервые объединил логическое мышление с физическим действием и заложил основы автономных систем. Разработки Shakey привели к созданию алгоритма поиска A*, методов графа видимости и влиятельного вычислительного варианта преобразования Хафа (Duda & Hart, SRI 1972). В 1970 году журнал Life Magazine назвал Shakey 'первой электронной личностью'.

Первый мобильный робот, способный осмысливать собственные действия и самостоятельно планировать сложные задачи
Объединял телекамеру, сонар, процессоры и датчики в автономную мобильную систему
Разработал систему планирования STRIPS для автоматического разбиения задач и поиска маршрутов
Объединил компьютерное зрение, навигацию и логическое мышление в единой физической системе

Персоны:Charles Rosen, Nils Nilsson, Bertram Raphael

Организации:SRI International, DARPA

1970Вехи

SHRDLU: понимание языка в мире кубиков

Около 1970 года Терри Виноград в Массачусетском технологическом институте создал программу, удивившую специалистов: SHRDLU. Ей можно было отдавать команды на простом английском — например, поставить красный куб на зелёный блок — и она выполняла их в виртуальном мире из цветных кубиков. SHRDLU понимала не только команды: она разрешала двусмысленные предложения, помнила сказанное, отвечала на вопросы о своём мире и могла даже объяснить, почему выполнила то или иное действие. Для многих это стало выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык. Важная оговорка: понимание SHRDLU работало только в её крошечном замкнутом мире кубиков. На реальный, необозримый мир с его бесконечными обыденными знаниями оно не распространялось. Со временем SHRDLU стала поучительным примером ограничений подобных микромиров — сам Виноград впоследствии отказался от этого подхода.

Около 1970 года Терри Виноград в МТИ создал SHRDLU — программу, которая понимала команды на простом английском и манипулировала виртуальным миром из кубиков.
SHRDLU умела разрешать двусмысленные предложения, помнить сказанное, отвечать на вопросы и даже объяснять, почему выполнила то или иное действие.
Она считалась выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык в ограниченном мире.
Важная оговорка: понимание SHRDLU работало только в её крошечном мире кубиков. На реальный мир оно не распространялось — поучительный пример ограничений таких микромиров.

Персоны:Terry Winograd

Организации:MIT

1970Публикации

Скрытые марковские модели получают признание

Математический фундамент для распознавания речи и моделирования последовательностей. С конца 1960-х до 1970 года Леонард Баум, Ллойд Уэлч и Тед Петри в Институте оборонных исследований (Institute for Defense Analyses) разработали скрытые марковские модели и создали алгоритм Баума-Уэлча. Эти статистические модели описывали скрытые состояния в последовательностях и предложили один из первых практически применимых подходов к выявлению латентных состояний в данных, зависящих от времени. С середины 1970-х HMM нашли первое практическое применение в распознавании речи — в работах Джеймса Бейкера в Университете Карнеги-Меллон и позднее в IBM. Метод коренным образом изменил автоматическое распознавание речи: от простых шаблонных методов (Template Matching) к статистическим подходам. HMM стали стандартом для моделирования последовательностей в многочисленных областях: от биоинформатики и финансового анализа до распознавания жестов. Алгоритм Баума-Уэлча, впоследствии признанный частным случаем алгоритма максимизации математического ожидания (Expectation-Maximization), сформулированного в общем виде в 1977 году, заложил фундамент для современных вероятностных методов машинного обучения.

Алгоритм Баума-Уэлча как частный случай Expectation-Maximization для оценки параметров HMM
Первое практическое применение в распознавании речи с середины 1970-х в Университете Карнеги-Меллон и IBM
Преобразовал моделирование последовательностей от шаблонного сопоставления к статистическим вероятностным подходам
Заложил математический фундамент для современных вероятностных методов машинного обучения

Персоны:Leonard Baum, Lloyd Welch, Ted Petrie

Организации:Institute for Defense Analyses

1972Вехи

Prolog: программирование с помощью логики

В 1972 году в Марсельском университете возник язык программирования, мысливший совершенно иначе, чем все остальные: Prolog, сокращение от Programmation en Logique. Его создатели Ален Кольмерауэр и Филипп Руссель — опираясь на теорию Роберта Ковальски — развивали захватывающую идею. Вместо того чтобы шаг за шагом указывать компьютеру, как что-то делать, в Prolog описывают лишь факты и правила некоторого мира. Логические выводы из них система делает сама. Prolog стал важнейшим языком символического ИИ: в экспертных системах, в обработке естественного языка и как основа амбициозного японского проекта пятого поколения (Fifth Generation). Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ. Масштабный японский проект, целиком построенный на Prolog, остался далеко позади своих обещаний. И прорыв обязан столько же теории Роберта Ковальски, сколько самому языку.

В 1972 году Ален Кольмерауэр и Филипп Руссель в Марсельском университете разработали язык Prolog — сокращение от Programmation en Logique.
Prolog является декларативным: описывают факты и правила, а система самостоятельно выводит логические следствия — вместо пошагового указания, как именно.
Prolog стал важнейшим языком логического, символического ИИ — в экспертных системах, обработке естественного языка и японском проекте пятого поколения.
Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ; японский проект пятого поколения, построенный на нём, не оправдал ожиданий. Важна также теория Роберта Ковальски, а не только сам язык.

Персоны:Alain Colmerauer, Philippe Roussel, Robert Kowalski

Организации:University of Aix-Marseille

1974Вехи

Первая зима ИИ

Период резких сокращений финансирования исследований и падения доверия к искусственному интеллекту. После чрезмерных обещаний 1960-х годов наступила горькая реальность: программы ИИ могли решать лишь тривиальные версии тех задач, с которыми им предстояло справляться. В Великобритании доклад Лайтхилла 1973 года стал уничижительной критикой, после чего Совет по научным исследованиям сократил финансирование нецелевых исследований в области ИИ. В США DARPA — под влиянием поправки Мэнсфилда — на несколько лет отказалась от нецелевых исследований; резкое сокращение финансирования понимания речи в 1974–1975 годах затронуло проект в Университете Карнеги — Меллона и привело к расторжению контракта на 3 миллиона долларов. Эта зима продолжалась примерно до 1980 года и преподала сообществу ИИ важный урок: реалистичные ожидания — ключ к устойчивому прогрессу.

DARPA в США и британский Совет по научным исследованиям в середине 1970-х годов резко сократили финансирование нецелевых исследований в области ИИ
Профессор Джеймс Лайтхилл в 1973 году жёстко раскритиковал исследования ИИ за недостижение поставленных целей и указал на проблему комбинаторного взрыва
DARPA расторгла контракт с Университетом Карнеги — Меллона на 3 миллиона долларов по системам понимания речи после разочаровывающих результатов
Программы ИИ начала 1970-х годов были ограничены тривиальными версиями реальных задач и воспринимались как умные 'игрушки'

Персоны:James Lighthill, J.C.R. Licklider, Hans Moravec

Организации:DARPA, British Science Research Council, Carnegie Mellon University

1980Публикации

Неокогнитрон: прародитель свёрточных нейронных сетей

В 1980 году японский исследователь Куниихико Фукусима представил нейронную сеть, намного опередившую своё время: неокогнитрон. Его образцом послужила природа — точнее, зрительная кора, которую изучали нобелевские лауреаты Хьюбел и Визел в опытах на кошках. В зрительной коре простые и сложные клетки поэтапно обрабатывают зрительные стимулы. Фукусима воспроизвёл этот принцип: многослойная сеть, распознающая признаки послойно — причём независимо от того, где именно в изображении они находятся. Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей (Convolutional Neural Networks), которые господствуют в распознавании изображений с 2012 года. Важная оговорка: неокогнитрон ещё не использовал метод обратного распространения ошибки и не мог обучаться так, как современные CNN. Лишь метод обратного распространения (1986) и LeNet Яна ЛеКуна (1989) превратили эту архитектуру в практически обучаемые сети. Первопроходческая роль Фукусимы до сих пор нередко недооценивается.

В 1980 году Куниихико Фукусима представил неокогнитрон — многослойную нейронную сеть для распознавания образов.
Образцом послужила зрительная кора (Хьюбел и Визел): простые и сложные клетки, которые поэтапно распознают признаки независимо от их положения.
Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей — локальные фильтры признаков и иерархическую обработку. LeNet ЛеКуна (1989) опирался на эти идеи.
Важная оговорка: неокогнитрон не использовал обратное распространение ошибки. Лишь метод обратного распространения (1986) и LeNet (1989) сделали из него практически обучаемые сети. Первопроходческая роль Фукусимы нередко недооценивается.

Персоны:Kunihiko Fukushima

Организации:NHK Broadcasting Science Research Laboratories

1980Вехи

Эра экспертных систем 1980-х годов

1980-е годы стали расцветом экспертных систем — временем, когда ИИ впервые достиг коммерческого успеха. Компании по всему миру внедряли эти основанные на правилах программы ИИ, воспроизводящие знания экспертов-людей в специализированных областях. Индустрия ИИ выросла с нескольких миллионов долларов в 1980 году до миллиардов в 1988-м. Две трети компаний из списка Fortune 500 использовали эту технологию. Системы вроде MYCIN достигали в исследованиях около 65% принятия своих терапевтических рекомендаций — наравне с экспертами факультетов, хотя MYCIN так и не применялась клинически. Однако бум завершился по классической схеме экономического пузыря, когда десятки компаний потерпели крах и обнаружились пределы технологии.

Индустрия ИИ выросла с нескольких миллионов долларов (1980) до миллиардов (1988)
Две трети компаний из списка Fortune 500 использовали экспертные системы в повседневной деловой практике
Терапевтические рекомендации MYCIN получали около 65% одобрения — сопоставимо с человеческими экспертами факультетов
Классическая схема экономического пузыря: подъём, за которым последовал масштабный крах

Персоны:Edward Feigenbaum, Bruce Buchanan, Edward Shortliffe

Организации:Stanford University, Fortune 500 Companies

1982Публикации

Сети Хопфилда: Ассоциативная память

Возрождение нейронных сетей благодаря ассоциативным возможностям памяти. В 1982 году Джон Хопфилд опубликовал основополагающую статью «Neural networks and physical systems with emergent collective computational abilities» в PNAS. Его инновация заключалась в связи нейробиологии и статистической физики: сети Хопфилда работают как content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов. Рекуррентная архитектура с симметричными двунаправленными связями сходится к аттракторам фиксированной точки через энергетическую функцию Ляпунова. Система «скатывается вниз» к ближайшему сохранённому воспоминанию. Работа Хопфилда возродила интерес к нейронным сетям и заложила теоретический фундамент для современных RNN. Хеббовское правило обучения позволило ассоциативное хранение паттернов — прорыв для понимания биологических и искусственных систем памяти.

Content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов
Рекуррентная архитектура с симметричными двунаправленными связями и эмерджентными коллективными свойствами
Энергетическая функция Ляпунова ведёт систему к аттракторам фиксированной точки через «скатывание вниз» к сохранённой памяти
Возродил интерес к нейронным сетям и заложил основу для развития современных RNN

Персоны:John Hopfield

Организации:California Institute of Technology, Bell Laboratories

1986Публикации

Алгоритм обратного распространения ошибки

Рождение современного машинного обучения благодаря элегантному алгоритму обучения. В октябре 1986 года Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали в журнале Nature статью 'Learning representations by back-propagating errors'. Этот алгоритм существенно изменил обучение нейронных сетей, предоставив эффективный метод корректировки весов в многослойных сетях. Метод итеративно корректирует веса связей, чтобы минимизировать разницу между фактическим и желаемым выходом. Ключевая инновация заключалась в способности обучать скрытые слои, которые автоматически распознают важные признаки задачи. Математические основы были заложены ранее — в частности, Полом Вербосом (1974) и Сеппо Линнайнмаа (1970), — однако именно эта статья сделала метод обратного распространения ошибки широко известным и убедительно продемонстрировала его эффективность. Метод обратного распространения стал рабочей лошадкой машинного обучения и сегодня лежит в основе всех современных приложений глубокого обучения.

Опубликовано в Nature 9 октября 1986 года под названием 'Learning representations by back-propagating errors'
Сделало эффективное обучение многослойных нейронных сетей посредством вычисления градиентов практически применимым и широко известным
Скрытые слои научились автоматически распознавать важные признаки — значительный прогресс по сравнению с перцептронами
Заложило математический фундамент для всех современных приложений глубокого обучения и архитектур трансформеров

Персоны:David Rumelhart, Geoffrey Hinton, Ronald Williams

Организации:University of California San Diego, Carnegie Mellon University, Nature

1987Вехи

Вторая зима ИИ

Крах рынка специализированного оборудования для ИИ и провал экспертных систем. В 1987 году рынок Lisp-машин рухнул, когда компьютеры Apple и IBM оказались дешевле и производительнее дорогостоящих ИИ-специфичных систем. Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании и негибкими для реального применения. Джек Шварц, новый руководитель IPTO, назвал экспертные системы 'умным программированием' и урезал финансирование ИИ 'глубоко и жестоко'. Упадок производителей Lisp-машин растянулся на несколько лет — лидер рынка Symbolics объявил о банкротстве лишь в 1993 году, — что привело к более длительной и глубокой зиме, чем первая в 1974 году. Эта зима продолжалась примерно до 1993 года и положила конец коммерческому ажиотажу вокруг экспертных систем и специализированного оборудования для ИИ — однако символический ИИ как направление исследований сохранился.

Рынок специализированных Lisp-машин рухнул в 1987 году, поскольку компьютеры Apple и IBM стали дешевле и производительнее
Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании, негибкими и неспособными работать с новыми данными
Джек Шварц урезал финансирование ИИ в DARPA 'глубоко и жестоко' и назвал экспертные системы 'умным программированием'
Затраты на ИИ-специфичное оборудование значительно превышали обещанные коммерческие выгоды

Персоны:Jacob T. Schwartz, Marvin Minsky, Roger Schank

Организации:DARPA, IPTO, Symbolics, Lisp Machines Inc, XCON

1987Наборы данных

Репозиторий UCI ML: библиотека наборов данных

Демократизация исследований в области машинного обучения с помощью стандартизированных эталонных наборов данных. В 1987 году аспирант UCI Дэвид Аха совместно с однокурсниками основал Репозиторий машинного обучения UCI (UCI Machine Learning Repository) как FTP-архив — коллекцию баз данных, предметных теорий и генераторов данных для эмпирического анализа алгоритмов машинного обучения. Эта инициатива устраняла критический дефицит стандартизированных общедоступных наборов данных для растущего сообщества в области машинного обучения. Репозиторий стал основным источником наборов данных для машинного обучения по всему миру и открыл студентам, преподавателям и исследователям доступ к высококачественным эталонным данным. За прошедшие годы он был процитирован десятки тысяч раз и входит в число наиболее используемых ресурсов в информатике. Сегодня репозиторий, управляемый Центром машинного обучения и интеллектуальных систем, предлагает наборы данных из здравоохранения, финансов и множества других областей. Репозиторий кардинально демократизировал образование и исследования в области машинного обучения.

Основан в 1987 году как FTP-архив Дэвидом Аха и студентами UCI для эмпирического анализа алгоритмов машинного обучения
Стал основным источником наборов данных для машинного обучения для студентов, преподавателей и исследователей по всему миру
Процитирован десятки тысяч раз — один из наиболее используемых ресурсов наборов данных в информатике
Демократизировал исследования в области машинного обучения, открыв доступ к стандартизированным высококачественным эталонным наборам данных

Персоны:David Aha, Patrick Murphy

Организации:University of California Irvine, UCI

1988Публикации

Байесовские сети: рассуждения в условиях неопределённости

Пока нейронные сети и экспертные системы соперничали за внимание, Джуда Перл в Калифорнийском университете в Лос-Анджелесе строил третий фундаментальный столп ИИ: рассуждения в условиях неопределённости. В своей книге 'Probabilistic Reasoning in Intelligent Systems' (1988) он популяризировал байесовские сети — графы, в которых узлы представляют переменные, а рёбра — их вероятностные зависимости. Вместо жёстких правил 'если — то' и произвольных весовых коэффициентов экспертных систем они позволяли аккуратно сочетать знания и неопределённость и эффективно делать выводы. Байесовские сети определили ИИ и машинное обучение в 1990-х и 2000-х годах; Перл получил премию Тьюринга в 2011 году и впоследствии обратился к каузальному выводу — вопросу о причинах, стоящих за данными. Если подходить честно: теорема Байеса сама по себе восходит к XVIII веку; вклад Перла состоял не в изобретении теории вероятностей, а в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым применительно к ИИ.

Джуда Перл (UCLA) утвердил рассуждение в условиях неопределённости как третий столп ИИ — наряду с символическим подходом и нейронными сетями.
Байесовские сети: графы из переменных (узлов) и вероятностных зависимостей (рёбер) — заменили произвольные весовые коэффициенты чётким и эффективным выводом.
Определили машинное обучение 1990-х и 2000-х; Перл получил премию Тьюринга в 2011 году и заложил основы современного каузального вывода.
Теорема Байеса восходит к XVIII веку; вклад Перла — в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым для ИИ, а не в изобретении теории вероятностей.

Персоны:Judea Pearl

Организации:UCLA

1989Публикации

Теорема об универсальной аппроксимации

Математическое доказательство теоретической мощи нейронных сетей. В 1989 году Курт Хорник, Максвелл Стинчкомб и Халберт Уайт опубликовали основополагающую статью 'Multilayer feedforward networks are universal approximators' в журнале Neural Networks. Их строгое доказательство показало: уже одного скрытого слоя с достаточным количеством нейронов хватает для сколь угодно точной аппроксимации любой борелевски измеримой функции. Эта теоретическая основа математически обосновала применение нейронных сетей и убедила исследователей в том, что достаточно большие сети способны моделировать сложные нелинейные зависимости в реальных данных. Параллельно появились схожие работы Джорджа Сайбенко и Фунахаси, использовавших различные методы. Теорема установила универсальность за счёт расширения скрытого слоя и стала теоретическим столпом для всех последующих разработок в области глубокого обучения. Хорник и соавторы создали математическую основу доверия, которая обеспечила возрождение нейронных сетей в 1990-е годы.

Строгое математическое доказательство универсальных аппроксимирующих возможностей нейронных сетей
Одного скрытого слоя с достаточным числом нейронов хватает для аппроксимации любой борелевски измеримой функции с любой точностью (параллельная работа Сайбенко показала это для непрерывных функций)
Доказывает способность к моделированию сложных нелинейных зависимостей в реальных данных
Обеспечил математическое обоснование применения нейронных сетей и теоретическую основу доверия

Персоны:Kurt Hornik, Maxwell Stinchcombe, Halbert White

Организации:University of California San Diego

1989Прорывы

Всемирная паутина: изобретение WWW

Изобретение, которое объединило мир и заложило основу для современных источников данных ИИ. 12 марта 1989 года Тим Бернерс-Ли подал в ЦЕРН предложение по 'системе управления информацией' — первоначально названной 'Mesh', а впоследствии 'World Wide Web'. Британский учёный осознал необходимость автоматизированного обмена информацией между исследователями по всему миру. К концу 1990 года он разработал три фундаментальные веб-технологии: HTML (HyperText Markup Language), HTTP (HyperText Transfer Protocol) и URI/URL. Первый веб-сервер info.cern.ch работал на компьютере NeXT вместе с первым браузером-редактором 'WorldWideWeb.app'. В 1991 году Сеть стала общедоступной. Экспоненциальный рост — примерно с 10 сайтов (1992) до нескольких сотен тысяч (1996) — создал информационную основу для последующих систем ИИ. Без Всемирной паутины не существовало бы наборов данных Common Crawl и больших языковых моделей.

Гипертекстовый проект со связанными документами, браузерами и 'горячими ссылками' — опирался на более ранние идеи гипертекста (Тед Нельсон, Memex Ваневара Буша), однако намеренно был проще, чем проект Xanadu Нельсона
Предложение по управлению информацией от 12 марта 1989 года в ЦЕРН для автоматизированного обмена научными данными
HTML, HTTP и URI/URL как фундаментальные веб-технологии, разработанные к концу 1990 года
Создал информационную инфраструктуру для последующих коллекций Common Crawl и обучения больших языковых моделей

Персоны:Tim Berners-Lee

Организации:CERN

1989Публикации

LeNet и рождение свёрточных нейронных сетей

Первое успешное практическое применение свёрточных нейронных сетей (CNN). В 1989 году Янн ЛеКун в AT&T Bell Labs впервые объединил метод обратного распространения ошибки (Backpropagation) с архитектурой CNN для распознавания рукописных символов. Эта система — впоследствии известная как прародитель семейства LeNet — распознавала рукописные почтовые индексы для Почтовой службы США (US Postal Service) с примечательной точностью: около 1% ошибок на обучающих данных и около 5% — на ранее не виденных тестовых данных; если сети разрешалось отклонять неуверенные случаи, ошибка на оставшихся цифрах снижалась примерно до 1%. Эти результаты доказали практическое превосходство CNN над традиционными подходами и заложили основу современного компьютерного зрения. Они показали, что нейронные сети — не просто теоретические конструкты, а инструмент для решения реальных бизнес-задач. Архитектура прошла несколько итераций улучшений и в 1998 году воплотилась в LeNet-5, достигшей точности 99,05% на MNIST. Эта работа заложила фундамент всех современных архитектур CNN.

Первое успешное сочетание свёрточных нейронных сетей (CNN) с обучением методом обратного распространения ошибки
Распознавала рукописные почтовые индексы для Почтовой службы США: около 5% ошибок на тестовых данных, около 1% — при возможности отклонять неуверенные случаи
Новаторская работа Янна ЛеКуна в Bell Labs утвердила CNN как практичное решение для задач компьютерного зрения
Заложила фундамент всех современных архитектур CNN — от AlexNet до современных систем компьютерного зрения

Персоны:Yann LeCun, Bernhard Boser, John Denker

Организации:AT&T Bell Labs, NIPS

1992Прорывы

TD-Gammon: обучение через игру против самого себя

Задолго до AlphaGo одна программа IBM показала, на что способно обучение с подкреплением: в 1992 году Джеральд Тесауро представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды. Примечательным был метод обучения. TD-Gammon тренировался почти исключительно за счёт сотен тысяч партий против самого себя, обучаясь по итогам игр с помощью метода временных разностей (Temporal Difference), постепенно корректирующего прогнозы. Никто не показывал ему хороших ходов. Сеть достигла почти мирового уровня и даже открыла начальные ходы, которые профессиональные игроки-люди впоследствии переняли. Важная оговорка: каким бы впечатляющим ни был этот успех, он долгое время не поддавался переносу на другие игры. Одна из причин — в кубиках: нарды являются игрой с элементом случайности, и случай сам по себе обеспечивает разнообразие при тренировках — преимущество для самоигры, которого детерминированные игры вроде шахмат или го не дают.

В 1992 году Джеральд Тесауро в IBM представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды.
Программа обучалась почти исключительно через партии против самой себя с помощью метода обучения с подкреплением Temporal Difference — без использования партий людей в качестве образца.
TD-Gammon достиг почти мирового уровня и открыл новые дебютные ходы, перенятые профессионалами, — предшественник AlphaGo почти на 25 лет раньше.
Важная оговорка: успех долгое время не поддавался переносу на другие игры. Кубики в нардах сами обеспечивают разнообразие при тренировках — преимущество для самоигры, которого шахматы или го не имеют.

Персоны:Gerald Tesauro

Организации:IBM

1992Публикации

Q-обучение: фундамент обучения с подкреплением

В 1992 году Крис Уоткинс и Питер Даян опубликовали математическое доказательство для Q-обучения (Q-learning) — алгоритма, которому предстояло существенно изменить мир ИИ. Основную идею Уоткинс разработал ещё в 1989 году в своей докторской диссертации 'Learning from Delayed Rewards' в King's College Cambridge. Q-обучение решало фундаментальную задачу: как агент может действовать оптимально, не нуждаясь в модели своей среды? Ответ был элегантным — через последовательную оптимизацию Q-функции, которая присваивает значение каждой паре состояние-действие. Доказательство сходимости 1992 года показало: при бесконечном исследовании Q-обучение гарантированно находит оптимальную стратегию для любой конечной задачи Маркова (Markov Decision Problem). Этот безмодельный метод стал краеугольным камнем современного обучения с подкреплением. От робототехники до финансовых рынков, от игр до автономных систем — Q-обучение применяется повсеместно. В конце 2013 года DeepMind представил глубокий вариант — Deep Q-Networks (DQN) (публикация в Nature в 2015 году), достигнув при этом на большинстве игр Atari уровня или превысив уровень человека. По сей день Q-обучение — прежде всего в форме Deep Q-Network — является одним из основных строительных блоков многочисленных систем ИИ.

1992 год, математическое доказательство сходимости: Q-обучение гарантированно находит оптимальные стратегии при бесконечном исследовании
Новаторский безмодельный подход: обучение оптимальным действиям без модели среды и вероятностей переходов
Элегантное решение задач принятия решений Маркова через последовательную оптимизацию Q-функции
Краеугольный камень современного обучения с подкреплением — по сей день ядро Deep Q-Networks и многочисленных систем ИИ

Персоны:Chris Watkins, Peter Dayan

Организации:King's College Cambridge, University College London

1993Наборы данных

Penn Treebank: синтаксическая разметка меняет NLP

Создание фундаментального корпуса для современных исследований в области синтаксического разбора. В 1993 году Митчелл Маркус, Беатрис Санторини и Мэри Энн Марцинкевич опубликовали основополагающую статью 'Building a Large Annotated Corpus of English: The Penn Treebank' в журнале Computational Linguistics. Более 4,5 миллиона слов американского английского, размеченных частями речи, и около 3 миллионов из них — с детальной синтаксической (скелетной) разметкой: Penn Treebank существенно изменил компьютерную лингвистику. Двухэтапный метод сочетал автоматическую POS-разметку с ручной корректурой, обеспечивая исключительное качество аннотации. За всё время проекта — около семи лет (1989–1996) — и в расширенном Penn Treebank II в общей сложности были созданы 7 миллионов слов с POS-разметкой, 3 миллиона текстов со скелетным разбором и 2 миллиона структур предикат-аргумент. Penn Treebank утвердил эмпирические методы в компьютерной лингвистике и стал основой современных алгоритмов синтаксического разбора. По сей день Penn Treebank служит современным NLP-системам важным эталоном для оценки синтаксического разбора и языкового моделирования.

4,5+ миллиона слов с разметкой частей речи, из них около 3 миллионов с детальной синтаксической разметкой — с помощью двухэтапного полуавтоматического метода
Утвердил эмпирические методы в компьютерной лингвистике и стал стандартным эталоном для исследований синтаксического разбора
Существенно изменил алгоритмы синтаксического разбора: от основанных на правилах к статистическим подходам
Заложил основы статистического синтаксического разбора и служит современным NLP-системам эталоном для оценки

Персоны:Mitchell Marcus, Beatrice Santorini, Mary Ann Marcinkiewicz

Организации:University of Pennsylvania, Linguistic Data Consortium

1995Публикации

AdaBoost: слабые обучающиеся становятся сильными

В 1995 году Йоав Фройнд и Роберт Шапир разработали AdaBoost (Adaptive Boosting) — алгоритм, существенно изменивший машинное обучение. Их ключевая идея: объединить множество 'слабых обучающихся' в высокоточную модель предсказания. Слабый обучающийся лишь немного лучше случайного угадывания — но сотни таких вместе способны достигать впечатляющих результатов. AdaBoost адаптируется: неверные предсказания на следующем шаге получают больший вес. Так система автоматически фокусируется на трудных случаях. Теоретическая элегантность подкупала — Фройнд и Шапир доказали, что ошибка на обучающей выборке убывает экспоненциально быстро, пока каждый слабый обучающийся лучше случайного. В 2003 году они получили за это обоснование теории бустинга Премию Гёделя — одну из самых престижных наград в теоретической информатике. AdaBoost нашёл практическое применение в биологии, компьютерном зрении и распознавании речи. Метод заложил фундамент для современных ансамблевых методов и вдохновил целое поколение алгоритмов бустинга вплоть до XGBoost.

Адаптивное взвешивание: трудные случаи получают больший вес для сфокусированного обучения на проблемных местах
Принцип слабых обучающихся: сотни простых классификаторов вместе дают высокоточные предсказания
Премия Гёделя 2003: одна из самых престижных наград теоретической информатики за обоснование теории бустинга
Фундамент современных ансамблевых методов: вдохновил XGBoost и целое поколение алгоритмов бустинга

Персоны:Yoav Freund, Robert Schapire

Организации:AT&T Bell Laboratories

1995Публикации

Метод опорных векторов: классификация с максимальным зазором

Утверждение элегантного геометрического подхода к надёжной классификации. В 1995 году Коринна Кортес и Владимир Вапник опубликовали в AT&T Bell Labs основополагающую статью 'Support-Vector Networks' в журнале Machine Learning. Метод опорных векторов (SVM) расширил ранний подход Вапника и Червоненкиса к максимальному зазору 1964 года ('Обобщённый портрет') до практического решения для неразделимых обучающих данных благодаря нововведению 'мягкого зазора' (Soft Margin). Ключевой принцип состоит в построении линейных решающих поверхностей в многомерных пространствах признаков с помощью нелинейных преобразований входных данных. Ядерный трюк (Kernel Trick) 1992 года позволил эффективно выполнять вычисления без явного преобразования. Методы опорных векторов максимизируют зазор между классами и тем самым обеспечивают высокую способность к обобщению. Набрав десятки тысяч цитирований, статья стала одной из наиболее цитируемых в области машинного обучения и доминировала в задачах классификации вплоть до революции глубокого обучения. Методы опорных векторов по-прежнему остаются надёжными, интерпретируемыми и эффективными для высокоразмерных задач.

Подход Вапника и Червоненкиса к максимальному зазору 1964 года расширен до практического решения для неразделимых данных
Ядерный трюк (Kernel Trick) обеспечивает нелинейную классификацию через неявные многомерные преобразования
Принцип максимального зазора максимизирует расстояние между классами для оптимального обобщения
Утвердил теоретически обоснованную альтернативу нейронным сетям с гарантиями обобщаемости

Персоны:Vladimir Vapnik, Corinna Cortes

Организации:AT&T Bell Labs

1995Наборы данных

WordNet: семантическая сеть языка

Первый лексический словарь для вычислительной лингвистики, построенный как семантическая сеть. В ноябре 1995 года Джордж Миллер опубликовал основополагающую статью 'WordNet: A Lexical Database for English' в журнале Communications of the ACM, представив идею, которую разрабатывал с 1986 года. WordNet организует английские существительные, глаголы, прилагательные и наречия в синсеты (synsets) — когнитивные группы синонимов, связанные семантическими и лексическими отношениями. Эта структура отражает семантическую память человека и позволяет перемещаться по сети слов и понятий, связанных по смыслу. Машиночитаемые словари существовали и прежде, однако WordNet стал первым, где словарный запас последовательно моделировался как сеть синсетов и отношений значений, соединяя традиционную лексикографическую информацию с современной обработкой данных. Разработка началась в 1986 году под руководством Миллера и его команды в Принстонском университете; WordNet стал основой для иерархий ImageNet и современных систем обработки естественного языка. Структура семантической сети повлияла на все последующие графы знаний и техники встраивания.

Первый лексический словарь, построенный как семантическая сеть из синсетов и отношений значений, с программным доступом
Синсеты, связанные семантическими и лексическими отношениями, образуют навигируемую сеть значений
Отражает семантическую память человека и связывает когнитивную науку с вычислительной лингвистикой
Заложил основу для иерархий ImageNet, графов знаний и современных семантических систем обработки естественного языка

Персоны:George Miller, Christiane Fellbaum

Организации:Princeton University, Cognitive Science Laboratory

1996Публикации

PageRank: алгоритм Google ценой в миллиарды

В 1996 году двое аспирантов Стэнфорда разработали алгоритм, которому предстояло существенно изменить интернет. Ларри Пейдж и Сергей Брин запустили проект 'BackRub', основанный на оригинальной идее: важность веб-страницы определяется не только её содержанием, но и ссылками, которые на неё указывают. Как при научном цитировании: чем чаще на страницу ссылаются, тем она важнее. Алгоритм PageRank моделирует 'случайного сёрфера', который случайным образом переходит по ссылкам в интернете. Чем чаще случайный сёрфер попадает на страницу через структуру ссылок, тем выше её значимость. Веб-краулер Пейджа стартовал в марте 1996 года с его собственной стэнфордской домашней страницы. Формальная публикация статьи по PageRank состоялась в январе 1998 года в виде технического отчёта Стэнфорда. К августу 1996 года BackRub уже обнаружил около 75 миллионов URL — адресов, найденных по ссылкам, из которых лишь часть была реально обойдена краулером. Даже ранний стэнфордский прототип давал более релевантные результаты, чем современные поисковые сервисы — Excite или Yahoo!. Стэнфорд получил патент и продал свои 1,8 миллиона акций Google в 2005 году за 336 миллионов долларов. Из университетского проекта выросла одна из самых успешных поисковых систем — и основа современного веб-ИИ.

Стэнфордский проект 'BackRub' анализировал данные обратных ссылок для определения веб-значимости — основа для Google
Новаторский анализ ссылок: важность веб-страниц по ссылкам, а не только по частоте ключевых слов
Модель случайного сёрфера: страница тем важнее, чем чаще случайный сёрфер попадает на неё через структуру ссылок
Из стэнфордских исследований выросла Google Inc. — PageRank как фундамент самой ценной поисковой системы

Персоны:Larry Page, Sergey Brin, Rajeev Motwani, Terry Winograd

Организации:Stanford University, Google Inc.

1997Соревнования

Deep Blue побеждает Каспарова

Первая победа машины над действующим чемпионом мира по шахматам в условиях турнира. 11 мая 1997 года Deep Blue вошёл в историю: суперкомпьютер IBM победил Гарри Каспарова в матче-реванше в Нью-Йорке со счётом 3,5:2,5. После поражения 1996 года IBM кардинально переработала систему: новые шахматные чипы удвоили скорость до 200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров повысили игровую силу. Решающая шестая партия длилась всего один час — после жертвы коня Каспаров быстро оказался в объективно проигранной позиции и сдался уже на 19-м ходу, что стало беспрецедентным моментом в его карьере. Победа впервые продемонстрировала превосходство компьютеров в сложном стратегическом мышлении и стала поворотным моментом в общественном восприятии ИИ. Призовой фонд в 700 000 долларов для Deep Blue подчеркнул историческое значение этого триумфа машинного интеллекта.

Первая победа компьютера над действующим чемпионом мира по шахматам в матче в стандартных турнирных условиях (одну отдельную партию Deep Blue уже выигрывал в 1996 году)
200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров
Технический триумф IBM после многолетней разработки начиная с ChipTest 1985 — через Deep Thought к Deep Blue
Поворотный момент в общественном восприятии ИИ и доказательство машинного превосходства в сложном стратегическом мышлении

Персоны:Garry Kasparov, Murray Campbell, Joe Hoane, Feng-hsiung Hsu

Организации:IBM, World Chess Championship

1997Публикации

LSTM: Долгая краткосрочная память

Решение проблемы затухающего градиента и рождение эффективного моделирования последовательностей. 15 ноября 1997 года Сепп Хохрайтер и Юрген Шмидхубер опубликовали основополагающую статью «Long Short-Term Memory» в Neural Computation. Их инновация решила фундаментальную проблему рекуррентных сетей: исчезновение градиентов на длинных последовательностях. LSTM ввёл специальные ячейки памяти с механизмами гейтов, обеспечивающими константный поток ошибки через тысячи временных шагов. Мультипликативные гейты учатся открывать и закрывать доступ к константной карусели ошибок. С O(1)-сложностью на временной шаг и локальным обучением LSTM значительно превзошёл все существовавшие тогда RNN-методы. Система впервые решила сложные проблемы с долгими временными задержками, которые ранее были нерешаемы. LSTM стал основой для современного распознавания речи, перевода и анализа временных рядов.

Решил проблему затухающего градиента через константный поток ошибки через тысячи временных шагов
Специальные ячейки памяти с константными каруселями ошибок для долгосрочного хранения информации
Мультипликативные Gate-Units учатся открывать и закрывать доступ к константному потоку ошибки
Сделал возможным эффективное моделирование долгосрочных последовательностей для распознавания речи и анализа временных рядов

Персоны:Sepp Hochreiter, Jürgen Schmidhuber

Организации:Technical University of Munich, IDSIA

1998Наборы данных

MNIST: стандарт машинного обучения

Создание одного из важнейших эталонных наборов данных для начинающих в области компьютерного зрения. В 1998 году Янн ЛеКун, Коринна Кортес и Кристофер Бёрджес представили набор данных MNIST — курированную коллекцию рукописных цифр, ставшую 'Hello World' машинного обучения. Основанный на Special Database 3 и Special Database 1 от NIST, MNIST содержит 70 000 нормализованных изображений размером 28x28 пикселей в оттенках серого: 60 000 для обучения и 10 000 для тестирования. Тщательная предобработка и сглаживание сделали MNIST идеальным для учебных целей без трудоёмкой подготовки данных. MNIST появился в статье 'Gradient-based learning applied to document recognition' (Proceedings of the IEEE, ноябрь 1998). Набор данных стал стандартным эталоном для бесчисленных алгоритмов машинного обучения и позволил целым поколениям студентов получить первые результаты в области компьютерного зрения. MNIST демократизировал образование в сфере машинного обучения по всему миру.

70 000 рукописных цифр в виде нормализованных изображений 28x28 пикселей в оттенках серого
Составлен Янном ЛеКуном, Коринной Кортес и Кристофером Бёрджесом на основе баз данных NIST
Стал 'Hello World' машинного обучения и стандартным эталоном для алгоритмов МО
Демократизировал образование в сфере МО благодаря простому доступу без трудоёмкой подготовки данных

Персоны:Yann LeCun, Corinna Cortes, Christopher Burges

Организации:AT&T Labs, Courant Institute

2001Публикации

Случайный лес: прорыв в ансамблевых методах

В 2001 году Лео Брейман из Калифорнийского университета в Беркли опубликовал одну из наиболее цитируемых статей по машинному обучению за всё время — 'Random Forests'. Его алгоритм существенно изменил концепцию ансамблевых методов и стал одним из важнейших инструментов современной статистики. Базовая идея была гениально проста: вместо одного дерева решений обучают сотни случайных деревьев и дают им проголосовать. Каждое дерево видит лишь случайное подмножество данных и признаков — 'бэггинг' (bagging) в сочетании с рандомизацией признаков. Результат: резкое снижение проблем переобучения (overfitting) и исключительная точность предсказаний. Брейман также предоставил теоретическую основу — границы ошибки обобщения, основанные на силе дерева и корреляции. Случайный лес стал одним из самых не требующих обслуживания алгоритмов машинного обучения типа 'подключи и работай': минимальная настройка, максимальная производительность. От биоинформатики до анализа финансовых рынков случайный лес по сей день доминирует в бесчисленных приложениях и сделал ансамблевые методы стандартным инструментом — параллельно с направлением бустинга (boosting), из которого впоследствии вырос XGBoost.

Прорыв в ансамблевых методах: сотни случайных деревьев решений совместно голосуют для получения более точных предсказаний
Бэггинг (bagging) + рандомизация признаков: каждое дерево видит разные данные и признаки для обеспечения разнообразия
Теоретическое обоснование: границы ошибки обобщения на основе силы дерева и корреляции
Алгоритм машинного обучения типа 'подключи и работай': минимальная настройка при исключительной производительности во всех областях

Персоны:Leo Breiman, Adele Cutler

Организации:UC Berkeley Statistics Department, Machine Learning Journal

2005Организации

Основание Future of Humanity Institute

Институционализация исследований безопасности ИИ и оценки экзистенциальных рисков. В 2005 году Ник Бостром основал Future of Humanity Institute в Оксфордском университете как мультидисциплинарную исследовательскую группу. Начав всего с трёх исследователей, FHI превратился в интеллектуальный центр притяжения для блестящих, нередко эксцентричных мыслителей и вырос примерно до 40 сотрудников. Институт создал новые исследовательские области: экзистенциальные риски, выравнивание ИИ (AI Alignment), управление ИИ (AI Governance) и долгосрочное мышление (Longtermism). Ранние публикации Бострома, такие как 'The fable of the dragon tyrant' (2005) и 'What is a singleton?' (2006), сформировали подходы к безопасности ИИ. Несмотря на относительно короткие 19 лет существования вплоть до закрытия в 2024 году, FHI внёс значительный вклад и создал новый способ мышления о ключевых вопросах человечества. Академическая легитимизация исследований безопасности ИИ через Оксфорд придала этой области научный авторитет.

В 2005 году основан в Оксфордском университете, вырос с 3 до примерно 40 исследователей к закрытию в 2024 году
Первопроходец в области экзистенциальных рисков, долгосрочного мышления (Longtermism) и управления ИИ (AI Governance) как новых исследовательских направлений
Утвердил выравнивание ИИ (AI Alignment) и безопасность ИИ (AI Safety) как легитимные академические дисциплины с глобальным влиянием
Придал исследованиям безопасности ИИ научный авторитет и уважение благодаря принадлежности к Оксфорду

Персоны:Nick Bostrom, Anders Sandberg

Организации:Oxford University, Future of Humanity Institute

2005Соревнования

DARPA Grand Challenge: рождение автономного вождения

8 октября 2005 года синий Volkswagen Touareg по имени 'Stanley' вошёл в историю. Под руководством Себастьяна Труна команда Stanford Racing Team выиграла DARPA Grand Challenge — первое в мире успешное соревнование автономных транспортных средств. После того как в 2004 году все участники потерпели неудачу (лучший результат: 7,4 мили, то есть 11,9 км), Stanley прошёл весь маршрут длиной 212 км по пустыне за 6 часов 53 минуты. Финишную черту пересекли пять машин, четыре из них — в рамках временного лимита; это был разительный прогресс по сравнению с нулём в предыдущем году. Stanley преодолел три узких тоннеля, более 100 крутых поворотов и опасный Beer Bottle Pass с его обрывами. Новаторство состояло в программном обеспечении, а не в аппаратной части: сенсоры LiDAR, машинное обучение и журнал решений человека-водителя дали Stanley возможности, которых прежде не было ни у одного робота. Призовые 2 миллиона долларов стали лишь началом — Stanley заложил основу для Tesla Autopilot, Google Waymo и всей индустрии автономных транспортных средств. Сегодня Stanley хранится в Смитсоновском музее.

'Stanley' Стэнфорда стал первым автономным транспортным средством, прошедшим маршрут по пустыне длиной 212 км менее чем за 7 часов
Прорыв от нуля успешных транспортных средств (2004) до пяти финишировавших (2005), четыре из которых уложились в лимит времени, — благодаря улучшенному ИИ
Определён как соревнование программного обеспечения: LiDAR, машинное обучение и данные о решениях человека-водителя — ключевые факторы успеха
Момент рождения современных технологий автономного вождения — вдохновил Tesla, Google и целую индустрию

Персоны:Sebastian Thrun, Mike Montemerlo, Stanley Thrun Team

Организации:DARPA, Stanford University, Stanford AI Lab

2006Публикации

Сети глубокого доверия: ренессанс глубокого обучения

В 2006 году Джеффри Хинтон изменил мир ИИ своей важной статьёй о сетях глубокого доверия (Deep Belief Networks). После многолетнего затишья в области нейронных сетей он показал, как можно эффективно обучать глубокие нейронные сети. Его инновация: послойное предобучение (Pre-Training) с помощью ограниченных машин Больцмана (Restricted Boltzmann Machines, RBM). Эта 'жадная' стратегия обучения решила проблему инициализации весов и сделала глубокое обучение (Deep Learning) практически применимым. Метод складывает RBM поверх друг друга и обучает каждый слой отдельно, после чего вся сеть дорабатывается в целом. Работа Хинтона положила конец многолетнему забвению нейронных сетей и открыла эпоху их возрождения. Уже в 2009 году DBN значительно снизили частоту ошибок в распознавании речи. В 2012 году команда Хинтона победила на соревновании ImageNet Challenge (ILSVRC) с AlexNet — глубокой свёрточной нейронной сетью, обученной с использованием GPU, ReLU и Dropout, которая уже не зависела от RBM-предобучения DBN. AlexNet достигла частоты ошибок top-5 на уровне 15,3% против 26,2% у второй команды — значительное улучшение. Этот момент знаменует возрождение нейронных сетей и начало нынешнего подъёма ИИ.

Жадный послойный алгоритм обучения впервые позволил эффективно обучать глубокие нейронные сети
Складывание ограниченных машин Больцмана (RBM) как строительных блоков для сложных представлений
Неконтролируемое предобучение решило проблему инициализации весов в глубоких сетях
Положило конец забвению нейронных сетей и дало начало современному подъёму глубокого обучения (Deep Learning) с 2006 года

Персоны:Geoffrey Hinton, Simon Osindero, Yee-Whye Teh

Организации:University of Toronto, Neural Computation

2006Соревнования

Приз Netflix: алгоритм за миллион долларов

Демократизация машинного обучения посредством краудсорсингового конкурса беспрецедентного масштаба — с открытым набором данных и призовым фондом в один миллион долларов. 2 октября 2006 года Netflix запустил этот конкурс с призом в миллион долларов: кто улучшит алгоритм рекомендаций Cinematch на 10 %? Предоставив более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов, Netflix создал один из крупнейших общедоступных наборов данных для машинного обучения. Зарегистрировалось более 40 000 команд из 186 стран, из которых более 5 000 попали в квалификационную таблицу лидеров и в совокупности подали около 44 000 допустимых решений. Когда 26 июня 2009 года команда 'BellKors Pragmatic Chaos' первой преодолела отметку в 10 %, это запустило 30-дневный финальный этап, завершившийся 26 июля 2009 года; официально победитель с улучшением на 10,06 % был объявлен на церемонии награждения 21 сентября 2009 года. Рецепт успеха: ансамблевое сочетание матричной факторизации и ограниченных машин Больцмана. Конкурс существенно изменил коллаборативную фильтрацию и продемонстрировал мощь краудсорсинга для решения сложных задач машинного обучения. Несмотря на то что Netflix так и не внедрил алгоритмы победителей в производство (слишком высокие затраты на реализацию), конкурс оказал долгосрочное влияние на современную индустрию рекомендательных систем.

Призовой фонд 1 миллион долларов за улучшение алгоритма Cinematch на 10 % в ходе трёхлетнего конкурса
Более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов в качестве общедоступного набора данных для МО
Существенно изменил коллаборативную фильтрацию благодаря матричной факторизации и ограниченным машинам Больцмана
Более 40 000 команд из 186 стран, свыше 5 000 в квалификационной таблице лидеров с около 44 000 заявками — мощь краудсорсинга для МО

Персоны:Reed Hastings, Netflix Team, BellKor Pragmatic Chaos Team

Организации:Netflix, BellKor, AT&T Research

2007Наборы данных

Основан фонд Common Crawl

Демократизация интернета как обучающих данных для искусственного интеллекта. В 2007 году Гил Эльбаз основал фонд Common Crawl с миссией: архивировать весь публичный интернет и делать его свободно доступным. С 2008 года начался систематический сбор данных (краулинг), и с тех пор корпус растёт на миллиарды страниц ежемесячно, достигнув к 2024 году порядка более 100 миллиардов веб-страниц и нескольких петабайт данных. Эта коллекция стала важнейшим источником обучающих данных для больших языковых моделей (Large Language Models) и обеспечила разработку GPT-3, ChatGPT, LLaMA и других современных систем ИИ. Common Crawl отличается от коммерческих подходов своей некоммерческой природой и открытой доступностью. Необработанные исходные данные требуют последующей обработки, однако фонд демократизировал доступ к обширным языковым данным и сделал ИИ-исследования менее зависимыми от проприетарных наборов данных.

Основан в 2007 году с миссией архивировать весь публичный интернет и делать его свободно доступным
С начала краулинга в 2008 года ежемесячно растёт на миллиарды страниц — к 2024 году: более 100 миллиардов веб-страниц и несколько петабайт данных
Стал важнейшим источником обучающих данных для GPT-3, ChatGPT, LLaMA и других современных больших языковых моделей
Некоммерческий подход демократизировал доступ к обширным языковым данным для ИИ-исследований по всему миру

Персоны:Gil Elbaz, Common Crawl Team

Организации:Common Crawl Foundation, Internet Archive, Alexa Internet

2007Вехи

CUDA: видеокарта становится двигателем ИИ

Революция ИИ 2012 года работала не только на алгоритмах — она работала на видеокартах. Почву для этого подготовила NVIDIA в 2007 году с CUDA: платформой, позволявшей запускать обычные программы на языке, подобном C, прямо на GPU — а не только графику. Анонсированная с чипом G80 в конце 2006 года, в феврале 2007 вышедшая в публичную бету и выпущенная в виде версии 1.0 в июне 2007 года, CUDA впервые открыла широкий доступ к огромному параллелизму графических процессоров. Это прекрасно сочетается с нейронными сетями, вычисления в которых сводятся к матричным умножениям — тысячи мелких операций одновременно. Пять лет спустя Крижевский, Суцкевер и Хинтон обучили AlexNet на двух картах NVIDIA GTX 580 с CUDA — прорыв, зажёгший глубокое обучение. С 2014 года cuDNN от NVIDIA поставлял оптимизированные строительные блоки, на которых сегодня работают TensorFlow, PyTorch и другие фреймворки. Если подходить честно: CUDA не изобрела GPGPU (программируемые шейдеры появились в 2001 году, BrookGPU — в 2004-м) и не стала единственной причиной глубокого обучения — но она сделала необходимые вычислительные мощности доступными, а без них ничего остального просто не было бы.

CUDA (2007, NVIDIA; авторы Иэн Бак — из проекта BrookGPU — и Джон Никколлс) позволяет запускать обычные программы на языке, подобном C, прямо на GPU — не только графику.
GPU выполняют тысячи операций параллельно. Это точно соответствует нейронным сетям, ядром которых являются матричные умножения.
Стала двигателем глубокого обучения: AlexNet (2012) обучалась на двух картах GTX 580 с CUDA; с cuDNN (2014) на ней работает практически каждый крупный фреймворк.
GPGPU существовала до CUDA (шейдеры 2001, BrookGPU 2004); CUDA не была единственной причиной глубокого обучения — она сделала вычислительные мощности доступными (необходимое, но не достаточное условие).

Персоны:Ian Buck, John Nickolls

Организации:NVIDIA

2008Публикации

Обучение с нулевым числом примеров: обучение без данных

Формализация обучения на невиданных ранее классах посредством семантических описаний. В июле 2008 года Хьюго Ларошель, Думитру Эрхан и Йошуа Бенжио представили на конференции AAAI работу 'Zero-data Learning of New Tasks', заложив теоретическую предварительную формализацию. Само название 'Zero-Shot Learning' закрепили в 2009 году две другие группы исследователей: Палатуччи с коллегами в статье 'Zero-Shot Learning with Semantic Output Codes' на конференции NIPS 2009 и Лямперт с коллегами, предложивший основанный на атрибутах подход на конференции CVPR 2009. Фундаментальная проблема: как модель может классифицировать классы, для которых отсутствуют обучающие данные, а есть только описания? Решение состояло в семантических векторных представлениях (embedding) и переносе обучения — повторном использовании обученных моделей для новых задач. Формализация Ларошеля была направлена на очень большие наборы классов, которые не могут быть полностью охвачены обучающими данными. Экспериментальный анализ подтвердил значительные способности к обобщению в этом контексте. Эта работа заложила концептуальный фундамент для современных возможностей Few-Shot и Zero-Shot в GPT-3, GPT-4 и других больших языковых моделях. Обучение с нулевым числом примеров стало ключевой технологией для масштабируемых систем ИИ.

Классификация классов без обучающих данных — только по семантическим описаниям целевых классов
Повторное использование обученных моделей для принципиально новых задач посредством семантических векторных представлений
Семантические представления позволяют обобщать знания на невиданные ранее концепты
Заложил фундамент для возможностей Few-Shot и Zero-Shot в современных больших языковых моделях

Персоны:Hugo Larochelle, Dumitru Erhan, Yoshua Bengio

Организации:University of Montreal

2009Наборы данных

Создание датасетов CIFAR

Создание фундаментального бенчмарка для компьютерного зрения. В 2009 году Алекс Крижевский, Винод Наир и Джеффри Хинтон в Университете Торонто разработали датасеты CIFAR-10 и CIFAR-100. Они были созданы как размеченные подмножества из 80-миллионного датасета изображений «Tiny Images». CIFAR-10 содержит 60 000 цветных изображений 32x32 пикселя в десяти категориях: самолёты, автомобили, животные и другие, а CIFAR-100 распределяет то же количество изображений по ста более детальным классам. Датасеты стали одним из важнейших бенчмарков в исследованиях компьютерного зрения и позволили стандартизировать сравнение различных алгоритмов. Примечательна связь с AlexNet: Крижевский использовал CIFAR-10 ещё до 2011 года для обучения небольших CNN на одиночных GPU — предшественник его позднейшего успеха ImageNet в 2012 году.

CIFAR-10 с 60 000 изображений в 10 категориях, CIFAR-100 со 100 более детальными классами как бенчмарки компьютерного зрения
Стал одним из важнейших стандартизированных бенчмарков для алгоритмов компьютерного зрения во всём мире
Позволил систематическую оценку и сравнение различных подходов машинного обучения
Крижевский использовал CIFAR-10 до 2011 года для обучения CNN — предвестник его успеха AlexNet в 2012 году

Персоны:Alex Krizhevsky, Vinod Nair, Geoffrey Hinton

Организации:University of Toronto, Canadian Institute for Advanced Research, CIFAR

2009Наборы данных

ImageNet: набор данных, изменивший всё

Создание набора данных, который открыл путь к развитию глубокого обучения. В 2009 году Фэй-Фэй Ли вместе со своей командой представила статью по ImageNet и продемонстрировала визуальную базу данных, призванную преобразовать компьютерное зрение. На момент запуска она насчитывала около 3,2 миллиона изображений с ручной разметкой примерно в 5 200 категориях. В полном объёме ImageNet впоследствии охватил более 14 миллионов изображений с ручными аннотациями и около 22 000 категорий, основанных на иерархиях WordNet, — тем самым устраняя критическое узкое место: нехватку больших, высококачественных обучающих данных. Разметку выполняли около 49 000 работников из 167 стран через Amazon Mechanical Turk — проект беспрецедентного масштаба. То, что начиналось как постер в углу конференц-зала в Майами-Бич, переросло в ежегодный ImageNet Challenge (ILSVRC) и стало одним из трёх движущих факторов развития современного ИИ. ImageNet открыл путь к прорыву AlexNet в 2012 году и заложил фундамент для автономных транспортных средств, распознавания лиц и медицинской визуализации.

На момент запуска в 2009 году — около 3,2 миллиона изображений, в полном объёме — более 14 миллионов изображений с ручной разметкой примерно в 22 000 категориях, созданных около 49 000 работниками из 167 стран
Основан на иерархиях WordNet для структурированной классификации визуальных объектов
Предоставил критически важные обучающие данные для прорыва AlexNet в 2012 году и развития глубокого обучения
Преобразовал исследования в области компьютерного зрения и открыл возможности для автономных транспортных средств, распознавания лиц и медицинской визуализации

Персоны:Fei-Fei Li, Jia Deng, Wei Dong, Richard Socher

Организации:Stanford University, Princeton University

2010Вехи

Основание DeepMind

Рождение лаборатории ИИ, которой предстояло делать заголовки новостей. В сентябре 2010 года Демис Хассабис, Шейн Легг и Мустафа Сулейман основали в Лондоне DeepMind Technologies. Их цель: разработать общий искусственный интеллект, объединив знания из нейронауки и машинного обучения. Хассабис, бывший вундеркинд в шахматах и разработчик игр, принёс уникальное видение: ИИ должен учиться подобно человеческому мозгу. В 2014 году Google приобрела стартап примерно за 500 миллионов долларов — одно из крупнейших приобретений в области ИИ в истории. Впоследствии DeepMind поразит мир прорывами AlphaGo, AlphaFold и другими достижениями.

Основана в сентябре 2010 года в Лондоне как DeepMind Technologies
Демис Хассабис (нейроучёный, разработчик игр), Шейн Легг и Мустафа Сулейман
Приобретена Google в 2014 году примерно за 500 миллионов долларов
Позже создала AlphaGo, AlphaFold и другие прорывные ИИ-системы

Персоны:Demis Hassabis, Shane Legg, Mustafa Suleyman

Организации:DeepMind, Google

2010Соревнования

ImageNet Challenge: начало соревнования

Учреждение важнейшего эталона компьютерного зрения в истории ИИ. В 2010 году стартовал первый ImageNet Large Scale Visual Recognition Challenge (ILSVRC) — стандартизированное соревнование, которое определило направление исследований компьютерного зрения на следующее десятилетие. С 1 000 категориями объектов и 1,2 миллиона обучающих изображений этот конкурс значительно превзошёл доступные на тот момент эталоны, например PASCAL VOC, располагавший лишь 20 классами. Оценка проводилась по метрикам Top-1 и Top-5 ошибок — стандартам, актуальным и по сей день. С 2010 по 2017 год точность Top-5 у победителей существенно выросла: с 71,8 % до 97,3 %, в конечном счёте превысив уровень человека. Ежегодный конкурс привлёк более 50 организаций со всего мира и катализировал достижения, кульминацией которых в 2012 году стал значительный прорыв AlexNet — уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности).

Первый ILSVRC в 2010 году: 1 000 категорий и 1,2 миллиона обучающих изображений — значительно больше, чем у PASCAL VOC
Утвердил метрики Top-1 и Top-5 ошибок как стандарты оценки компьютерного зрения
Ежегодный конкурс с 2010 года привлёк более 50 организаций по всему миру и стимулировал развитие исследований
Создал конкурсную структуру, которая в 2012 году открыла путь к прорыву AlexNet: уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности)

Персоны:Fei-Fei Li, Olga Russakovsky, Alexander Berg

Организации:Stanford University, ImageNet Team

2011Соревнования

Watson побеждает чемпионов Jeopardy

Триумф IBM в обработке естественного языка и доказательство машинного понимания речи. 16 февраля 2011 года система IBM Watson в телевизионном шоу Jeopardy! победила двух самых успешных чемпионов за всю историю: Кена Дженнингса (74 победы подряд) и Брэда Раттера (3,25 миллиона долларов выигрышей до 2005 года). Watson, разработанный командой DeepQA под руководством Дэвида Феруччи, состоял из 90 серверов IBM Power 750 (в 10 стойках) с 16 терабайтами оперативной памяти и 2 880 процессорными ядрами POWER7. Новаторство заключалось в обработке естественного языка: Watson понимал вопросы на обычном языке и отвечал точнее любой стандартной поисковой технологии — без подключения к интернету. Выиграв 77 147 долларов (пожертвованных на благотворительность), Watson обошёл своих соперников-людей более чем на 50 000 долларов. Знаменитая заключительная реплика Кена Дженнингса — 'I for one welcome our new computer overlords' — подчеркнула историческое значение этого рубежа в области обработки естественного языка.

Победил легенд Jeopardy Кена Дженнингса и Брэда Раттера в телевизионном состязании
Первая телевизионная демонстрация развитых возможностей обработки естественного языка для миллионов зрителей
Система DeepQA объединила поиск по базе знаний со сложным логическим выводом без подключения к интернету
Комментарий Кена Дженнингса про 'computer overlords' подчеркнул культурное значение прогресса в области ИИ

Персоны:David Ferrucci, Ken Jennings, Brad Rutter

Организации:IBM Research, Jeopardy!, Sony Pictures Television

2011Продукты

Запуск Siri: голосовой ассистент становится массовым явлением

4 октября 2011 года Apple существенно изменила взаимодействие человека с компьютером, представив Siri на iPhone 4S. Как первый голосовой ассистент, глубоко интегрированный в смартфон для широкой аудитории, Siri принесла ИИ в карманы миллионов людей. 'Какая сегодня погода?' или 'Найди мне хороший греческий ресторан' — внезапно пользователи смогли говорить со своим телефоном естественным образом. Siri не была совершенно новым изобретением: с 2010 года она существовала как отдельное iOS-приложение компании Siri Inc. (приобретённой Apple), а Google уже предлагал голосовой поиск Voice Actions. Но именно бесшовная интеграция Apple в операционную систему превратила голосового ассистента в массовое явление. Siri опиралась на десятилетия исследований в SRI International и проекте CALO от DARPA. Сьюзан Беннетт ещё в 2005 году неосознанно записала оригинальный голос. Стив Джобс, тяжело больной в последние дни жизни, сам не выступил на презентации — iPhone 4S представлял Тим Кук. На следующий день после представления Siri Джобс скончался. Siri не была идеальной — критики указывали на жёсткие команды и недостаточную гибкость. Но цель была достигнута: ИИ стал массовым явлением. Siri вдохновила Amazon Alexa, Google Assistant и Microsoft Cortana. Эпоха голосовых ассистентов началась.

Первый голосовой ассистент, глубоко интегрированный в смартфон для миллионов пользователей по всему миру
Продвинутая обработка естественного языка обеспечила интуитивное взаимодействие человека с компьютером
Один из последних значимых продуктов Стива Джобса до его смерти 5 октября 2011 года
Основала современную эпоху голосовых ассистентов и вдохновила всех конкурентов

Персоны:Steve Jobs, Susan Bennett, Tom Gruber, Adam Cheyer

Организации:Apple, SRI International, DARPA

2012Публикации

Dropout-регуляризация

В июле 2012 года Джеффри Хинтон, Нитиш Шривастава, Алекс Крижевский, Илья Суцкевер и Руслан Салахутдинов значительно изменили обучение нейронных сетей, изобретя Dropout-регуляризацию. Эта элегантная техника предотвращает переобучение (Overfitting) путём случайного отключения примерно половины всех нейронов во время обучения, что устраняет сложные совместные адаптации. Вместо того чтобы запоминать специфические комбинации признаков, каждый нейрон учится распознавать устойчивые, универсально полезные паттерны. Метод, опубликованный на arXiv 3 июля 2012 года, несколько месяцев спустя стал одним из ключевых элементов победы AlexNet на ImageNet в рамках ILSVRC 2012, результаты которого были представлены в октябре 2012 года, — наряду с GPU-обучением, ReLU-активацией и глубиной сети, — и превратился в стандарт большинства современных архитектур глубокого обучения. Dropout устанавливает новые рекорды в распознавании речи и объектов и решает центральную проблему переобучения глубоких сетей.

Решает центральную проблему переобучения (Overfitting) глубоких нейронных сетей
Случайное отключение половины всех нейронов во время обучения
Один из ключевых элементов прорыва AlexNet на ImageNet — наряду с GPU-обучением, ReLU и глубиной сети
Стал стандартом в большинстве современных архитектур глубокого обучения

Персоны:Geoffrey Hinton, Nitish Srivastava, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov

Организации:University of Toronto

2012Прорывы

Успех AlexNet

Переломный момент для глубокого обучения и современного ИИ. 30 сентября 2012 года были опубликованы результаты конкурса ImageNet Challenge, который AlexNet выиграл с таким отрывом, что это навсегда изменило компьютерное зрение. Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон из Университета Торонто разработали CNN-архитектуру, которая превзошла конкурентов на впечатляющие 10,9 процентных пункта — улучшение, признанное в научном сообществе исключительным. Имея 60 миллионов параметров и используя инновационные методы, такие как активации ReLU и слои Dropout, AlexNet наглядно продемонстрировал практическое превосходство глубокого обучения. Это был момент, когда интересная теория стала доминирующей технологией. Янн ЛеКун назвал это 'несомненным переломным моментом в истории компьютерного зрения'. Реализация на основе GPU открыла путь к современному развитию ИИ.

AlexNet выиграл конкурс ImageNet 2012 с частотой ошибок 15,3% — на 10,9 процентных пункта лучше второго участника (26,2%)
60 миллионов параметров, активации ReLU, слои Dropout и обучение на GPU установили новые технические стандарты
Наглядно продемонстрировал практическое превосходство глубокого обучения и положил конец скептицизму в отношении нейронных сетей
Дал старт современному развитию ИИ и сделал CNN-архитектуры стандартом в компьютерном зрении

Персоны:Alex Krizhevsky, Geoffrey Hinton, Ilya Sutskever

Организации:University of Toronto, ImageNet Challenge, NIPS

2012Прорывы

Революция глубокого обучения

Год, ознаменовавший начало современной эпохи ИИ благодаря сочетанию наборов данных, вычислительной мощи GPU и нейронных архитектур. 2012 год отметил подъём глубокого обучения (Deep Learning) как доминирующей технологии ИИ — катализатором стала впечатляющая победа AlexNet на ImageNet. Это стало возможным благодаря конвергенции трёх факторов: набор данных ImageNet, созданный Фэй-Фэй Ли, предоставил огромное количество размеченных обучающих данных; вычисления на GPU обеспечили необходимую мощность для обучения глубоких сетей; улучшенные методы обучения — ReLU-активации и Dropout-регуляризация — преодолели прежние ограничения. Команда Джеффри Хинтона — Алекс Крижевский, Илья Суцкевер и сам Хинтон — доказала в доме родителей Крижевского на двух картах Nvidia, что глубокие нейронные сети практически применимы. AlexNet стал поворотным моментом для компьютерного зрения. Этот успех значительно усилил интерес к глубокому обучению и открыл путь к VGG, ResNet и, наконец, к сегодняшнему развитию генеративного ИИ.

Глубокое обучение (Deep Learning) утвердилось как доминирующая технология ИИ, завершив эпоху традиционных подходов машинного обучения
Победа AlexNet на ImageNet впервые продемонстрировала практическое превосходство глубоких нейронных сетей
Вычисления на GPU открыли возможность обучать крупные нейронные сети и коренным образом изменили методы исследований в области ИИ
Вызвало масштабные инвестиции в исследования глубокого обучения и промышленное внедрение нейронных архитектур

Персоны:Geoffrey Hinton, Yann LeCun, Yoshua Bengio, Alex Krizhevsky, Ilya Sutskever

Организации:University of Toronto, NYU, University of Montreal

2013Публикации

Word2Vec: слова как векторы

Преобразование представления слов через семантические векторные пространства. 16 января 2013 года Томас Миколов вместе со своей командой в Google опубликовал основополагающую статью 'Efficient Estimation of Word Representations in Vector Space'. Word2Vec изменил обработку естественного языка, представив слова в виде плотных, низкоразмерных векторов (как правило, от 100 до 300 измерений), отражающих семантические и синтаксические связи, — в противовес огромным, разреженным one-hot-векторам прежних методов. Две архитектурных варианта — CBOW (Continuous Bag of Words) и Skip-Gram — обучались на больших текстовых корпусах на основе наблюдения, что схожие слова встречаются в схожих контекстах. Знаменитый пример продемонстрировал векторную арифметику: король - мужчина + женщина = королева. С более чем 49 000 цитирований работа Миколова стала одной из самых влиятельных в области обработки естественного языка. Word2Vec заложил фундамент для всех современных техник встраивания (embedding) и открыл возможность семантических рассуждений в векторных пространствах. Это новшество проложило путь к архитектурам Transformer и современным большим языковым моделям.

Первые эффективные плотные низкоразмерные векторные представления слов с семантическими отношениями
Семантические и синтаксические закономерности через векторную арифметику: король - мужчина + женщина = королева
Открыл возможность аналогических рассуждений в векторных пространствах с помощью косинусного сходства и метрик расстояния
Заложил фундамент для современных техник встраивания и больших языковых моделей на основе Transformer

Персоны:Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean

Организации:Google, Google Research

2013Публикации

VAE: вариационные автокодировщики

Разработка вероятностных генеративных моделей посредством моделирования скрытого пространства. 20 декабря 2013 года Дидерик Кингма и Макс Веллинг опубликовали статью 'Auto-Encoding Variational Bayes'. Вариационные автокодировщики (VAE) соединяют сети кодировщика и декодировщика через вероятностное скрытое пространство — как правило, многомерное гауссово распределение. В отличие от детерминированных автокодировщиков, кодировщик представляет данные как распределения, а не отдельные точки, что позволяет осуществлять непрерывную интерполяцию и генерацию данных. Трюк репараметризации (Reparameterization Trick) делает случайность дифференцируемым элементом входных данных модели и обеспечивает стандартную оптимизацию по градиенту. В своих экспериментах VAE генерировали рукописные цифры (MNIST) и небольшие изображения лиц (Frey Faces) — пусть и размытые, но служащие доказательством применимости вариационного вывода. Эта работа заложила фундамент современного генеративного ИИ и оказала влияние на последующие вероятностные подходы вплоть до диффузионных моделей.

Вариационный вывод (Variational Inference) для эффективного приближения неподдающихся вычислению апостериорных распределений в непрерывных скрытых переменных
Вероятностное скрытое пространство позволяет осуществлять непрерывную интерполяцию и генерацию новых точек данных
Новаторское соединение архитектуры автокодировщика с масштабируемым вероятностным генеративным моделированием посредством амортизированного вариационного вывода
Архитектура кодировщик-декодировщик с трюком репараметризации для дифференцируемой случайности

Персоны:Diederik P. Kingma, Max Welling

Организации:University of Amsterdam

2014Публикации

Adam: стандартный оптимизатор глубокого обучения

Чтобы нейронная сеть обучалась, оптимизатор должен шаг за шагом поворачивать миллионы настроечных параметров в нужную сторону. В 2014 году Дидерик Кингма и Джимми Ба представили метод, который быстро стал самым востребованным в отрасли: Adam — название происходит от английского Adaptive Moment Estimation и не является аббревиатурой. Хитрость Adam в том, что для каждого отдельного параметра ведётся собственная, автоматически адаптируемая скорость обучения. Метод объединяет две проверенные идеи — импульс (momentum), сохраняющий предыдущее направление, и адаптивный размер шага в духе RMSProp. Результат: сети обучаются надёжно, без мучительного подбора скорости обучения. Статья стала одной из наиболее цитируемых в исследованиях ИИ. Если подходить честно: Adam — не панацея. В ряде случаев более простой SGD лучше обобщает данные на новые ситуации. Кроме того, Adam опирается на предшественников — AdaGrad и RMSProp, — а более поздние варианты, такие как AdamW (2017), пришлось доработать, чтобы исправить слабые места оригинала.

В 2014 году Дидерик Кингма и Джимми Ба представили оптимизатор Adam — название происходит от Adaptive Moment Estimation (не аббревиатура).
Adam автоматически адаптирует скорость обучения для каждого параметра, объединяя две идеи: импульс (momentum) и адаптивный размер шага (как в RMSProp).
Adam стал стандартным инструментом для обучения нейронных сетей — надёжным и без мучительной настройки скорости обучения. Статья входит в число наиболее цитируемых в исследованиях ИИ.
Adam — не панацея: в ряде случаев простой SGD обобщает данные лучше. Метод опирается на предшественников (AdaGrad, RMSProp); более поздние варианты, например AdamW (2017), устранили его недостатки.

Персоны:Diederik Kingma, Jimmy Ba

2014Наборы данных

MS COCO: золотой стандарт компьютерного зрения

В 2014 году исследовательская группа под руководством Microsoft Research, Корнеллского университета и Калифорнийского университета в Беркли существенно изменила исследования в области компьютерного зрения с помощью набора данных COCO (Common Objects in Context). В отличие от ImageNet с изолированными объектами, COCO показывал предметы в их естественном контексте — так, как они встречаются в реальном мире. 2,5 миллиона аннотаций в 328 000 изображениях, разделённых на 91 категорию в исходной статье, из которых 80 образуют актуальный по сей день эталон для задач обнаружения объектов, — всё это предметы повседневной жизни, которые узнал бы четырёхлетний ребёнок. Инновация заключалась в деталях: маски сегментации с точностью до пикселя вместо обычных ограничивающих рамок. COCO впервые обеспечил возможность точной локализации объектов и понимания сложных сцен. Набор данных стал золотым стандартом для обнаружения объектов, сегментации экземпляров и создания описаний изображений. От YOLO до Mask R-CNN — все ведущие модели компьютерного зрения оцениваются по COCO. Стандартизированные метрики, такие как средняя точность (mAP), сделали сравнение моделей объективно возможным. Спустя более десяти лет COCO по-прежнему остаётся важнейшим эталоном в сообществе компьютерного зрения. Без COCO не было бы современных систем обнаружения объектов в автономных транспортных средствах, системах видеонаблюдения и дополненной реальности.

Объекты в естественном контексте, а не изолированно — существенно изменило компьютерное зрение: от искусственных сцен к реальным
2,5 миллиона точных до пикселя аннотаций в 328 000 изображениях — беспрецедентное качество и глубина разметки
Золотой стандарт с метриками mAP для объективного сравнения моделей — определил оценку в компьютерном зрении
Фундамент для YOLO, Mask R-CNN и всех современных систем компьютерного зрения — от автономных автомобилей до дополненной реальности

Персоны:Tsung-Yi Lin, Michael Maire, Serge Belongie

Организации:Microsoft Research, Cornell University, UC Berkeley

2014Публикации

GAN — генеративно-состязательные сети

Иэн Гудфеллоу изобрёл генеративно-состязательные сети (GAN) в 2014 году за одну ночь в Монреале после посещения паба. Его новаторский подход заставляет две нейронные сети соревноваться в игре с минимакс-стратегией: генератор создаёт искусственные данные, дискриминатор пытается отличить настоящие данные от поддельных. Это состязательное обучение кардинально изменило генеративный ИИ. Оригинальная GAN 2014 года генерировала лишь небольшие размытые изображения (например, цифры и лица), однако проложила путь к последующей фотореалистичной генерации изображений. Работа, опубликованная в 2014 году на arXiv, стала одной из наиболее влиятельных статей в области ИИ и принесла Гудфеллоу широкую известность. За ней последовали сотни вариантов GAN.

Две нейронные сети в игре с минимакс-стратегией: генератор против дискриминатора
Изобретено за одну ночь 2014 года в Монреале после посещения паба — заработало сразу же
Математически элегантный подход к состязательной оптимизации
Кардинально изменило генеративный ИИ — проложило путь к последующей фотореалистичной генерации изображений

Персоны:Ian Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio

Организации:University of Montreal, NIPS Conference

2014Публикации

Механизм внимания: ключ к современным большим языковым моделям

Сентябрь 2014 года: Дзмитры Бахданау, Кюнхён Чо и Йошуа Бенжио опубликовали статью, которой предстояло навсегда изменить мир обработки естественного языка (NLP). 'Neural Machine Translation by Jointly Learning to Align and Translate' решила фундаментальную проблему моделей Sequence-to-Sequence. Прежние архитектуры кодировщик-декодировщик сжимали каждое входное предложение в единственный вектор фиксированной длины — информационное узкое место при длинных предложениях. Attention Бахданау стала значительным шагом вперёд: вместо фиксированного вектора модель использовала динамическое внимание к различным частям входного предложения. Подобно тому как человеческий глаз перемещается при чтении, внимание ИИ перескакивает между релевантными словами. Эта 'Additive Attention' стала концептуальным предшественником современных NLP-систем. Трансформер (2017), появившийся позже, опирался на идею внимания, но заменил аддитивный вариант более эффективным Scaled-Dot-Product Attention. Без концепции Attention Бахданау не было бы трансформеров, без трансформеров — ни семейства GPT, ни BERT. Этот прорыв произошёл за три года до выхода статьи 'Attention Is All You Need'.

Устранил узкое место в архитектуре кодировщик-декодировщик: переменная длина предложений вместо сжатия в фиксированный вектор
Динамическое внимание вместо статического кодирования: адаптивная фокусировка на релевантных частях входных данных
Обучается выравниванию между языками: какие слова соответствуют друг другу при переводе?
Концептуальный предшественник трансформеров: идея Attention Бахданау открыла путь к GPT, BERT и ChatGPT

Персоны:Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio

Организации:University of Montreal, Jacobs University Bremen

2014Продукты

Запуск Amazon Alexa и Echo

6 ноября 2014 года Amazon представил Alexa и умную колонку Echo, существенно изменив взаимодействие человека с технологиями. Поначалу Echo продавался только по приглашениям и исключительно для участников Prime; лишь с началом открытых продаж в 2015 году голосовой ИИ стал доступен широкому кругу потребителей и превратил дом в управляемую голосом среду. Опираясь на польскую технологию синтеза речи Ivona, приобретённую 24 января 2013 года, Amazon создал принципиально новый пользовательский опыт. Echo стартовал как устройство для управления музыкой, однако быстро превратился в универсальный центр умного дома. Это новшество породило массовую категорию продуктов и ознаменовало начало масштабного развития рынка умных колонок, вдохновив многочисленных конкурентов.

Создал массовую категорию умных колонок с постоянной голосовой готовностью
С началом открытых продаж в 2015 году сделал голосовой ИИ доступным для миллионов потребителей, а не только для технических энтузиастов
Превратил гостиную в управляемый голосом центр умного дома
Ознаменовал начало масштабного развития рынка — Google, Apple и другие последовали примеру

Персоны:Jeff Bezos, Amazon Alexa Team

Организации:Amazon, Ivona (acquired 2013)

2015Прорывы

Deep Q-Networks: ИИ учится играть в Atari по пикселям

Задолго до того как AlphaGo попал в заголовки газет, DeepMind в 2015 году научила ИИ играть в видеоигры Atari, опираясь исключительно на сырые пиксели изображения, — и тем самым заложила фундамент глубокого обучения с подкреплением. В феврале 2015 года команда под руководством Владимира Мних опубликовала в Nature статью 'Human-level control through deep reinforcement learning' (предварительная версия вышла в 2013 году). Нейронная сеть, которая видела лишь экран и счёт, обучилась играть в 49 различных игр Atari — с одной и той же архитектурой, без дополнительной настройки под каждую игру. Технически DeepMind объединила свёрточную сеть с Q-обучением, буфером опыта (Experience Replay, введённым Лином в начале 1990-х) и стабилизирующей целевой сетью. При оценке важна точность: система достигала человеческого уровня примерно в половине игр и превзошла все прежние методы в 43 из 49 — однако в играх с редкими наградами, таких как Montezuma's Revenge, её результат был почти нулевым. Тем не менее это стало доказательством того, что глубокие сети и обучение с подкреплением совместимы в большом масштабе — мостом от Q-обучения 1990-х к AlphaGo и AlphaZero.

Обучение по сырым пикселям: система видела лишь экран и счёт — никаких ручных признаков, никаких специальных знаний для каждой игры.
Свёрточная сеть + Q-обучение + буфер опыта (Experience Replay, введённый Лином в начале 1990-х) + целевая сеть, добавленная в 2015 году для стабилизации обучения.
Человеческий уровень достигнут примерно в половине из 49 игр (43/49 лучше прежних методов) — в играх с редкими наградами (Montezuma's Revenge) результат близок к нулю.
Старт глубокого обучения с подкреплением; сделал DeepMind известным до AlphaGo — мост от Q-обучения к AlphaGo и AlphaZero.

Персоны:Volodymyr Mnih, David Silver, Demis Hassabis

Организации:Google DeepMind

2015Публикации

Batch Normalization: важный прогресс в обучении нейронных сетей

11 февраля 2015 года Сергей Иоффе и Кристиан Сегеди из Google опубликовали статью, которая существенно изменила обучение глубоких нейронных сетей. Их диагноз: 'Internal Covariate Shift' — распределение входных данных каждого слоя смещается в процессе обучения, что делает его нестабильным. Их элегантное решение: Batch Normalization (пакетная нормализация) нормализует активации каждого слоя для каждого мини-пакета. Эффект оказался значительным: примерно в 14 раз меньше шагов обучения до достижения той же точности. Стали возможны более высокие скорости обучения, Dropout нередко оказывался лишним, а инициализация — менее критичной. Метод выступал одновременно и как регуляризатор, и как ускоритель. Ансамбль на ImageNet достиг 4,8% ошибок в топ-5, превзойдя тем самым людей-оценщиков (около 5,1%). Примечательно: последующие исследования (Santurkar и др., 2018) показали, что истинный механизм действия связан не столько с подавлением Covariate Shift, сколько со сглаживанием ландшафта функции потерь — то есть исходное объяснение сегодня считается относительным. Статья, набравшая уже более 60 000 цитирований, вдохновила множество методов нормализации: GroupNorm, LayerNorm, InstanceNorm. Сегодня Batch Normalization является стандартом во многих современных архитектурах — от ResNet до актуальных CNN. Трансформеры, напротив, как правило используют вдохновлённую этой работой Layer Normalization.

Решил проблему Internal Covariate Shift путём нормализации активаций в каждом мини-пакете
Примерно в 14 раз меньше шагов обучения до той же точности — стали возможны более высокие скорости обучения и устойчивая инициализация
Двойная польза: ускорение И регуляризация — нередко заменяет Dropout в современных архитектурах
4,8% ошибок в топ-5 на ImageNet с ансамблем — превзошло людей-оценщиков (около 5,1%) и установило новый стандарт

Персоны:Sergey Ioffe, Christian Szegedy

Организации:Google Inc., ICML Conference

2015Публикации

YOLO: You Only Look Once

Трансформация детекции объектов в реальном времени через унифицированную однопроходную архитектуру. 8 июня 2015 года Джозеф Редмон, Сантош Диввала, Росс Гиршик и Али Фархади представили прорывную статью 'You Only Look Once: Unified, Real-Time Object Detection'. YOLO преодолел традиционную двухэтапную парадигму детекции объектов и сформулировал детекцию как задачу регрессии для пространственно разделённых bounding boxes. Одна нейронная сеть предсказывает bounding boxes и вероятности классов непосредственно из полных изображений за одну оценку. С базовой производительностью 45 fps и Fast YOLO на поразительных 155 fps система была в сотни-тысячи раз быстрее существующих детекторов. Архитектура на основе сетки разделяла изображения на ячейки, где каждая ячейка предсказывает объекты в своём центре.

Базовая производительность 45 fps, Fast YOLO 155 fps — в сотни-тысячи раз быстрее существующих детекторов
Однопроходная архитектура формулирует детекцию объектов как задачу регрессии вместо двухэтапной парадигмы
Разделение на ячейки с прямым предсказанием bounding box и вероятностей классов
Сделал возможным компьютерное зрение в реальном времени для автономных автомобилей, видеонаблюдения и мобильных приложений

Персоны:Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi

Организации:University of Washington, Allen Institute, Facebook AI Research

2015Прорывы

Разработка DeepMind AlphaGo

В октябре 2015 года DeepMind достиг исторического прорыва: AlphaGo стал первой системой ИИ, победившей профессионального игрока в го на полной доске без форы. AlphaGo обыграл европейского чемпиона по го Фань Хуэя со счётом 5:0, завоевав тем самым самую сложную классическую настольную игру в мире — на десятилетие раньше, чем прогнозировали эксперты. Поначалу матч оставался в тайне; публично об успехе объявили лишь 27 января 2016 года — одновременно с публикацией в научном журнале Nature. Го несравнимо сложнее шахмат — примерно в гугол (10^100) раз больше допустимых позиций, а число возможных конфигураций доски превышает количество атомов в наблюдаемой вселенной. Этот замечательный успех демонстрирует мощь нейронных сетей и поиска Монте-Карло по дереву.

Первая победа компьютера над профессиональным игроком в го на полной доске без форы (Фань Хуэй 5:0)
Новаторский подход с использованием глубоких нейронных сетей вместо жёстко закодированных алгоритмов
Преодоление 10^170 возможных конфигураций доски — больше, чем атомов во вселенной
Прорыв произошёл на десятилетие раньше, чем прогнозировали эксперты в области ИИ

Персоны:Demis Hassabis, David Silver, DeepMind Team

Организации:DeepMind, Google

2015Продукты

Автопилот Tesla: системы помощи водителю для массового рынка

14 октября 2015 года Tesla выпустила программную версию 7.0 и тем самым впервые активировала автопилот для автомобилей Model S. Аппаратное обеспечение было установлено в автомобилях ещё в сентябре 2014 года — за год до программной активации. Система использовала технологию Mobileye с фронтальной камерой, радаром и 12 ультразвуковыми датчиками. Водители получили возможность пользоваться адаптивным круиз-контролем, системой удержания полосы движения и автоматической парковкой — функциями, прежде доступными только в автомобилях премиум-класса. Tesla охарактеризовала это как автономность 2-го уровня: система помогает водителю, но не заменяет его. При выпуске Маск подчеркнул: 'Мы рекомендуем водителям держать руки на руле.' Уже в первый год автопарк Tesla собрал сотни миллионов километров с активным автопилотом — к концу 2016 года Tesla сообщила о примерно 222 миллионах пройденных миль. Концепция — предустановить аппаратное обеспечение, а функции открывать через обновления программного обеспечения — показала автомобильной промышленности новый путь. От Mercedes до чисто технологических поставщиков, таких как Mobileye, многочисленные игроки продвигали собственные системы помощи водителю.

Программное обновление от 14 октября 2015 года активировало предустановленное аппаратное обеспечение — новая концепция для автомобильной промышленности
Сенсорика на базе Mobileye: фронтальная камера, радар и 12 ультразвуковых датчиков для помощи водителю 2-го уровня
Адаптивный круиз-контроль, система удержания полосы и автоматическая парковка — прежде функции премиум-класса
Сотни миллионов километров уже в первый год — продемонстрировала готовность массового рынка к системам помощи водителю

Персоны:Elon Musk, Tesla Engineering Team

Организации:Tesla Inc., Mobileye

2015Продукты

TensorFlow: ML-фреймворк Google становится открытым

Демократизация машинного обучения благодаря мощному внутреннему инструменту Google. 9 ноября 2015 года Google открыл исходный код TensorFlow под лицензией Apache 2.0 и сделал свою вторую ML-систему доступной для всех. TensorFlow заменил внутреннюю систему DistBelief и предложил двукратную скорость с улучшенной масштабируемостью и готовностью к производству. Как универсальный процессор графов вычислений TensorFlow позволял не только глубокое обучение, но и любые дифференцируемые вычисления. Гибкий интерфейс Python, автоматическое дифференцирование и первоклассные оптимизаторы революционизировали ML-разработку. Стратегия Google: разработка на основе сообщества ускоряет прогресс ИИ для всех. Разработанный более чем 30 авторами из команды Google Brain, TensorFlow стал одной из ведущих ML-платформ и позволил миллионам разработчиков создавать продвинутые ИИ-приложения.

Лицензия Apache 2.0 сделала мощную внутреннюю ML-систему Google свободно доступной для всех
Заменил DistBelief с двукратной скоростью и улучшенной масштабируемостью
Гибкий интерфейс Python и автоматическое дифференцирование значительно улучшили ML-разработку
Позволил миллионам разработчиков получить доступ к продвинутой ИИ-технологии

Персоны:Martín Abadi, Ashish Agarwal, Paul Barham, Jeff Dean

Организации:Google, Google Brain

2015Публикации

ResNet: остаточные сети меняют глубокое обучение

Решение проблемы деградации очень глубоких сетей и рождение ультраглубоких нейронных архитектур. 10 декабря 2015 года команда Кайминга Хэ в Microsoft Research опубликовала статью 'Deep Residual Learning for Image Recognition' и существенно изменила глубокое обучение. До этого точность обучения ухудшалась при увеличении глубины сетей — не столько из-за затухающих градиентов, сколько потому, что глубокие сети было просто сложнее оптимизировать. ResNet ввёл остаточные соединения (residual connections) — пропускные связи, которые напрямую передают входные данные более поздним слоям и позволяют обучать ультраглубокие нейронные сети. При 152 слоях ResNet был в восемь раз глубже VGG, но менее сложным. Замечательный результат: 3,57 % ошибок Top-5 (ансамбль моделей) на ImageNet — триумф, который обеспечил первое место во всех категориях. ResNet выиграл ImageNet Classification, Detection, Localization, а также COCO Detection и Segmentation в 2015 году. Фреймворк остаточного обучения переосмыслил слои как обучение остаточным функциям (residual functions) вместо безреференсных функций. Это новшество открыло возможность обучать сети с сотнями слоёв.

Пропускные соединения напрямую передают входные данные и позволяют обучать ультраглубокие нейронные сети
152 слоя — в 8 раз глубже VGG, но менее сложный благодаря фреймворку остаточного обучения
3,57 % ошибок Top-5 (ансамбль) на ImageNet, победа во всех категориях ILSVRC и COCO 2015
Утвердил остаточные соединения (residual connections) как стандарт для современных архитектур глубокого обучения

Персоны:Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

Организации:Microsoft Research

2015Вехи

Основание OpenAI

Организация, стремившаяся сделать ИИ доступным для всех, — и изменившая мир. 11 декабря 2015 года Сэм Альтман, Илон Маск и другие известные технологические деятели объявили об основании OpenAI. Заявив о намерении привлечь миллиард долларов — финансовом обещании инвесторов, распределённом на несколько лет, из которого поначалу реально поступила лишь небольшая часть, — и поставив целью разработку безопасного общего ИИ на благо всего человечества, OpenAI вышла на арену как некоммерческая исследовательская организация. То, что начиналось как идеалистическое начинание, превратилось в наиболее влиятельную лабораторию ИИ в мире. В 2019 году была учреждена дочерняя коммерческая компания. С GPT-3 и ChatGPT OpenAI заново определила, на что способен ИИ.

Основана 11 декабря 2015 года в Сан-Франциско
Миссия: разработать безопасный общий ИИ на благо всего человечества
Обещано: 1 миллиард долларов от Илона Маска, Питера Тиля, Рида Хоффмана и других — финансовое обещание на несколько лет, не доступное немедленно
GPT-1 (2018) и GPT-2 (2019) были созданы ещё в период чисто некоммерческой деятельности; в 2019 году появилась структура capped-profit, в рамках которой создавались GPT-3 (2020) и ChatGPT (2022)

Персоны:Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, Wojciech Zaremba, John Schulman

Организации:OpenAI, Y Combinator

2016Соревнования

AlphaGo побеждает Ли Седоля

Исторический момент, когда ИИ впервые победил чемпиона мира в сложнейшей настольной игре. С 9 по 15 марта 2016 года в Сеуле прошёл матч DeepMind Challenge Match — пять партий между Ли Седолем, одним из лучших игроков в го в мире, и AlphaGo. Результат поразил мир: 4:1 в пользу машины. Особенно знаменитый «ход 37» во второй партии продемонстрировал машинную креативность — ход с вероятностью 1:10000, перевернувший вековые истины го. AlphaGo сочетал глубокое обучение с поиском по дереву Монте-Карло и обучался как на человеческих партиях, так и на самоигре. Однако ответ Ли Седоля в четвёртой партии с его «божественным ходом 78» показал, что человеческая интуиция всё ещё может удивлять. Более 200 миллионов человек по всему миру следили за этими партиями.

AlphaGo победил Ли Седоля 4:1 и впервые продемонстрировал превосходство ИИ в сложнейшей настольной игре
Знаменитый «ход 37» с вероятностью 1:10000 показал машинную креативность и бросил вызов традициям го
Сочетание глубокого обучения и поиска по дереву Монте-Карло позволило освоить сложность го
Более 200 миллионов человек следили за партиями — поворотный момент в общественном восприятии ИИ

Персоны:Lee Sedol, Demis Hassabis, David Silver, Aja Huang

Организации:DeepMind, Google, Korean Baduk Association

2016Публикации

XGBoost: Extreme Gradient Boosting доминирует в ML

Совершенствование градиентного бустинга и завоевание задач на структурированных данных. 9 марта 2016 года Тяньци Чен и Карлос Гестрин опубликовали на arXiv статью 'XGBoost: A Scalable Tree Boosting System', представленную в августе 2016 на конференции KDD. Разработанный из PhD-проекта Чена в University of Washington, XGBoost значительно улучшил традиционный градиентный бустинг через экстремальные оптимизации: L1- и L2-регуляризация предотвращала переобучение, градиенты второго порядка давали более точную информацию о направлении, а параллелизация значительно ускорила построение деревьев. XGBoost доминировал в соревнованиях машинного обучения 2010-х и стал стандартным выбором для команд-победителей на Kaggle. На Higgs Boson ML Challenge Тяньци Чен получил специальный приз, и XGBoost использовался многими топ-участниками.

Экстремальная оптимизация градиентного бустинга с L1/L2-регуляризацией и градиентами второго порядка
Доминировал в ML-соревнованиях 2010-х и стал стандартным выбором для команд-победителей Kaggle
Параллелизованное построение деревьев и масштабируемая сквозная архитектура для больших датасетов
Основной алгоритм для структурированных данных параллельно с революцией глубокого обучения

Персоны:Tianqi Chen, Carlos Guestrin

Организации:University of Washington

2016Продукты

Google Assistant: стратегия 'ИИ прежде всего' становится реальностью

18 мая 2016 года Сундар Пичаи на конференции Google I/O представил Google Assistant — ответ Google на Siri и Alexa. После многих лет отставания в области голосовых помощников Google догонял конкурентов в полную силу. Assistant был чем-то большим, чем просто обновление Google Now, — он стал фундаментом стратегии Пичаи 'ИИ прежде всего' (AI-First). 'Мы хотим, чтобы пользователи вели непрерывный диалог с Google', — объяснил Пичаи. 'Мы создаём индивидуальный Google для каждого пользователя.' Планировалось, что Assistant станет 'ambient experience', охватывающим все устройства — от смартфонов до Google Home и автомобилей. В отличие от конкурентов, работавших на основе команд, Google делал ставку на естественный диалог и понимание контекста. Поначалу Assistant был лишь анонсирован; первым его домом стало приложение для обмена сообщениями Allo, а затем, в конце 2016 года, умная колонка Google Home. Запуск ознаменовал серьёзный выход Google в разработку голосового ИИ и заложил основу для нынешнего доминирования компании в области ИИ.

Естественный диалог вместо команд — 'непрерывный разговор' как цель голосового ИИ
Фундамент стратегии Пичаи 'ИИ прежде всего' — 'индивидуальный Google' для каждого пользователя
Концепция ambient experience — бесшовное взаимодействие с ИИ на всех устройствах и платформах
Догоняющий марш Google против Siri и Alexa — от аутсайдера к претенденту на лидерство в голосовом ИИ

Персоны:Sundar Pichai, Google Assistant Team

Организации:Google Inc., Google I/O Conference

2016Организации

Partnership on AI: технологические гиганты объединяются

Значимый альянс ведущих технологических компаний ради ответственного развития ИИ. 28 сентября 2016 года Amazon, Facebook, Google, DeepMind, IBM и Microsoft основали 'Partnership on Artificial Intelligence to Benefit People and Society' — необычную коалицию бывших конкурентов. С Эриком Хорвицем (Microsoft Research) и Мустафой Сулейманом (DeepMind) в роли временных сопредседателей Partnership поначалу имела совет директоров, состоявший исключительно из корпоративных представителей, объявив о планах преобразовать его в паритетный орган с равным числом некорпоративных членов. Миссия охватывает исследования и лучшие практики в области этики, справедливости, прозрачности, защиты данных и взаимодействия человека и ИИ. Примечательно: Apple поначалу отсутствовала, но присоединилась в 2017 году. Partnership сознательно отказывается от лоббирования и сосредоточивается на научном сотрудничестве. Эта инициатива ознаменовала начало структурированного отраслевого саморегулирования в развитии ИИ.

Значимый альянс Amazon, Facebook, Google, DeepMind, IBM и Microsoft в области этики ИИ
Миссия: ИИ на благо людей и общества через этику, справедливость и прозрачность
Запланированный паритетный совет: на старте состоял из корпоративных представителей, позднее дополненный равным числом некорпоративных членов
Фокус на научном сотрудничестве и лучших практиках без лоббирования

Персоны:Mustafa Suleyman, Eric Horvitz, Partnership Team

Организации:Amazon, Apple, Facebook, Google, IBM, Microsoft

2016Прорывы

Распознавание речи достигает уровня человека

18 октября 2016 года Microsoft добился исторического успеха: впервые компания достигла производительности уровня человека в системе распознавания речи на эталонном тесте Switchboard для разговорной речи. После 25 лет исследований цель была достигнута — уровень ошибок слов 5,9 %, что соответствует точности профессиональных транскрибистов на этой задаче. (В 2017 году Microsoft скорректировал человеческий показатель до 5,1 % и был вынужден снова догонять.) Сюэдун Хуан, главный учёный Microsoft по речевым технологиям, объявил: 'Мы достигли паритета с человеком. Это историческое достижение.' Система использовала новейшие технологии глубокого обучения: свёрточные нейронные сети, архитектуры LSTM и нейронные языковые модели с непрерывными векторами слов. Сила заключалась в систематическом сочетании проверенных компонентов — ансамбль акустических моделей CNN и BLSTM, адаптация к диктору с помощью i-vector и переоценка с помощью языковой модели. Это стало возможным благодаря конвергенции трёх факторов: больших наборов данных (Switchboard Corpus), вычислений на GPU и улучшенных методов обучения. Это достижение открыло путь для современных голосовых ассистентов — однако оно подтверждает паритет лишь в узко определённой задаче транскрипции, а не общие когнитивные способности человека.

Уровень ошибок слов 5,9 % достигает человеческого уровня на Switchboard: точность профессиональных транскрибистов
Исторический рубеж: наименьший уровень ошибок, когда-либо зафиксированный в стандарте Switchboard
CNN + LSTM + нейронные языковые модели: систематическое сочетание передовых технологий глубокого обучения
25-летняя исследовательская цель достигнута: паритет с человеком в узко определённой задаче транскрипции

Персоны:Xuedong Huang, Microsoft AI Research Team

Организации:Microsoft AI and Research, Switchboard Corpus

2017Регулирование

Принципы Асиломара: экспертное сообщество устанавливает ориентиры

В начале 2017 года, задолго до ChatGPT, ведущие исследователи ИИ собрались в Асиломаре на побережье Калифорнии — там же, где биологи в 1975 году обсуждали риски генной инженерии. Конференцию по полезному ИИ организовал Future of Life Institute. Итогом стали 23 Асиломарских принципа ИИ: руководящие принципы в области исследований, таких ценностей, как безопасность и прозрачность, а также долгосрочных рисков. Под ними подписались более тысячи специалистов по ИИ, в том числе такие известные фигуры, как Стивен Хокинг и Илон Маск. Это была одна из первых масштабных попыток экспертного сообщества установить для себя ориентиры — за многие годы до того, как к теме обратились правительства. Если подходить честно: принципы носили добровольный и необязательный характер. Они повлияли на дискуссию, однако не имели юридической силы.

Январь 2017: Future of Life Institute собрал ведущих исследователей ИИ в Асиломаре (Калифорния) — на месте исторической конференции по генной инженерии 1975 года.
Итог: 23 Асиломарских принципа ИИ по исследованиям, ценностям (безопасность, прозрачность) и долгосрочным рискам — одна из первых масштабных добровольных обязательств экспертного сообщества.
Более тысячи исследователей ИИ и других подписантов (в т. ч. Стивен Хокинг, Илон Маск) — ранний консенсус о том, что ИИ должен служить общественному благу.
Принципы носили добровольный и необязательный характер — важный дискуссионный ориентир, но без механизма исполнения.

Персоны:Stephen Hawking, Elon Musk

Организации:Future of Life Institute

2017Публикации

MobileNet — ИИ для смартфонов

В апреле 2017 года Google Research существенно изменил мобильный ИИ с помощью MobileNet — одной из первых моделей глубокого обучения, специально разработанной для смартфонов, интернета вещей и встраиваемых систем (предшественники, такие как SqueezeNet, уже существовали). Благодаря инновационной архитектуре Depthwise Separable Convolution MobileNet снижает вычислительные затраты при сохранении той же эффективности примерно до одной восьмой по сравнению с обычными свёртками. Эта примечательная эффективность — около девяти раз меньше вычислительных операций при ядрах 3x3 — открывает путь к обработке изображений в реальном времени на мобильных устройствах. MobileNet демократизировал компьютерное зрение для миллиардов смартфонов и утвердил граничные вычисления (edge computing) как новую ИИ-парадигму за пределами облачных решений.

Одна из первых моделей глубокого обучения, специально разработанная для смартфонов и устройств интернета вещей
Depthwise Separable Convolutions: около девяти раз меньше вычислительных затрат при той же эффективности
Обеспечивает обработку ИИ непосредственно на устройствах, а не в облаке — граничные вычисления (edge computing)
Снижает вычислительные затраты примерно до одной восьмой по сравнению с обычными свёртками при сопоставимой точности

Персоны:Andrew Howard, Menglong Zhu, Bo Chen, Google Research Team

Организации:Google, Google Research

2017Публикации

Публикация исследовательской статьи о RLHF

Техника, которая сделала ChatGPT возможным — за годы до прорыва. В июне 2017 года исследователи из OpenAI и DeepMind опубликовали статью «Deep Reinforcement Learning from Human Preferences». Идея: вместо обучения ИИ-систем с идеально определёнными функциями вознаграждения, они учатся напрямую из человеческой обратной связи. Люди оценивают различные выводы ИИ, и система учится, какое поведение предпочтительно. Этот метод, позже известный как RLHF (обучение с подкреплением на основе человеческой обратной связи), стал ключевой технологией за ChatGPT и другими современными языковыми моделями. RLHF позволил сделать ИИ-системы более полезными, честными и безопасными.

Статья «Deep Reinforcement Learning from Human Preferences» опубликована в июне 2017 года
Ключевая идея: ИИ учится из человеческих предпочтений вместо предопределённых вознаграждений
Совместное исследование OpenAI и DeepMind, в т.ч. Пол Кристиано и Дарио Амодеи
RLHF стал ключевой технологией для ChatGPT и современных ИИ-ассистентов

Персоны:Paul Christiano, Jan Leike, Dario Amodei, Tom Brown

Организации:OpenAI, DeepMind

2017Публикации

Трансформер: 'Attention Is All You Need'

12 июня 2017 года восемь исследователей — преимущественно из Google, среди которых был и стажёр Университета Торонто — опубликовали на arXiv статью 'Attention Is All You Need' — основу современных больших языковых моделей. Эшиш Васвани, Ноам Шазир и их коллеги предложили новую архитектуру: трансформер (Transformer). В отличие от прежних моделей последовательностей, трансформер отказывается от рекуррентных и свёрточных слоёв. Вместо них используются чистые механизмы внимания. Механизм самовнимания (Self-Attention) улавливает связи между всеми позициями последовательности параллельно — последовательная обработка больше не нужна. Многоголовое внимание (Multi-Head Attention) использует несколько параллельных голов внимания, обучающихся различным аспектам отношений между словами. На наборе WMT 2014 модель достигла показателя 28,4 BLEU для пары английский — немецкий и 41,8 BLEU для пары английский — французский — новые рекорды. Архитектура оказалась широко применимой: GPT, BERT, ChatGPT и многие другие модели основаны на вариантах трансформера. Статья набрала значительно более 100 000 цитирований — и эта цифра неуклонно растёт — и входит в число наиболее цитируемых научных работ XXI века.

Механизм самовнимания (Self-Attention) улавливает зависимости между всеми позициями последовательности одновременно
Отказ от рекуррентности обеспечивает параллельную обработку — значительно быстрее, чем последовательные модели
28,4 BLEU WMT английский — немецкий, 41,8 BLEU английский — французский — новые стандарты машинного перевода
Стал основой всех современных больших языковых моделей: GPT, BERT, ChatGPT построены на архитектуре трансформера

Персоны:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin

Организации:Google Brain, Google Research

2017Регулирование

Генеральный план Китая по ИИ: борьба за мировое лидерство

20 июля 2017 года Государственный совет Китая объявил 'План развития искусственного интеллекта нового поколения' — первую комплексную национальную стратегию в области ИИ такого масштаба. Цель: к 2030 году стать мировой державой-лидером в области ИИ. Трёхэтапный план был чётко сформулирован: к 2020 году — конкурентоспособность на глобальном уровне; к 2025 году — мировое лидерство в отдельных областях и крупные прорывы в фундаментальной теории ИИ; к 2030 году — ведущая ИИ-сверхдержава с объёмом индустрии в 1 триллион юаней. Китай прямо обозначил ИИ как 'фокус международной конкуренции' и 'стратегическую технологию для национальной безопасности'. Инвестиции значительны: десятки миллиардов долларов направляются в исследования, инфраструктуру и развитие кадров. План охватывает военные и гражданские применения: от автономного оружия до умных городов. Принципы открытого исходного кода призваны содействовать международному сотрудничеству, тогда как Китай одновременно добивается технологической независимости. Эта стратегия существенно изменила глобальный ИИ-ландшафт и спровоцировала волну национальных ИИ-инициатив в США и Европе.

Первая национальная ИИ-стратегия такого масштаба: скоординированное государственное планирование для достижения глобального технологического лидерства
Трёхэтапная временная шкала: к 2020 — конкурентоспособность, к 2025 — мировое лидерство в отдельных областях, к 2030 — ведущая ИИ-сверхдержава
Инвестиции в триллион юаней: масштабное государственное финансирование исследований в области ИИ, инфраструктуры и кадров
Амбиция мирового лидерства: начало глобального ИИ-соревнования между Китаем, США и Европой

Персоны:State Council of China, Chinese AI Research Community

Организации:State Council of China, Chinese Academy of Sciences

2017Регулирование

Монреальская декларация об ответственном ИИ

Первая международная инициатива, разработавшая этические принципы ИИ посредством демократического участия граждан. 3 ноября 2017 года Университет Монреаля запустил процесс совместного создания Монреальской декларации об ответственном развитии ИИ. Форум по общественно ответственному развитию ИИ собрал более 400 участников из различных секторов и дисциплин. В ходе 15 дискуссионных семинаров на протяжении трёх месяцев более 500 граждан, экспертов и заинтересованных сторон обсуждали общественные вызовы, связанные с ИИ. Опубликованная 4 декабря 2018 года декларация представляет 10 принципов и 59 рекомендаций, основанных на таких ценностях, как благополучие, автономия, справедливость, конфиденциальность и демократия. Набрав более 500 подписантов, Монреальская декларация утвердила партисипативный подход к управлению ИИ и оказала влияние на последующие международные усилия по ответственному развитию ИИ.

10 этических принципов и 59 рекомендаций по ответственному развитию ИИ с демократической легитимностью
Акцент на благополучии, автономии, справедливости, конфиденциальности, демократии и экологической устойчивости
Инициирован Университетом Монреаля с участием более 400 представителей различных секторов
Более 500 подписантов; повлиял на международное управление ИИ и последующие регуляторные инициативы

Персоны:Yoshua Bengio, Montreal AI Ethics Team

Организации:Université de Montréal, Montreal Institute for Learning Algorithms

2017Прорывы

AlphaZero осваивает три игры

Рождение универсального игрового ИИ посредством чистого самообучения. В декабре 2017 года DeepMind представил AlphaZero — систему, освоившую три совершенно разные стратегические игры без каких-либо предварительных знаний: шахматы, сёги и го. Подход tabula rasa означал: никаких дебютных баз, никаких человеческих стратегий — только правила игры в качестве отправной точки. За 24 часа AlphaZero достиг сверхчеловеческого уровня — в шахматах уже через 4 часа, в сёги через 2 часа. В матче из 100 партий против Stockfish он выиграл 28 партий, не проиграл ни одной и свёл 72 к ничьей. Особенность заключалась в эффективном поиске: пока Stockfish оценивает 60 миллионов позиций в секунду, AlphaZero анализирует лишь 60 000 — но значительно целенаправленнее благодаря своей глубокой нейронной сети. Это достижение убедительно продемонстрировало универсальность и доменную независимость чистого обучения с подкреплением.

Освоил три сложные игры полностью с нуля — только на основе правил, без человеческих знаний или баз данных
Достиг сверхчеловеческого уровня в шахматах (4 ч), сёги (2 ч) и го (~8 ч) посредством чистого самоигры
Обучался через миллионы партий самоигры и обучение с подкреплением без внешних данных
Оценивал лишь 60 000 позиций в секунду против 60 миллионов у Stockfish — но значительно целенаправленнее

Персоны:David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou

Организации:DeepMind, Google, Science Magazine, ArXiv

2018Вехи

Премия Тьюринга за глубокое обучение

В 2019 году ИИ получил высшую награду информатики: премия А.М. Тьюринга 2018 года — нередко именуемая Нобелевской премией по информатике — была присуждена Йошуа Бенжио, Джеффри Хинтону и Яну ЛеКуну, трём крёстным отцам глубокого обучения. Ассоциация вычислительной техники (ACM) отметила их концептуальные и технические прорывы, сделавшие глубокие нейронные сети центральным элементом информатики — от метода обратного распространения ошибки и свёрточных сетей до идей, обеспечивших прорыв 2012 года. Награда стала запоздалым официальным признанием революции, над которой десятилетиями насмехались. Важная оговорка: у глубокого обучения много авторов — такие исследователи, как Юрген Шмидхубер, публично критиковали недостаточную оценку важных вкладов. Премия отмечает центральную роль трио, но не единоличное авторство.

Йошуа Бенжио, Джеффри Хинтон и Ян ЛеКун — три крёстных отца глубокого обучения — за прорывы, лежащие в основе современных нейронных сетей.
Премия А.М. Тьюринга (объявлена в марте 2019 года) является высшей наградой в области информатики; отмечены глубокие нейронные сети как центральный элемент вычислений.
Официальное признание революции глубокого обучения 2012 года — и предвестник Нобелевской премии по физике 2024 года за ту же исследовательскую линию.
Важная оговорка: у глубокого обучения множество авторов (например, Шмидхубер, публично критиковавший недооценку своих работ); премия отмечает центральную роль трио, но не единоличное авторство.

Персоны:Yoshua Bengio, Geoffrey Hinton, Yann LeCun

Организации:ACM

2018Регулирование

GDPR: переломный момент в защите данных с влиянием на ИИ

25 мая 2018 года вступил в силу Общий регламент по защите данных ЕС (GDPR/DSGVO) — переломный момент для ИИ и защиты данных во всём мире. Как 'мать всех законов о защите данных' он заменил устаревшую директиву 95/46/ЕС 1995 года, принятую в эпоху зарождения интернета. GDPR ввёл принцип 'Privacy by Design' как обязательное требование: защита данных должна быть встроена в системы ИИ с самого начала. Глобальный охват регламента оказался весьма широким — даже технологические гиганты США обязаны соблюдать стандарты ЕС при обработке европейских данных. Для ИИ это стало принципиальным вызовом: как объяснить работу алгоритмов-'чёрных ящиков', когда GDPR требует прозрачности? Наблюдатели усмотрели в этом стимул к разработке более экономных с точки зрения данных систем ИИ, а методы вроде Transfer Learning приобрели большее значение. GDPR вдохновил законы о защите данных по всему миру — от Калифорнии до Сингапура. Регламент подготовил почву для Закона об ИИ ЕС 2024 года: от защиты данных к регулированию ИИ был всего один логичный шаг.

Обязательный принцип 'Privacy by Design': защита данных должна быть интегрирована в системы ИИ с самого начала
Вызов прозрачности ИИ: алгоритмы-'чёрные ящики' против требований GDPR об объяснимости
Глобальный охват: даже технологические компании США обязаны соблюдать стандарты ЕС при работе с европейскими данными
Регуляторный образец: вдохновил законы о защите данных по всему миру и проложил путь к Закону об ИИ ЕС

Персоны:EU Parliament, European Commission

Организации:European Union, European Parliament

2018Публикации

GPT-1: рождение генеративного предобучения

Основа всех современных больших языковых моделей — через обучение без учителя. 11 июня 2018 года Алек Рэдфорд с командой OpenAI опубликовал основополагающую статью 'Improving Language Understanding by Generative Pre-Training'. Эта работа впервые объединила архитектуру Transformer с предобучением без учителя и заложила двухэтапную парадигму: сначала генеративное обучение на больших текстовых корпусах, затем дообучение (Fine-Tuning) под конкретные задачи. Располагая 117 миллионами параметров и обучаясь на наборе данных BooksCorpus, включавшем более 7 000 неопубликованных книг различных жанров, GPT-1 доказал, что Transfer Learning работает для понимания языка. Двенадцатислойная архитектура Transformer на основе декодера с маскированным самовниманием (masked self-attention) задала шаблон для всей серии GPT. Это открытие превратило архитектуру Transformer 2017 года в практический инструмент для широкого круга задач обработки естественного языка (NLP) и положило начало эпохе больших языковых моделей.

Утвердило предобучение без учителя на больших текстовых корпусах как основу языковых моделей
Доказало успешное применение Transfer Learning для широкого круга задач обработки естественного языка (NLP)
Двенадцатислойная архитектура Transformer на основе декодера стала шаблоном для всей серии GPT
Положило начало эпохе больших языковых моделей и парадигме предобучение — дообучение

Персоны:Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever

Организации:OpenAI

2018Публикации

BERT существенно улучшил понимание языка

Важный прогресс двунаправленных языковых моделей и рождение современной обработки естественного языка (NLP). В октябре 2018 года Джейкоб Девлин и его команда в Google Research опубликовали статью о BERT — Bidirectional Encoder Representations from Transformers (двунаправленные представления кодировщика на основе трансформеров). Эта новаторская разработка существенно изменила обработку языка: впервые были обучены глубокие двунаправленные представления на неразмеченных текстах. В отличие от предыдущих моделей, BERT одновременно учитывает как левый, так и правый контекст во всех слоях. Результат оказался примечательным: BERT достиг новых лучших показателей в одиннадцати задачах NLP и улучшил показатель GLUE на 7,7 процентных пункта — до 80,5%. Само предварительное обучение (Pre-Training) заняло несколько дней на множестве TPU, однако открытая публикация демократизировала передовые технологии: готовую предобученную модель можно было тонко настроить (Fine-Tuning) под собственную задачу примерно за 30 минут на одном облачном TPU. BERT установил парадигму Pre-Training — Fine-Tuning, которая сегодня лежит в основе всех крупных языковых моделей.

Первая глубокая двунаправленная языковая модель, одновременно учитывающая левый и правый контекст во всех слоях
Достигла новых лучших показателей в 11 задачах NLP и улучшила показатель GLUE на 7,7 процентных пункта — до 80,5%
Открытая публикация позволила выполнять тонкую настройку (Fine-Tuning) предобученной модели под собственные задачи примерно за 30 минут на одном облачном TPU
Установила парадигму Pre-Training — Fine-Tuning для всех современных языковых моделей

Персоны:Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

Организации:Google Research, Google AI Language

2019Публикации

GPT-2 - "Слишком опасно для публикации"

В феврале 2019 года OpenAI выпустила GPT-2, но неожиданно решила придержать полную модель с 1,5 миллиарда параметров — якобы «слишком опасную» для полного релиза. Это беспрецедентное решение разделило ИИ-сообщество: сторонники хвалили ответственную позицию перед лицом рисков злоупотребления, таких как фейковые новости и автоматический спам. Критики обвинили OpenAI в «закрытии» исследований и раздувании необоснованных страхов. Через девять месяцев без серьёзных свидетельств злоупотреблений OpenAI выпустила полную модель, отметив поворотный момент в дебатах об ответственной разработке ИИ.

Беспрецедентное решение: OpenAI придерживает полную модель с 1,5B параметров
Опасения по поводу фейковых новостей, кражи личности и автоматического спама в соцсетях
ИИ-сообщество разделилось: прогресс этики vs обвинение в закрытии исследований
Через 9 месяцев полный релиз из-за отсутствия доказательств злоупотреблений

Персоны:Alec Radford, Jeffrey Wu, Rewon Child, David Luan

Организации:OpenAI

2019Соревнования

AlphaStar достигает уровня гроссмейстера

Завоевание самой сложной стратегии в реальном времени искусственным интеллектом. В июле и августе 2019 года AlphaStar компании DeepMind анонимно участвовал в рейтинговых матчах на Battle.net; 30 октября 2019 года DeepMind сообщил в журнале Nature, что система стала первым ИИ, достигшим уровня гроссмейстера в StarCraft II — игре, которая считалась слишком сложной для машин. AlphaStar превзошёл более 99,8% всех активных игроков Battle.net и освоил все три расы: Протоссов, Терранов и Зергов. Ранее AlphaStar уже победил профессиональных игроков Гжегожа 'MaNa' Кэминча и Дарио 'TLO' Вюнша со счётом 5:0 каждого. Особенностью стала архитектура многоагентного обучения с подкреплением (Multi-Agent Reinforcement Learning), обучавшая различные стратегии и контрстратегии в рамках лиги. Совершая в среднем 280 действий в минуту, AlphaStar оставался даже ниже показателей профессиональных игроков-людей, однако демонстрировал более точное исполнение. Это достижение стало важной вехой для ИИ в видеоиграх и принятии решений в реальном времени.

AlphaStar достиг уровня гроссмейстера во всех трёх расах StarCraft II и превзошёл более 99,8% всех игроков Battle.net
Победил профессиональных игроков MaNa и TLO со счётом 5:0 каждого ещё до публичного успеха
Многоагентное обучение с подкреплением (Multi-Agent Reinforcement Learning) с лиговым обучением различных стратегий и контрстратегий
Первый ИИ, освоивший популярную киберспортивную игру без ограничений на высшем уровне

Персоны:Oriol Vinyals, Igor Babuschkin, Wojciech Czarnecki, Grzegorz Komincz, Dario Wünsch

Организации:DeepMind, Team Liquid, Blizzard Entertainment, Battle.net

2019Публикации

T5 — Text-to-Text Transfer Transformer

В октябре 2019 года Google AI существенно изменил NLP с помощью T5, Text-to-Text Transfer Transformer, который преобразует все задачи обработки языка в единый формат «текст-в-текст». С инновационным подходом «Everything is Text» перевод, резюмирование, ответы на вопросы и классификацию можно выполнять одной моделью, одной функцией потерь и одними гиперпараметрами. T5 вводит обширный датасет C4 и достигает почти человеческой производительности на бенчмарках SuperGLUE. Как базовая модель с до 11 миллиардами параметров, T5 прокладывает путь для современных больших языковых моделей и утверждает единую парадигму текст-в-текст как стандарт.

Инновационный единый подход: все NLP-задачи как проблема текст-в-текст
Парадигма «Everything is Text» унифицирует перевод, резюмирование, Q&A
Утверждает парадигму базовых моделей для современных больших языковых моделей
Вводит обширный датасет C4 — Colossal Clean Crawled Corpus

Персоны:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee

Организации:Google AI, Google Research

2020Публикации

RAG: языковые модели с внешней памятью

Языковая модель знает лишь то, что содержалось в её обучающих данных, — и при неопределённости уверенно что-то придумывает. В 2020 году Патрик Льюис и его коллеги из Facebook AI предложили выход: Retrieval-Augmented Generation, сокращённо RAG (генерация с поиском и дополнением). Идея подкупает своей простотой. Прежде чем модель ответит, она ищет в внешнем источнике знаний — например, в Википедии — подходящие фрагменты текста и опирает ответ на найденное. Это позволяет обновлять знания без переобучения модели, а ответ становится проверяемым. После успеха ChatGPT RAG превратился в стандартный метод привязки языковых моделей к актуальным, проверяемым источникам — основу почти всех приложений, позволяющих общаться с собственными документами. Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их. Если найденное содержит ошибки или модель неверно его интерпретирует, ошибки сохраняются. Метод даёт ссылки, но не настоящее понимание — и опирается на более ранние исследования в области поиска информации.

В 2020 году Патрик Льюис и коллеги из Facebook AI представили метод Retrieval-Augmented Generation (RAG) — генерацию с поиском и дополнением.
Вместо того чтобы отвечать только из памяти, языковая модель сначала находит подходящие документы (например, из Википедии) и опирает на них свой ответ.
После ChatGPT RAG стал стандартным методом привязки языковых моделей к актуальным, проверяемым источникам — основой почти всех приложений для общения с собственными документами.
Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их — если найденное ошибочно или неверно понято, модель всё равно ошибается. Метод даёт ссылки, но не настоящее понимание, и опирается на более ранние исследования в области поиска (например, DPR, REALM).

Персоны:Patrick Lewis

Организации:Facebook AI Research, University College London, New York University

2020Публикации

Законы масштабирования нейросетей

Джаред Каплан, Сэм МакКандлиш, Том Браун и Дарио Амодеи в январе 2020 года открыли фундаментальные математические законы масштабирования нейросетей и тем самым существенно изменили разработку больших языковых моделей. Основополагающая работа OpenAI и Университета Джонса Хопкинса показала, что производительность подчиняется степенным законам в зависимости от размера модели, объёма набора данных и вычислительной мощности — с трендами, охватывающими семь порядков величины. Элегантные уравнения впервые позволили систематически прогнозировать распределение ресурсов и утвердили парадигму 'чем больше — тем лучше'. Эти математические основы непосредственно привели к успеху GPT-3 и преобразовали разработку ИИ: от экспериментального метода проб и ошибок к научно обоснованному, предсказуемому масштабированию. Конкретное правило распределения ресурсов по Каплану — активно масштабировать размер модели при слабом увеличении объёма данных — было скорректировано в 2022 году статьёй Chinchilla от DeepMind: оптимальное по вычислениям обучение требует значительно большего объёма обучающих данных, чем рекомендовалось изначально.

Открытие фундаментальных степенных законов, охватывающих семь порядков величины
Элегантные уравнения позволяют систематически прогнозировать распределение ресурсов; в 2022 году уточнены работой Chinchilla
Утверждает парадигму 'чем больше — тем лучше' для систематической разработки больших языковых моделей
Преобразует разработку ИИ от метода проб и ошибок к научной методологии

Персоны:Jared Kaplan, Sam McCandlish, Tom Brown, Dario Amodei

Организации:OpenAI, Johns Hopkins University

2020Публикации

GPT-3: модель с 175 миллиардами параметров

Прорыв к обучению с несколькими примерами (Few-Shot Learning) и проявляющимся способностям ИИ. 28 мая 2020 года команда OpenAI под руководством Тома Брауна представила значимую статью 'Language Models are Few-Shot Learners' — GPT-3 со 175 миллиардами параметров, более чем в 100 раз превышающей GPT-2. Масштабирование выявило проявляющиеся способности: модель могла решать новые задачи лишь с несколькими примерами, без дообучения. От переводов до словесных головоломок и трёхзначной арифметики GPT-3 демонстрировал впечатляющую универсальность. Оценщики-люди едва могли отличить написанные GPT-3 новостные статьи от настоящих. Только за счёт обучения в контексте (In-Context Learning) GPT-3 приближался к передовому уровню на отдельных подзадачах SuperGLUE — однако на общем тесте набирал около 71,8 балла, заметно уступая дообученным лидирующим моделям (около 89). 31 исследователь OpenAI (Том Браун и 30 соавторов) доказали: масштабное увеличение числа параметров способно порождать качественно новые возможности. GPT-3 заложил фундамент для ChatGPT и современной эпохи больших языковых моделей.

175 миллиардов параметров — более чем в 100 раз больше GPT-2 со значительными эффектами масштабирования
Проявляющиеся способности Few-Shot без дообучения: новые задачи решаются с несколькими примерами
Продемонстрировал проявляющиеся способности: перевод, арифметика, генерация текста на человеческом уровне
Заложил фундамент для ChatGPT и коммерциализировал большие языковые модели через доступ по API

Персоны:Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah

Организации:OpenAI

2020Публикации

DDPM: Диффузионные модели утверждены

Математическая основа современной генерации изображений через процессы шумоподавления. В июне 2020 года Джонатан Хо, Аджай Джейн и Питер Эббил опубликовали влиятельную статью «Denoising Diffusion Probabilistic Models» — класс латентных переменных моделей, вдохновлённый неравновесной термодинамикой. Их инновация заключалась во взвешенной вариационной границе и связи между диффузионными моделями и Denoising Score Matching с динамикой Ланжевена. Результаты были впечатляющими: показатель FID 3,17 на CIFAR-10 и показатель Inception 9,46. DDPM установили прогрессивный подход с потерями при декомпрессии, который можно интерпретировать как обобщение авторегрессивного декодирования. Эта работа заложила математический фундамент для Stable Diffusion и всей современной генерации изображений из текста.

Новый класс генеративных моделей, основанных на неравновесной термодинамике и процессах шумоподавления
Прогрессивный подход с потерями при декомпрессии как обобщение авторегрессивного декодирования
Заложил математический фундамент для Stable Diffusion и современной генерации изображений из текста
FID-показатель 3,17 на CIFAR-10 продемонстрировал качество изображений, сопоставимое с GAN, и утвердил диффузию как стандарт

Персоны:Jonathan Ho, Ajay Jain, Pieter Abbeel

Организации:UC Berkeley

2020Публикации

Vision Transformer: 'An Image is Worth 16x16 Words'

Архитектура Transformer в компьютерном зрении. 22 октября 2020 года команда Алексея Досовицкого в Google Research опубликовала статью 'An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale'. Vision Transformer (ViT) показал, что свёрточные нейронные сети (CNN) не обязательны — чистые Transformer могут напрямую применяться к последовательностям фрагментов изображения. Ключевой вывод ('at Scale'): лишь после масштабного предварительного обучения на огромных наборах данных (ImageNet-21k или JFT-300M) ViT достигает сравнимых или лучших результатов, чем современные CNN; на наборах среднего размера без такого предобучения ViT показывает более слабые результаты. Система разбивает изображения на фрагменты — как правило, 16x16 пикселей, хотя в зависимости от варианта размер может меняться — обрабатывает их как последовательности токенов и применяет стандартную архитектуру Transformer. Универсальность архитектуры Transformer стала очевидна: та же технология, которая изменила обработку естественного языка, работает и в компьютерном зрении. ViT вдохновил новое поколение моделей компьютерного зрения на основе механизма внимания и продемонстрировал мощь унифицированных архитектур.

Первое масштабируемое, основанное на фрагментах применение чистой архитектуры Transformer в компьютерном зрении без компонентов CNN
Фрагменты изображения (как правило, 16x16 пикселей) обрабатываются как последовательности токенов, что изменило подход к преобразованию изображения в последовательность
Self-Attention для обработки изображений доказал универсальность архитектуры Transformer
После масштабного предварительного обучения достиг уровня современных CNN и вдохновил модели компьютерного зрения на основе механизма внимания

Персоны:Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov

Организации:Google Research, Google Brain

2020Прорывы

Успех AlphaFold

Решение 50-летней биологической загадки с помощью искусственного интеллекта. В ноябре 2020 года AlphaFold 2 от DeepMind доминировал на соревновании CASP14 с точностью, которую учёные назвали «поразительной» и «трансформационной». Система достигла показателя GDT 92,4 из 100 баллов в предсказании структуры белков — точность, сравнимая с экспериментальными методами вроде рентгеновской кристаллографии. При этом AlphaFold значительно превзошёл 145 других команд, решив проблему, над которой биология билась с 1970-х годов. Архитектура нейронной сети на основе механизма внимания может за несколько дней предсказать, как сворачиваются белки — процесс, фундаментальный для понимания жизни. За это достижение Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года.

AlphaFold 2 доминировал на CASP14 с показателем GDT 92,4 и значительно превзошёл 145 других команд
Решил 50-летнюю проблему укладки белков и фундаментально изменил структурную биологию
Архитектура на основе механизма внимания достигла экспериментальной точности в предсказании структуры белков
Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года за это достижение

Персоны:Demis Hassabis, John Jumper

Организации:DeepMind, Google, CASP, University of Washington

2021Прорывы

CLIP: мост между изображением и языком

В тот же день, когда OpenAI представила DALL-E — 5 января 2021 года, — вышла, пожалуй, более значимая модель: CLIP. Она не генерировала изображения, а обучалась понимать картинку и текст в едином пространстве. Команда Алека Радфорда обучила два энкодера контрастным методом на примерно 400 миллионах пар изображение — текст из интернета, пока связанные изображения и подписи к ним не оказались в одной точке общего векторного пространства. Эффект оказался поразительным: CLIP мог классифицировать изображения в режиме zero-shot — категории просто описывались словами, без какого-либо обучения на конкретной задаче. Так модель достигла 76,2 % на ImageNet — наравне с ResNet-50, обученной на 1,28 миллиона размеченных примеров, — хотя CLIP не видел ни одного из них. Для общей картины это принципиально: CLIP стал фундаментом волны генерации изображений по тексту — DALL-E 2 опирается на эмбеддинги CLIP, а Stable Diffusion напрямую использует его текстовый энкодер. Если быть точным: контрастивные модели 'изображение — текст' уже существовали (ConVIRT вышел месяцами раньше) — вклад CLIP заключался в масштабе, ширине zero-shot и открытых весах, которые запустили целую экосистему.

Контрастивное обучение: два энкодера (изображение + текст) обучаются на примерно 400 млн веб-парах, чтобы помещать связанные изображения и тексты в одно векторное пространство.
Zero-shot: категории описываются словами, обучение на конкретной задаче не нужно — 76,2 % на ImageNet, наравне с ResNet-50, которой потребовалось 1,28 млн размеченных изображений.
Фундамент волны генерации изображений по тексту: DALL-E 2 опирается на эмбеддинги CLIP, Stable Diffusion напрямую использует его текстовый энкодер.
Контрастивные модели 'изображение — текст' уже существовали (ConVIRT, окт. 2020). Вклад CLIP: масштаб, ширина zero-shot, открытые веса — но вместе с ними и предвзятость веб-данных.

Персоны:Alec Radford, Jong Wook Kim, Ilya Sutskever

Организации:OpenAI

2021Продукты

DALL-E создаёт изображения из текста

Важный прорыв в генерации изображений по тексту и значительный прогресс в области творческих возможностей ИИ. 5 января 2021 года OpenAI представила DALL-E — систему, которая создаёт связные и нередко поразительно креативные изображения на основе текстовых описаний. Модели преобразования текста в изображение существовали и прежде (например, alignDRAW в 2015 году или подходы на основе GAN — StackGAN и AttnGAN), однако DALL-E подняла связность и универсальность на принципиально новый уровень. Основанная на версии GPT-3 с 12 миллиардами параметров, DALL-E доказала, что границу между пониманием языка и восприятием изображений можно преодолеть. Система обучалась на 250 миллионах пар 'изображение — текст' из интернета и в результате приобрела примечательные способности: очеловечивать животных, правдоподобно объединять несвязанные концепции и даже воспроизводить текст в изображениях. Марк Ридль из Технологического института Джорджии отметил, что результаты 'поразительно более связны', чем у всех прежних систем преобразования текста в изображение. DALL-E успешно расширила языковое понимание GPT на область зрительного восприятия и открыла принципиально новое измерение творческих возможностей ИИ.

Подняла генерацию изображений по тексту на новый уровень — связные, креативные изображения из описаний на естественном языке (предшественники наподобие alignDRAW или StackGAN уже существовали)
Проявила поразительные творческие способности: очеловечивание персонажей, объединение концепций, воспроизведение текста
Версия GPT-3 с 12 миллиардами параметров, обученная на 250 миллионах пар 'изображение — текст' из интернета
Открыла новое измерение творческих возможностей ИИ и вдохновила движение генеративного ИИ

Персоны:Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray

Организации:OpenAI, DALL-E Team

2021Вехи

Основание Anthropic

Бывшие руководители OpenAI решили воплотить собственное видение безопасного ИИ. В январе 2021 года Дарио и Даниэла Амодеи вместе с пятью другими бывшими исследователями OpenAI — в том числе Томом Брауном, Джаредом Капланом и Крисом Ола — основали Anthropic; всего семь сооснователей. Брат и сестра ранее занимали ключевые должности в OpenAI — Дарио в должности вице-президента по исследованиям. Их новая компания должна была сосредоточиться на безопасности ИИ и разработке надёжных, интерпретируемых систем. С помощью Constitutional AI компания Anthropic разработала инновационный подход к обучению ИИ-систем на основе принципов, а не только человеческой обратной связи. Claude, их ИИ-ассистент, стал одним из ведущих конкурентов ChatGPT.

Основана в январе 2021 года в Сан-Франциско
Дарио Амодеи (генеральный директор, бывший вице-президент по исследованиям в OpenAI) и Даниэла Амодеи (президент) — часть команды из семи сооснователей
Фокус на безопасности ИИ, интерпретируемости и Constitutional AI
Разработала Claude — одного из ведущих ИИ-ассистентов

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Jared Kaplan, Sam McCandlish, Jack Clark, Chris Olah

Организации:Anthropic, OpenAI

2021Продукты

GitHub Copilot: ИИ-парный программист

Демократизация ИИ-разработки программного обеспечения для миллионов разработчиков. 29 июня 2021 года GitHub анонсировал Technical Preview Copilot — первого ИИ-парного программиста на базе OpenAI Codex. Основанный на варианте GPT-3, обученном на миллиардах строк публичного кода из репозиториев GitHub, Copilot мог генерировать автодополнения кода и целые функции из комментариев. Базовая модель Codex достигла 28,8% успеха с первой попытки в бенчмарке HumanEval — значительно лучше GPT-3 с 0%. Особенно впечатляюще: со 100 попытками семплирования успешность выросла до 70,2%. Copilot особенно хорошо работал с Python, JavaScript, TypeScript, Ruby и Go. Ограниченный Technical Preview вызвал огромный интерес и утвердил ИИ-программирование как практичный инструмент. Copilot фундаментально изменил опыт разработчиков и проложил путь новому поколению ИИ-инструментов для программирования.

Technical Preview 29 июня 2021 с ограниченным доступом через список ожидания для избранных разработчиков
На базе OpenAI Codex, обученного на миллиардах строк кода из публичных GitHub-репозиториев
28,8% успеха с первой попытки (HumanEval), 70,2% со 100 попытками семплирования
Утвердил ИИ-программирование как практичный инструмент и вдохновил новые инструменты кодирования

Персоны:Nat Friedman, GitHub Team, OpenAI Team

Организации:GitHub, OpenAI, Microsoft

2021Продукты

OpenAI Codex: ИИ программирует для людей

10 августа 2021 года OpenAI опубликовала Codex через API и существенно изменила разработку программного обеспечения — масштабная система ИИ для генерации кода. Основанный на GPT-3, но обученный на 159 гигабайтах кода Python из 54 миллионов репозиториев GitHub, Codex преобразовывал естественный язык в работоспособный код. 'Создай функцию для простых чисел' превращалось в реальный код Python за считанные секунды. Ещё раньше, 29 июня 2021 года, из партнёрства с GitHub появился Technical Preview Copilot — ИИ-ассистент программирования, уже работавший на ранней версии Codex. Codex владел более чем дюжиной языков программирования: Python, JavaScript, Go, Ruby, Swift и другими. В бенчмарке HumanEval точно настроенная модель Codex-S решала около 37 % задач с первой попытки (pass@1) — базовая модель справлялась примерно с 29 %; впечатляет, но не является меркой для произвольных запросов. GitHub Copilot оказался значительным инструментом повышения производительности для разработчиков. Codex доказал: ИИ способен поддерживать творческую, когнитивно сложную работу. От генерации кода к его пониманию — Codex открыл дверь в разработку программного обеспечения с поддержкой ИИ.

Естественный язык в код: 'Напиши функцию сортировки' превращается в работоспособный Python/JavaScript
GitHub Copilot (Technical Preview с 29 июня 2021 года): ведущий ИИ-ассистент программирования, обученный на 54 миллионах репозиториев кода
12+ языков программирования: от Python до Swift — ИИ понимает намерения разработчика на естественном языке
Заметный прирост производительности: Codex доказал потенциал ИИ для творческой когнитивной работы

Персоны:OpenAI Team, GitHub Development Team

Организации:OpenAI, GitHub, Microsoft

2022Публикации

InstructGPT: мост к ChatGPT

Между методом и мировым успехом пролегал решающий промежуточный шаг — и он назывался InstructGPT. В начале 2022 года OpenAI показала в статье 'Training language models to follow instructions with human feedback', как заставить GPT-3 действительно делать то, чего хотят пользователи: с помощью обучения с подкреплением на основе обратной связи от людей (RLHF). Поразительный результат: InstructGPT с 1,3 миллиарда параметров люди предпочитали ответам GPT-3 в сто раз большего размера (175 миллиардов параметров). Разницу определяла не грубая величина, а согласованность с намерением. InstructGPT стал прямым техническим мостом между идеей RLHF (2017) и ChatGPT, который в конце 2022 года сделал этот метод широко известным. Если подходить честно: InstructGPT не изобрёл RLHF — это сделала статья 2017 года, — но именно InstructGPT впервые показал в большом масштабе, насколько согласованность делает языковую модель полезнее.

OpenAI применила RLHF (обучение с подкреплением на основе обратной связи от людей) к GPT-3, чтобы модель следовала инструкциям и соответствовала намерениям пользователей.
Поразительно: InstructGPT с 1,3 млрд параметров люди предпочитали GPT-3 в 100 раз большего размера (175 млрд) — согласованность побеждает грубую величину.
Прямой мост между идеей RLHF (2017) и ChatGPT (конец 2022) — именно это объясняет, почему ChatGPT так хорошо работал.
InstructGPT не изобрёл RLHF (это сделала статья 2017 года); он впервые показал в большом масштабе, насколько согласованность делает модель полезнее.

Персоны:Long Ouyang

Организации:OpenAI

2022Публикации

Chinchilla: масштабирование осмыслено заново

В 2022 году DeepMind задала неудобный вопрос: а не строим ли мы свои ИИ-модели неправильно? В статье 'Training Compute-Optimal Large Language Models' команда под руководством Джордана Хоффмана показала, что крупнейшие языковые модели того времени — GPT-3, Gopher — имели множество параметров, но слишком мало обучающих данных. Предложенная ими корректировка, сегодня известная как законы масштабирования Chinchilla: при заданном вычислительном бюджете размер модели и объём данных должны расти примерно в одном темпе. В качестве доказательства они обучили Chinchilla с 70 миллиардами параметров на 1,4 триллиона токенов — и превзошли вчетверо большую модель Gopher (280 миллиардов). Это изменило подход к обучению практически каждой последующей ведущей модели. Если подходить честно: Chinchilla не изобрела законы масштабирования, а скорректировала более ранние законы Каплана (2020); более поздние модели вроде Llama намеренно выходили за пределы оптимального по вычислениям соотношения ради повышения эффективности при использовании.

Законы масштабирования Chinchilla: при фиксированном вычислительном бюджете размер модели и обучающие данные должны расти примерно в одном темпе.
Крупнейшие модели (GPT-3, Gopher) были избыточны по параметрам и недостаточно обучены на данных. Chinchilla (70 млрд, 1,4 трлн токенов) превзошла вчетверо большую Gopher (280 млрд).
Изменила подход к обучению практически каждой последующей ведущей модели (соотношение данных и параметров); повлияла в том числе на Llama.
Chinchilla не изобрела законы масштабирования, а скорректировала Каплана (2020); более поздние модели намеренно превышают оптимальное соотношение ради большей эффективности при использовании.

Персоны:Jordan Hoffmann

Организации:Google DeepMind

2022Продукты

PaLM: гигантская языковая модель Google на 540 миллиардов параметров

В 2022 году Google продемонстрировал, насколько высоко можно масштабировать языковые модели: PaLM (Pathways Language Model) насчитывал 540 миллиардов параметров и обучался с помощью системы Pathways на тысячах TPU-чипов. Впечатляло не столько огромное число параметров, сколько то, на что PaLM оказался способен. С так называемыми подсказками цепочки мыслей (Chain-of-Thought Prompts), при которых модель записывает своё рассуждение шаг за шагом, PaLM решал многоэтапные текстовые задачи и даже объяснял суть анекдотов. PaLM стал символом идеи эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели. Это был апогей эпохи масштабирования Google и предтеча PaLM 2 и Gemini. Важная оговорка: 540 миллиардов параметров были чрезвычайно дорогостоящими, и PaLM так и не был опубликован как открытая модель. Тезис об эмерджентных способностях также вызывает споры — некоторые подобные скачки отчасти являются артефактом выбранной метрики измерения.

В 2022 году Google представил PaLM — языковую модель с 540 миллиардами параметров, обученную на тысячах TPU-чипов.
PaLM блеснул в многоэтапном рассуждении: с подсказками цепочки мыслей (Chain-of-Thought) он решал текстовые задачи и даже объяснял анекдоты.
Это поддержало идею эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели.
Важная оговорка: 540 миллиардов параметров обходились крайне дорого, и PaLM так и не был опубликован в открытом доступе. Тезис об эмерджентных способностях спорен — некоторые скачки отчасти являются артефактом метрики измерения (Schaeffer и др., 2023).

Организации:Google

2022Продукты

Stable Diffusion: генерация изображений с открытым кодом

Демократизация ИИ-генерации изображений благодаря первой мощной модели с открытым исходным кодом. 22 августа 2022 года Stability AI выпустила Stable Diffusion и существенно изменила доступ к продвинутой технологии преобразования текста в изображение. Как первая модель своего класса с открытым кодом, Stable Diffusion могла генерировать фотореалистичные изображения 512x512 пикселей на потребительских GPU — важный прогресс для скорости и доступности. Основанная на латентных диффузионных моделях (LDM), система итеративно «удаляет шум» в латентных пространствах вместо прямой манипуляции пикселями. С 860 миллионами параметров в U-Net и 123 миллионами в текстовом энкодере она оставалась относительно лёгкой несмотря на высокую производительность. Исходный код на GitHub позволил взрывообразно растущему сообществу разрабатывать бесчисленные варианты и инструменты. Stable Diffusion разрушила монополию проприетарных систем и сделала высококачественную ИИ-генерацию изображений доступной для каждого.

Первая мощная модель преобразования текста в изображение с открытым кодом и исходным кодом на GitHub
Латентные диффузионные модели с итеративным удалением шума в латентных пространствах вместо прямой манипуляции пикселями
Взрывообразный рост сообщества с бесчисленными вариантами, инструментами и приложениями
Разрушила монополию проприетарных систем и демократизировала высококачественную ИИ-генерацию изображений

Персоны:Emad Mostaque, Robin Rombach, Andreas Blattmann

Организации:Stability AI, CompVis, Runway

2022Прорывы

OpenAI выпускает Whisper

Когда распознавание речи наконец стало надёжным — и доступным для всех. 21 сентября 2022 года OpenAI выпустила Whisper — систему распознавания речи, обученную работать устойчиво с различными языками, акцентами и фоновыми шумами. В отличие от ранних систем, обучавшихся на чистых аудиоданных, Whisper использовал 680 000 часов многоязычных данных из интернета. Результат — система, способная транскрибировать речь на 99 языках и конкурирующая с коммерческими решениями. OpenAI сделала Whisper общедоступным в виде открытого исходного кода — подарок разработчикам по всему миру, открывший возможности для бесчисленных приложений.

Выпущен 21 сентября 2022 года как программное обеспечение с открытым исходным кодом
Охватывает 99 языков и уверенно транскрибирует речь даже с акцентами и фоновыми шумами — наиболее точен в английском, поскольку большая часть обучающих данных на английском
Обучен на 680 000 часах многоязычных аудиоданных из интернета
Демократизировал высококачественное распознавание речи благодаря открытому исходному коду

Персоны:Alec Radford, Jong Wook Kim, Tao Xu

Организации:OpenAI

2022Продукты

ChatGPT обозначил поворотный момент в использовании ИИ

Момент, когда ИИ стал доступен всем и началась новая эра. 30 ноября 2022 года OpenAI выпустила ChatGPT как бесплатный Research Preview — без масштабного маркетинга и с минимальными ожиданиями. То, что последовало, превзошло все прогнозы: через 5 дней ChatGPT достиг 1 миллиона пользователей, а через два месяца — 100 миллионов. Это был тогда самый быстрый рост аудитории, который когда-либо демонстрировало потребительское приложение (в июле 2023 года этот рекорд побил Threads от Meta). Основанный на GPT-3.5, ChatGPT впервые открыл широкой аудитории прямой доступ к мощной системе ИИ без технических барьеров. Кевин Рус из New York Times назвал его 'лучшим ИИ-чат-ботом, когда-либо выпущенным для широкой публики'. ChatGPT демократизировал искусственный интеллект и превратил исследовательскую область в инструмент повседневного использования. Этот выпуск ознаменовал начало нынешней волны генеративного ИИ.

30 ноября 2022 года стал доступен широкой публике как бесплатный Research Preview
Достиг 1 миллиона пользователей за 5 дней, 100 миллионов — за 2 месяца; тогда это был самый быстрый рост потребительского приложения (впоследствии превзойдённый Threads)
Первый мощный ИИ без технических барьеров — прямой веб-доступ для любого пользователя интернета
Демократизировал ИИ и дал толчок нынешней волне генеративного ИИ в обществе и экономике

Персоны:Sam Altman, Greg Brockman, Ilya Sutskever, John Schulman

Организации:OpenAI, Microsoft, ChatGPT

2022Публикации

Constitutional AI — безопасность ИИ через принципы

В декабре 2022 года компания Anthropic представила Constitutional AI (CAI) — новый метод разработки безвредных, полезных и честных систем ИИ. 'Конституция' из этических принципов позволяет ИИ самостоятельно критиковать и улучшать собственные ответы на вредоносный контент — без необходимости использовать человеческую разметку именно для оценки вреда. (Явную привязку этих принципов к Всеобщей декларации прав человека ООН и другим основополагающим документам Anthropic описала лишь в мае 2023 года в 'Claude's Constitution'; в исходной статье применялся прагматично составленный набор принципов.) Новаторский метод RLAIF (Reinforcement Learning from AI Feedback — обучение с подкреплением на основе обратной связи от ИИ) заменяет человеческую обратную связь лишь применительно к безвредности — посредством самокритики ИИ; полезность же по-прежнему обучается на основе человеческих предпочтений (RLHF). Таким образом, CAI устанавливает подход 'безопасность прежде всего' как альтернативу чисто производительностному подходу ChatGPT и прокладывает путь к ответственной разработке ИИ.

ИИ самостоятельно критикует и улучшает свои ответы на вредоносный контент — без человеческой разметки для этой оценки
Альтернатива 'безопасность прежде всего' по отношению к чисто производительностным подходам наподобие ChatGPT
Тройная цель: полезный, честный и безвредный — через этические принципы
RLAIF: Reinforcement Learning from AI Feedback заменяет человеческие оценки при обеспечении безвредности (полезность по-прежнему обучается через RLHF)

Персоны:Yuntao Bai, Andy Jones, Kamal Ndousse, Dario Amodei, Anthropic Team

Организации:Anthropic

2023Регулирование

Система NIST AI: США определяют стандарты надёжного ИИ

26 января 2023 года Национальный институт стандартов и технологий США (NIST) опубликовал первую комплексную систему управления рисками ИИ (AI RMF 1.0) — ответ Америки на глобальное регулирование искусственного интеллекта. После 18 месяцев разработки при участии более 240 организаций из промышленности, науки и гражданского общества NIST впервые определил федеральные стандарты надёжного ИИ. Система устанавливает четыре основные функции: Govern, Map, Measure, Manage — и семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный. Как добровольный стандарт, он призван минимизировать риски ИИ для отдельных людей, организаций и общества. Публикация последовала за Сводом прав ИИ Байдена (2022) и была дополнена его указом об ИИ (октябрь 2023 года). AI RMF был создан по поручению Национального закона об инициативе в области ИИ 2020 года — NIST продолжил свою устоявшуюся роль федерального органа по стандартизации. Система стала основой для отраслевых стандартов и международной координации — противовесом государственному контролю над ИИ в Китае и регуляторному подходу Европы.

Четыре основные функции: Govern, Map, Measure, Manage для систематического управления рисками ИИ
Семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный
Добровольный многосторонний подход: более 240 организаций совместно разработали стандарты
Федеральный орган по стандартизации: NIST разработал AI RMF по поручению Национального закона об инициативе в области ИИ 2020 года

Персоны:NIST AI Team, 240+ Contributing Organizations

Организации:NIST, US Department of Commerce, Biden Administration

2023Продукты

LLaMA: открытая базовая языковая модель

Демократизация больших языковых моделей через открытые исследовательские модели. 24 февраля 2023 года Meta AI опубликовала LLaMA (Large Language Model Meta AI) — набор базовых моделей от 7B до 65B параметров, обученных исключительно на общедоступных данных. Основополагающая статья 'LLaMA: Open and Efficient Foundation Language Models' доказала, что результаты уровня state-of-the-art достижимы без проприетарных наборов данных. LLaMA открыла исследователям без доступа к крупной инфраструктуре возможность изучать передовые языковые модели. Код вывода был опубликован под лицензией GPLv3, тогда как доступ к весам модели предоставлялся в отдельных случаях исключительно для академических исследований. Благодаря обучению на триллионах токенов и различным размерам моделей LLaMA отвечала разным аппаратным требованиям. Эта работа катализировала волну открытых исследований в области больших языковых моделей и вдохновила многочисленные производные модели в сообществе открытого программного обеспечения.

Код вывода под лицензией GPLv3; веса модели предоставлялись в отдельных случаях исключительно для некоммерческих исследований
Модели от 7B до 65B параметров, обученные исключительно на общедоступных наборах данных
Открыла исследователям без крупной инфраструктуры возможность изучать передовые языковые модели
Различные размеры моделей для различных аппаратных требований и исследовательских задач

Персоны:Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet

Организации:Meta AI, FAIR

2023Продукты

Claude и Constitutional AI

Представление ИИ со встроенной системой ценностей и этическими принципами. В марте 2023 года Anthropic представила Claude — ИИ-ассистента на базе Constitutional AI, который установил новый подход к безопасности ИИ. В отличие от традиционных систем, Claude обучается двухфазным методом: сначала модель критикует и улучшает свои собственные ответы на основе конституции из этических принципов, затем улучшается через обратную связь, генерируемую ИИ — без человеческих оценок для предотвращения вреда. Результат — система, которая действует одновременно полезно и безвредно. Anthropic одновременно выпустила Claude и Claude Instant, причём последний представляет более быструю и экономичную версию. Метод Constitutional AI оказался улучшением по Парето по сравнению с человеческой обратной связью и открыл новые пути для масштабируемого контроля ИИ.

Фреймворк Constitutional AI с двухфазным обучением: самокритика на основе этических принципов, затем улучшение на основе ИИ-обратной связи
Новый подход к безопасности без человеческих оценок вреда — исключительно через ИИ-супервизию
Одновременный выпуск Claude и Claude Instant для различных требований к приложениям
Установил «helpful, harmless, honest» как центральные ценности ответственной разработки ИИ

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Chris Olah

Организации:Anthropic, Constitutional AI, AI Safety

2023Продукты

GPT-4: мультимодальная модель ИИ

Прорыв к человеческому уровню в профессиональных и академических тестах. 14 марта 2023 года OpenAI представил GPT-4 — большую мультимодальную модель (Large Multimodal Model), обрабатывающую текстовые и графические данные и достигающую человеческого уровня в различных дисциплинах. Улучшения были существенными: если GPT-3.5 сдавал экзамен на право занятия адвокатской практикой (Bar Exam) в нижних 10 %, то GPT-4 достиг верхних 10 %. На тесте SAT по математике результат вырос с 70-го до 89-го перцентиля. После шести месяцев итеративного выравнивания с учётом результатов программы тестирования на устойчивость к атакам (adversarial testing) и обратной связи от ChatGPT весь стек глубокого обучения был выстроен заново. Мультимодальные возможности позволяют обрабатывать документы, диаграммы и скриншоты с тем же качеством, что и чисто текстовые запросы. GPT-4 установил новые стандарты безопасности и производительности ИИ.

Большая мультимодальная модель с текстовыми и графическими данными, возможностями компьютерного зрения для документов и диаграмм
Bar Exam — верхние 10 % против нижних 10 % у GPT-3.5; SAT по математике — рост с 70-го до 89-го перцентиля
6 месяцев итеративного выравнивания с adversarial testing и обратной связью ChatGPT для повышения безопасности
Интеграция в ChatGPT Plus сделала передовой мультимодальный ИИ доступным для широкой аудитории

Персоны:Sam Altman, OpenAI Team

Организации:OpenAI

2023Продукты

Midjourney V5: фотореалистичное ИИ-искусство

Фотореалистичная генерация изображений с помощью ИИ достигает нового уровня качества и существенно меняет творческую индустрию. 15 марта 2023 года Midjourney выпустила версию 5, сделав качественный скачок, который пользователи описывали как 'пугающий' и 'слишком совершенный'. Альфа-версия впервые позволила создавать фотореалистичные изображения, практически неотличимые от настоящих фотографий. Особенно примечательно: хроническая проблема с некорректным изображением рук была существенно улучшена — в большинстве случаев V5 правильно отображала пять пальцев. Графический дизайнер Джули Виланд сравнила этот опыт с 'тем, как наконец надеть очки после того, как слишком долго мирился с плохим зрением' — вдруг всё видишь в качестве 4K [источник: Ars Technica, март 2023]. Улучшенная чувствительность к запросам (промптам) обеспечила более точный творческий контроль, а автоматическое масштабирование позволяло увеличивать базовые изображения размером 1024x1024 пикселей без дополнительных затрат на GPU. V5 вызвала интенсивные дискуссии о будущем человеческого творчества.

Фотореалистичное качество изображений, практически неотличимых от настоящих фотографий
Вызвала интенсивную реакцию в творческом сообществе — от восторга до экзистенциальных опасений
Существенно улучшила ИИ-арт благодаря точному изображению рук и улучшенной чувствительности к запросам
Установила новые стандарты для коммерческой генерации изображений с помощью ИИ с ощутимым влиянием на творческую индустрию

Персоны:David Holz, Midjourney Team

Организации:Midjourney Inc

2023Регулирование

Указ Байдена об ИИ — первое комплексное регулирование США

30 октября 2023 года президент Байден подписал Executive Order 14110 о 'безопасной, защищённой и заслуживающей доверия разработке и использовании искусственного интеллекта' — первый комплексный нормативный акт США в области ИИ и, со своими 110 страницами, самый длинный президентский указ в истории. Этот масштабный документ обязывал разработчиков мощных систем ИИ раскрывать результаты тестирований безопасности и устанавливал строгие стандарты Red Team через NIST. Указ предусматривал защиту от мошенничества с применением ИИ посредством аутентификации контента и водяных знаков, а также затрагивал риски для критической инфраструктуры и биологические угрозы. На момент подписания этот указ задавал глобальные стандарты ответственной разработки ИИ и позиционировал США как лидера в области управления ИИ (AI Governance). Однако его действие оказалось недолгим: 20 января 2025 года президент Трамп отменил EO 14110 своим указом EO 14148 — таким образом, этот документ отражает регуляторное положение дел по состоянию на 2023 год.

Наиболее комплексное управление ИИ за всю историю — 110 страниц, самый длинный президентский указ в истории
Обязательные тестирования безопасности и результаты Red Team для мощных систем ИИ
Закон об оборонном производстве: обязательная отчётность для систем ИИ, создающих риски национальной безопасности
В 2023 году позиционировал США как лидера в ответственном управлении ИИ — однако в 2025 году был отменён

Персоны:Joe Biden, Kamala Harris

Организации:White House, NIST, Department of Homeland Security

2023Регулирование

Письмо о паузе и Блетчли: безопасность ИИ становится глобальной темой

В 2023 году, в первое потрясение после ChatGPT, мир искал правила для внезапно обретшей мощь технологии. В марте тысячи подписантов — среди них Ёшуа Бенджио и Илон Маск — потребовали в открытом письме Future of Life Institute шестимесячной паузы в обучении ИИ-систем мощнее GPT-4. Паузы не последовало, однако письмо поставило тему на мировую повестку дня. В ноябре прошёл первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — намеренно в том самом месте, где Тьюринг некогда взламывал шифры. 28 государств и ЕС, в том числе США и Китай, подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ. Это был первый случай, когда соперничающие державы заговорили вместе о безопасности ИИ, — старт серии саммитов (Сеул 2024, Париж 2025). Если подходить честно: пауза так и не наступила, а Блетчлийская декларация носила необязательный характер — оба события поставили темы на повестку дня, но не создали механизмов принуждения.

Март 2023: открытое письмо Future of Life Institute (тысячи подписантов, в т. ч. Бенджио, Маск) потребовало 6-месячной паузы в обучении ИИ мощнее GPT-4.
Ноябрь 2023: первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — там, где Тьюринг во время войны взламывал шифры.
28 государств и ЕС — в том числе США и Китай — подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ; старт серии саммитов (Сеул 2024, Париж 2025).
Пауза так и не наступила; декларация носила необязательный характер. Оба события поставили темы на повестку, но не создали механизмов принуждения.

Организации:Future of Life Institute, UK Government

2023Продукты

Mistral и Mixtral: открытые европейские модели

Пока в 2023 году заголовки новостей в основном определяли американские компании, из Парижа выступил конкурент: Mistral AI, основанный весной 2023 года Артуром Меншем (ранее работавшим в Google DeepMind), а также Гийомом Лямплем и Тимоте Лакруа (ранее работавшими в Meta). Уже в сентябре небольшая модель Mistral 7B удивила профессиональное сообщество — она распространялась свободно под лицензией Apache 2.0 и превосходила значительно более крупную Llama 2 13B. В декабре последовала Mixtral 8x7B: открытая модель типа Mixture-of-Experts, достигшая на многих задачах уровня GPT-3.5, однако активировавшая лишь малую часть своих параметров на каждый запрос (около 13 из 47 миллиардов). Mistral стала европейским символом открытых моделей и привлекла миллиарды инвестиций. Важная оговорка: открытые веса — это не то же самое, что открытый исходный код; данные и код обучения остаются закрытыми. И Mixtral достигла уровня GPT-3.5, но не тогдашней флагманской модели GPT-4; при этом сама архитектура Mixture-of-Experts значительно старше.

Весна 2023: в Париже Артур Менш (экс-Google DeepMind), Гийом Лямпль и Тимоте Лакруа (экс-Meta) основали Mistral AI — европейский ответ американским лабораториям.
Сентябрь 2023: Mistral 7B — небольшая модель со свободными весами (Apache 2.0), превзошедшая более крупную Llama 2 13B.
Декабрь 2023: Mixtral 8x7B, открытая модель Mixture-of-Experts — на многих тестах на уровне GPT-3.5, но эффективная (только ~13 млрд активных из ~47 млрд параметров).
Важная оговорка: открытые веса не означают открытый исходный код (данные и код обучения закрыты); Mixtral достигла GPT-3.5, но не GPT-4. Архитектура Mixture-of-Experts значительно старше (в частности, Shazeer 2017).

Персоны:Arthur Mensch, Guillaume Lample, Timothée Lacroix

Организации:Mistral AI

2023Продукты

Google Gemini: мультимодальное семейство ИИ

Ответ Google на ChatGPT и прорыв к нативной мультимодальности. 6 декабря 2023 года Google представил Gemini 1.0 — семейство ИИ-моделей, разработанных с нуля для мультимодальности. Совместная работа DeepMind и Google Brain воплотилась в три размера моделей: Gemini Ultra для высококомплексных задач, Gemini Pro как сбалансированное решение и Gemini Nano для использования непосредственно на устройствах. В отличие от систем, расширенных мультимодальностью постфактум, Gemini изначально создавался с нативным пониманием текста, аудио, кода и видео. В шести из восьми тестов Gemini Pro превзошёл стандарт GPT-3.5, включая тесты MMLU. В день анонса обычный Bard получил новые возможности на базе Gemini Pro; более мощный Bard Advanced с Gemini Ultra Google объявил на начало 2024 года. Gemini стал стратегическим ответом Google на доминирование OpenAI и закрепил мультимодальный ИИ как новый стандарт для больших языковых моделей.

Разработан с нуля для мультимодальности: нативная интеграция понимания текста, аудио, кода и видео
Превзошёл GPT-3.5 в 6 из 8 стандартных тестов и утвердил Google как серьёзную альтернативу ChatGPT
Три размера моделей: Ultra (сложные задачи), Pro (сбалансированный), Nano (на устройстве) для разных применений
Обычный Bard получил Gemini Pro в день анонса; Bard Advanced с Gemini Ultra был объявлен на начало 2024 года

Персоны:Sundar Pichai, Demis Hassabis, Gemini Team

Организации:Google, DeepMind, Google AI

2024Продукты

Воплощённый ИИ: модели обретают тело

Долгие годы крупные ИИ-модели существовали только на экранах — они писали тексты, создавали изображения, вели беседы. В 2024 году это начало меняться: год стал годом воплощённого ИИ (embodied AI). Идея состоит в том, чтобы помещать те же базовые модели, которые понимают язык и изображения, в настоящие тела — прежде всего в человекоподобных роботов. Компания Figure объединилась с OpenAI и показала робота, который говорит, видит и манипулирует предметами. NVIDIA представила Project GR00T — базовую модель специально для гуманоидов, а молодые компании, такие как Physical Intelligence, оценивались в миллиарды долларов. Многие уже говорили о своём 'ChatGPT-моменте' для робототехники. Если подходить честно: большинство из этого пока оставалось демонстрациями и анонсами, а не надёжно работающими в повседневной жизни машинами. Физический мир несравнимо сложнее для робота, чем экран, — ловкость, безопасность и надёжность по-прежнему остаются нерешёнными проблемами.

2024 стал годом воплощённого ИИ: языковые модели, прежде существовавшие только в чате, переселились в роботов — особенно в человекоподобных.
Figure объединилась с OpenAI и показала говорящего, действующего гуманоида; NVIDIA представила Project GR00T — базовую модель для гуманоидов; стартапы вроде Physical Intelligence оценивались в миллиарды.
Надежда: робот, объединяющий язык, зрение и действие в единой базовой модели, мог бы обучиться решению общих задач в реальном мире — своего рода ChatGPT-момент для робототехники.
Большинство из этого пока оставались демонстрациями и анонсами, а не надёжно работающими продуктами. Реальный мир несравнимо сложнее для роботов, чем экран, — ловкость, безопасность и надёжность остаются нерешёнными задачами.

Организации:Figure AI, NVIDIA, Physical Intelligence

2024Продукты

Waymo: беспилотное такси становится реальностью

Более десяти лет автономное вождение служило показательным примером обещаний ИИ, которые постоянно откладывались. В 2024 году оно стало реальностью: Waymo, дочерняя компания Google по разработке роботизированных автомобилей, впервые в широком масштабе открыла беспилотные такси для широкой публики — в Сан-Франциско, Лос-Анджелесе и Финиксе. Летом 2024 года компания сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём. После многих лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный, повседневный сервис. Важная оговорка: Waymo работает только в строго ограниченных, тщательно картированных городских районах — не везде и не в любую погоду. Поломки и заблокированные автомобили по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей; уход конкурента Cruise после серьёзного происшествия в 2023 году показал, насколько технология ещё хрупка.

В 2024 году Waymo, дочерняя компания Google по разработке роботизированных автомобилей, стала первым поставщиком беспилотных такси в широком масштабе — открытых для широкой публики в нескольких городах США.
Летом 2024 года Waymo сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём.
После более чем десяти лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный сервис.
Важная оговорка: Waymo работает только в строго ограниченных, картированных городских районах — не везде. Поломки по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей (уход конкурента Cruise показал хрупкость технологии).

Организации:Waymo, Alphabet

2024Продукты

Sora: видео из текста, созданное ИИ

Прогресс в создании фотореалистичных видео с помощью ИИ и его влияние на киноиндустрию. 15 февраля 2024 года OpenAI представила Sora — модель преобразования текста в видео, которая по кратким описаниям генерирует детализированные HD-видео продолжительностью до одной минуты. Названная в честь японского слова, означающего 'небо', Sora символизирует 'безграничный творческий потенциал'. Как диффузный трансформер (Diffusion Transformer), Sora адаптирует технологию DALL-E 3 для временной согласованности и нередко — хотя и не всегда надёжно — симулирует физически правдоподобное движение. Демонстрационные видео превзошли все существующие системы преобразования текста в видео и установили новые стандарты для ИИ-творчества. Режиссёр Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов из-за опасений по поводу влияния Sora на индустрию. OpenAI придерживалась осторожного подхода, проводя тестирование в Red Team на предмет дезинформации и предвзятости перед более широким выпуском.

Фотореалистичная генерация видео из текста с HD-видео длительностью в несколько минут, превосходящая существующие системы
Диффузный трансформер (Diffusion Transformer) на основе технологии DALL-E 3 для временной согласованности
Нередко симулирует физически правдоподобное движение и сохраняет согласованность на протяжении всего видео
Потенциальное изменение киноиндустрии: Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов

Персоны:Tim Brooks, Bill Peebles, Connor Holmes, Will DePue

Организации:OpenAI

2024Продукты

Семейство Claude 3 с мультимодальными возможностями

Представление семейства ИИ с поддержкой зрения и тремя специализированными моделями. 4 марта 2024 года Anthropic представила семейство Claude 3: Opus, Sonnet и Haiku — три модели с различными сильными сторонами для разных сценариев использования. Ключевой функцией стала продвинутая обработка изображений, способная анализировать фотографии, графики, диаграммы и технические чертежи. Claude 3 Opus установил новые рекорды в когнитивных задачах, превзойдя конкурентов в бенчмарках MMLU и GPQA. Sonnet предложил идеальный баланс между интеллектом и скоростью для бизнеса, а Haiku отличался почти мгновенным временем отклика. С контекстным окном в 200 000 токенов (расширяемым до 1 миллиона) и доступностью в 159 странах Claude 3 установил новые стандарты для мультимодальных ИИ-систем.

Продвинутая обработка изображений для фотографий, графиков, диаграмм и технических чертежей
Opus (высший интеллект), Sonnet (баланс), Haiku (скорость) для различных сценариев использования
Мультимодальные возможности позволяют обрабатывать визуальные форматы параллельно с текстом
Claude 3 Opus достиг новых рекордов в MMLU, GPQA и других когнитивных бенчмарках

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Claude 3 Team

Организации:Anthropic, Claude API, Amazon Bedrock

2024Продукты

Devin: первый автономный ИИ-инженер по программному обеспечению

Рождение полностью автономной разработки программного обеспечения с помощью искусственного интеллекта. 12 марта 2024 года компания Cognition Labs представила Devin — позиционируемый фирмой как первый в мире полностью автономный ИИ-инженер по программному обеспечению. Система способна самостоятельно планировать, клонировать репозитории, писать код, отлаживать, тестировать и даже развёртывать его. На сложном тесте SWE-Bench Devin достиг 13,86% успешных решений реальных задач из GitHub — огромный скачок по сравнению с предыдущим лучшим результатом в 1,96%. Стартап получил оценку около 350 миллионов долларов на раннем раунде финансирования; вскоре после запуска появились сообщения об оценке около 2 миллиардов долларов. Несмотря на впечатляющие результаты, тесты выявили и ограничения: только 3 из 20 задач были решены успешно, нередко с непредсказуемыми сбоями.

Полностью автономная разработка программного обеспечения: планирование, программирование, отладка, тестирование и развёртывание без участия человека
Справляется со сложными инженерными задачами — от миграции кода до полной разработки приложений
13,86% успешных решений на SWE-Bench — в 7 раз лучше предыдущего лучшего результата в 1,96%
Вызвало дискуссию о будущем разработки программного обеспечения и вдохновило на создание открытых альтернатив, таких как OpenHands

Персоны:Scott Wu, Steven Hao, Walden Yan

Организации:Cognition Labs, SWE-Bench

2024Прорывы

AlphaFold 3: ИИ предсказывает взаимодействие молекул

Спустя четыре года после прорыва AlphaFold 2 в мае 2024 года Google DeepMind сделала следующий шаг — совместно с дочерней компанией Isomorphic Labs. AlphaFold 2 предсказывал, как отдельный белок сворачивается в трёхмерную структуру. AlphaFold 3 идёт принципиально дальше: он моделирует, как белки взаимодействуют с другими молекулами — с ДНК, РНК, ионами и небольшими молекулами лекарственных веществ. Именно это взаимодействие имеет ключевое значение для фармацевтических исследований: так можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью. Если подходить честно: предсказания впечатляют, но не безупречны — их точность варьируется в зависимости от типа молекулы, и в лаборатории их по-прежнему необходимо проверять. Кроме того, AlphaFold 3 изначально вышел без открытого исходного кода, только в виде ограниченного веб-сервиса, что вызвало в научном сообществе критику относительно воспроизводимости результатов.

В мае 2024 года Google DeepMind и Isomorphic Labs представили AlphaFold 3.
Если AlphaFold 2 предсказывал сворачивание отдельных белков, то AlphaFold 3 моделирует их взаимодействие — с ДНК, РНК, молекулами лекарственных веществ и ионами.
Особенно ценно для фармацевтических исследований: можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью.
Предсказания не безупречны и требуют лабораторной проверки. AlphaFold 3 изначально вышел без открытого кода — только как ограниченный веб-сервис, что вызвало критику относительно воспроизводимости результатов.

Организации:Google DeepMind, Isomorphic Labs

2024Соревнования

AlphaProof: ИИ завоёвывает серебро на математической олимпиаде

Математика долгое время считалась королевской дисциплиной, недоступной для ИИ: слишком творческой, слишком требовательной к подлинному пониманию. В июле 2024 года Google DeepMind поставила восклицательный знак: система AlphaProof совместно с AlphaGeometry 2 решила четыре из шести задач Международной математической олимпиады. Это соответствовало уровню серебряной медали — всего на одно очко ниже золота. Принципиально важна методика работы: AlphaProof формулирует доказательства на формальном языке Lean, в котором каждый шаг поддаётся машинной проверке — значит, ИИ не может 'схитрить'. Обучение проходило с применением метода обучения с подкреплением. Впервые ИИ достиг медального уровня на этом престижном соревновании. Если подходить честно: это были не настоящие условия соревнования. Там, где участники располагают четырьмя с половиной часами, ИИ иногда работал несколько дней, и специалистам пришлось вручную переводить задачи на формальный язык. Две комбинаторные задачи так и остались нерешёнными.

В июле 2024 года AlphaProof от Google DeepMind вместе с AlphaGeometry 2 решил четыре из шести задач Международной математической олимпиады — на уровне серебряной медали.
AlphaProof формулирует доказательства на формальном языке Lean и проверяет их самостоятельно; обучен с применением метода обучения с подкреплением. AlphaGeometry 2 взял на себя геометрическую задачу.
Впервые ИИ достиг медального уровня на этом престижном соревновании — важная веха для машинного рассуждения с проверяемыми доказательствами.
Не настоящие условия соревнования: ИИ потребовались дни вместо 4,5 часов, а люди переводили задачи на формальный язык. Две комбинаторные задачи остались нерешёнными.

Организации:Google DeepMind

2024Регулирование

Закон ЕС об ИИ: первый комплексный закон об искусственном интеллекте

Первое в мире комплексное регулирование искусственного интеллекта вступает в силу. 1 августа 2024 года Закон ЕС об ИИ приобрёл юридическую силу — основанный на оценке рисков свод правил, включающий 180 преамбульных пунктов и 113 статей для всего жизненного цикла систем ИИ. Закон классифицирует системы ИИ по четырём уровням риска: недопустимые приложения запрещены, системы высокого риска в образовании, занятости и правосудии подлежат детальным требованиям по соблюдению нормативов, системы ограниченного риска обязаны выполнять требования о прозрачности, а подавляющее большинство систем с минимальным риском остаются в значительной мере нерегулируемыми. Параллельно действуют отдельные правила для базовых моделей общего назначения (GPAI), таких как GPT, лежащих в основе ChatGPT. Экстерриториальное действие закона распространяется также на поставщиков за пределами ЕС, обслуживающих европейских пользователей. За нарушения грозят штрафы до 35 миллионов евро или 7% мирового годового оборота. Подобно GDPR 2018 года, Закон об ИИ может установить глобальные стандарты и определить, как ИИ влияет на нашу жизнь. Поэтапное введение в действие начинается в 2025 году и завершается к 2027 году.

Первый в мире комплексный закон об ИИ с 180 преамбульными пунктами и 113 статьями для всего жизненного цикла систем ИИ
Четыре уровня риска: запрещённые, высокого риска, ограниченного риска и минимального риска — плюс отдельные правила для базовых моделей GPAI
Экстерриториальное действие по образцу GDPR может установить глобальные стандарты ИИ и повлиять на соблюдение нормативов во всём мире
Штрафы до 35 млн евро или 7% годового оборота, поэтапное введение в действие 2025–2027

Персоны:Ursula von der Leyen, Thierry Breton

Организации:European Union, European Parliament, European Commission

2024Продукты

OpenAI O1 — прогресс в рассуждении

12 сентября 2024 года OpenAI выпустила сначала o1-preview (и o1-mini), существенно расширив возможности ИИ в области рассуждения (reasoning) благодаря цепочке размышлений (chain-of-thought), обученной методом обучения с подкреплением (reinforcement learning). O1 — первая широко доступная языковая модель, которая систематически 'думает' перед ответом: используя закрытую цепочку размышлений, она анализирует проблемы шаг за шагом. Этот новый подход открывает дополнительное измерение масштабирования — масштабирование на этапе вывода (test-time scaling), при котором более длительное 'обдумывание' даёт лучшие результаты. Полная модель o1 в бенчмарк-тестах достигает уровня, сопоставимого с кандидатами PhD в физике, химии и биологии, и решает 83 % задач American Invitational Mathematics Examination (GPT-4o: 13 %). Технология показывает, что ИИ способен значительно улучшить навыки решения задач за счёт структурированного рассуждения.

Первая модель, чья цепочка размышлений (chain-of-thought) обучается и масштабируется с помощью обучения с подкреплением — для структурированного рассуждения
Новое измерение масштабирования: чем дольше модель думает, тем лучше результаты
Новый подход: от воспроизведения паттернов к улучшенному решению задач
Важный шаг вперёд в сложном рассуждении — улучшенные способности к решению задач

Персоны:Sam Altman, Noam Brown, OpenAI Team

Организации:OpenAI

2024Вехи

Нобелевские премии по ИИ 2024 года

В октябре 2024 года произошло нечто беспрецедентное: сразу две Нобелевские премии по естественным наукам отметили основы современного ИИ. 8 октября Нобелевская премия по физике была присуждена Джону Хопфилду и Джеффри Хинтону — за фундаментальные открытия, открывшие путь к машинному обучению с искусственными нейронными сетями. То, что именно физика отметила нейронные сети, вызвало дискуссии — однако вдохновлённые физикой сети Хопфилда (1982) и методы обучения Хинтона действительно заложили фундамент. Днём позже Нобелевскую премию по химии разделили Дэвид Бейкер (за компьютерное проектирование белков), а также Демис Хассабис и Джон Джампер из DeepMind — за AlphaFold, решивший 50-летнюю проблему предсказания структуры белков. Впервые фундаментальные исследования в области ИИ были признаны на высшем уровне мировой науки. Примечательно: Хинтон, только что удостоенный премии, воспользовался трибуной, чтобы одновременно предупредить об опасностях технологии, у истоков которой стоял.

8 октября 2024: Нобелевская премия по физике присуждена Джону Хопфилду и Джеффри Хинтону за основы машинного обучения с нейронными сетями — премия по физике за ИИ.
9 октября 2024: Нобелевская премия по химии присуждена Дэвиду Бейкеру (проектирование белков), а также Демису Хассабису и Джону Джамперу из DeepMind (AlphaFold, предсказание структуры белков).
Впервые две Нобелевские премии по естественным наукам в один год отметили основы ИИ — поворотный момент в статусе этой области.
Дискуссионный вопрос: являются ли нейронные сети физикой? Премии отмечают многолетние фундаментальные разработки (сети Хопфилда 1982, машина Больцмана Хинтона). Хинтон одновременно предупредил об опасностях ИИ.

Персоны:John Hopfield, Geoffrey Hinton, Demis Hassabis, John Jumper, David Baker

Организации:Royal Swedish Academy of Sciences

2024Прорывы

OpenAI o3: прорыв на тесте ARC-AGI

Незадолго до конца 2024 года, 20 декабря, OpenAI анонсировала o3 — преемника o1 и доказательство того, что масштабирование рассуждений во время работы модели (Test-Time Scaling) можно продолжать. Особое внимание привлёк один результат: o3 набрала 87,5 % на ARC-AGI — тесте, намеренно построенном так, чтобы его нельзя было пройти простым запоминанием; предыдущие модели оставались здесь почти на нуле. Тем самым o3 впервые приблизилась к человеческому уровню на этом тесте и одновременно продемонстрировала высокие результаты в математике и программировании. Вместе с o1 и DeepSeek-R1, o3 ознаменовала эру моделей-рассуждателей (Reasoning Models) (o3-mini последовала в конце января 2025 года, полная o3 — в апреле). Важная оговорка: 87,5 % были получены в режиме максимальной производительности с огромными — и очень дорогостоящими — вычислительными затратами на каждую задачу; организаторы ARC Prize особо подчеркнули, что o3 не является AGI и показывает значительно худшие результаты на более сложном тесте ARC-AGI-2.

o3 (анонсирована 20.12.2024) развивает Test-Time Scaling из o1: больше вычислений во время работы модели — лучшие результаты, высшие оценки в математике и коде.
87,5 % на ARC-AGI — тесте, защищённом от простого запоминания, на котором предыдущие модели почти не набирали очков: заметный прыжок в сторону человекоподобной адаптивности.
Вместе с o1 и DeepSeek-R1 открыла эру моделей-рассуждателей; o3-mini — конец января 2025, полная o3 — апрель 2025.
Важная оговорка: 87,5 % получены в дорогостоящем режиме максимальной производительности декабрьской предварительной версии (позднее выпущенная o3 показала более низкие результаты); организаторы ARC подчёркивают: o3 — НЕ AGI и на более сложном ARC-AGI-2 опускается примерно до 3 %.

Организации:OpenAI

2025Продукты

Агентный ИИ выходит в массы

В 2024–2025 годах изменилось само предназначение ИИ: от ответов — к действиям. Первой ласточкой стала Anthropic: в октябре 2024 года она первой из крупных ИИ-лабораторий представила модель, которая умеет самостоятельно управлять компьютером — видеть экран, двигать мышью, кликать, печатать. В январе 2025 года OpenAI выпустила Operator — агента, который самостоятельно выходит в интернет и выполняет задачи, а вскоре после этого — Deep Research, способный проводить многоэтапные исследования и составлять подкреплённые ссылками отчёты. Чат-бот, выдающий текст, превратился в систему, действующую от имени пользователя, — качественный сдвиг, намеченный ещё Devin в 2024 году. Если подходить честно: первые версии работали медленно, часто давали сбои и справлялись лишь с узко очерченными задачами; системы, выпущенные в 2025 году под маркой агентов, продвигались активнее, чем позволяла реальная надёжность.

Anthropic, Computer Use (окт. 2024): первая frontier-модель с управлением компьютером в открытой бете — экран, мышь, клавиатура.
OpenAI: Operator (янв. 2025) самостоятельно выходит в интернет; Deep Research (февр. 2025) проводит многоэтапные исследования и составляет подкреплённые ссылками отчёты.
Переход от чат-бота (выдавать текст) к агенту (действовать) — намечен Devin (2024), в 2025 году стал продуктовым мейнстримом.
Ранние версии работали медленно, давали сбои, были ограничены узкими задачами; системы продвигались активнее, чем позволяла их реальная надёжность в 2025 году.

Организации:Anthropic, OpenAI

2025Продукты

DeepSeek-R1: ИИ-шок из Китая

В конце января 2025 года ИИ-модель впервые ощутимо пошатнула мировые фондовые рынки. 20 января 2025 года китайская лаборатория DeepSeek опубликовала R1 — модель рассуждения (reasoning model) на уровне o1 от OpenAI, но с открытыми весами (лицензия MIT) и стоимостью обучения, оказавшейся значительно ниже ожидаемой. Это стало возможным благодаря масштабному обучению с подкреплением на базовой модели DeepSeek-V3. Когда неделю спустя приложение DeepSeek возглавило американские чарты, настроение переломилось: 27 января акции Nvidia упали примерно на 17 % — около 600 миллиардов долларов за один день, крупнейшие однодневные потери в истории американской биржи, — поскольку инвесторы усомнились в том, что передовому ИИ непременно нужны бесконечно дорогие чипы. R1 одновременно поколебал несколько убеждений: что только американские гиперскейлеры могут конкурировать на вершине, что модели рассуждения остаются закрытыми и что наращивание вычислительных мощностей — единственный путь вперёд. Если подходить честно: расхожая цифра в несколько миллионов долларов относится только к финальному обучающему прогону базовой модели V3 (не к R1 как таковой, не к исследованиям и оборудованию в целом) — и R1 превосходила o1 далеко не по всем показателям.

R1 (20 янв. 2025): модель рассуждения на уровне o1 с открытыми весами (лицензия MIT), обученная с применением масштабного обучения с подкреплением на DeepSeek-V3.
Обучена при значительно меньших затратах, чем ожидалось, — это поставило под сомнение тезис о том, что передовой ИИ непременно требует огромных вычислительных бюджетов.
27 янв. 2025: Nvidia -около 17 % (около 600 млрд $ за один день, рекорд США); Китай на вершине ИИ — ИИ стал зримым вопросом рынка и геополитики.
Несколько миллионов долларов относятся лишь к финальному обучающему прогону базовой модели V3 — не к самой R1 и не к исследованиям или оборудованию в целом; R1 превосходила o1 не по всем показателям.

Персоны:Liang Wenfeng

Организации:DeepSeek

2025Вехи

Stargate: ИИ как инфраструктура национального масштаба

21 января 2025 года искусственный интеллект оказался в Белом доме на сцене — как инфраструктурный проект национального масштаба. OpenAI, SoftBank, Oracle и инвестиционная компания MGX объявили о проекте Stargate: до 500 миллиардов долларов за четыре года на центры обработки данных для ИИ в США, причём вложение 100 миллиардов долларов должно было начаться немедленно. Тем самым стало очевидно, что следующая фаза ИИ — это меньше вопрос алгоритмов и больше вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций и промышленных парков. Для области, красной нитью которой со времён AlexNet является вычислительная мощь (см. CUDA 2007), это была логичная, но грандиозная следующая ступень — и сигнал того, что ИИ стал национальным геополитическим приоритетом. Важная оговорка: объявление — это не готовый центр обработки данных. Полнота финансирования в размере 500 миллиардов долларов вызывала сомнения с самого начала — в том числе у участников и наблюдателей, публично высказывавших скептицизм.

До 500 млрд долларов за четыре года на центры обработки данных для ИИ в США (OpenAI, SoftBank, Oracle, MGX); вложение 100 млрд долларов должно было начаться немедленно.
Объявлено в Белом доме: ИИ открыто превратился в вопрос национальной инфраструктуры и геополитики.
Следующая фаза ИИ — это вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций (красная нить, начиная с CUDA/AlexNet).
Важная оговорка: объявление — не готовый центр обработки данных; полнота финансирования в 500 млрд долларов вызывала сомнения с самого начала.

Персоны:Sam Altman, Masayoshi Son, Larry Ellison

Организации:OpenAI, SoftBank, Oracle

2025Регулирование

Парижский саммит по ИИ (AI Action Summit)

10 и 11 февраля 2025 года в парижском Гран-Пале встретились главы государств и правительств, технологические компании и исследователи на саммите AI Action Summit — третьем крупном международном форуме по ИИ после Блетчли (2023) и Сеула (2024), который совместно возглавляли президент Франции Макрон и премьер-министр Индии Моди. Примечательным стал сдвиг в тоне: если первый саммит уделял главное внимание безопасности ИИ, то в Париже речь шла прежде всего о возможностях, инвестициях и конкурентоспособности — вице-президент США открыто выступал против избыточного регулирования. В итоге 58 государств, а также ЕС и Африканский союз подписали декларацию об инклюзивном и устойчивом ИИ — однако США и Великобритания от подписи отказались. Тем самым саммит обнажил трансатлантический раскол в сфере управления ИИ. Важная оговорка: декларация носила необязательный характер, а критики назвали саммит упущенной возможностью для решения вопросов безопасности.

Третий глобальный саммит по ИИ (после Блетчли 2023, Сеула 2024): 10-11 февраля 2025, Гран-Пале, под руководством Макрона и Моди.
Смена тона: от безопасности к возможностям и конкуренции — Париж сделал акцент на инвестициях, а не рисках; вице-президент США выступал против избыточного регулирования.
58 государств плюс ЕС и Африканский союз подписали итоговую декларацию — США и Великобритания отказались от подписи (открытый трансатлантический раскол).
Важная оговорка: декларация носила необязательный характер; критики назвали саммит упущенной возможностью для обсуждения безопасности ИИ.

Персоны:Emmanuel Macron, Narendra Modi

2025Продукты

Frontier-модели 2025 года

В 2025 году способность к рассуждению, которую запустили o1 и R1, превратилась в стандарт ведущих моделей — в темпе, за которым было трудно успевать. В марте Google представила Gemini 2.5 Pro, в мае Anthropic выпустила Claude 4 (Opus 4 и Sonnet 4), в августе OpenAI — GPT-5; между ними вышли Claude 3.7 (первая гибридная модель, по выбору отвечающая быстро или рассуждающая дольше), GPT-4.5, Llama 4 от Meta и Grok от xAI. Новое поколение объединило две линии: пошаговое рассуждение reasoning-моделей и способность действовать самостоятельно (агентность). Особое место заняло автономное программирование на длинных дистанциях. Если подходить честно: лаборатории каждую неделю перебивали друг друга в рекордах по бенчмаркам, и каждая заявляла о своём первенстве — реальный прогресс есть, но часто употребляемое слово AGI оставалось скорее маркетингом, чем реальностью.

В 2025 году рассуждение (пошаговое обдумывание) и агентность (самостоятельные действия) стали стандартом ведущих моделей; Claude 3.7 ввёл гибридную модель, способную отвечать быстро или рассуждать дольше.
Плотная гонка: Gemini 2.5 Pro (март), Claude 4 / Opus 4 (май), GPT-5 (август) — плюс Llama 4, Grok, DeepSeek. Несколько лабораторий на вершине.
В центре внимания: автономное программирование на длинных дистанциях (например, Claude Code) — модели, самостоятельно выполняющие целые задачи.
Рекорды бенчмарков каждую неделю, каждая лаборатория заявляет о лидерстве; реальный прогресс есть, но AGI оставался скорее маркетингом, чем реальностью.

Организации:Anthropic, OpenAI, Google DeepMind

1837Вехи

Аналитическая машина Бэббиджа: идея компьютера

История ИИ начинается не с компьютеров, а с идеи компьютера. В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину и впервые подробно описал её в 1837 году — на бумаге это был первый универсальный программируемый вычислительный прибор в мире. Его проект на целый век опережал своё время: в нём уже были арифметическое устройство, которое Бэббидж называл 'мельницей' (mill), память (store), программирование с помощью перфокарт и даже условные переходы — основные строительные блоки любого современного компьютера. При жизни изобретателя машина так и не была построена: она оказалась слишком сложной для механики XIX века. Тем не менее она является далёкой прародительницей каждого вычислительного устройства — а значит, и того оборудования, на котором вообще может работать искусственный интеллект. Если подходить честно: Аналитическая машина осталась незавершённым проектом, и она была вычислительным, а не мыслящим устройством. Она заложила фундамент — способность вычислять, но не мыслить.

В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину, которую впервые описал в 1837 году, — первый проект универсального программируемого вычислителя.
Его проект уже содержал строительные блоки современных компьютеров: арифметическое устройство (mill), память (store), программирование с помощью перфокарт и даже условные переходы.
Машина Бэббиджа — далёкая прародительница каждого компьютера, а значит, и того оборудования, на котором вообще может работать ИИ.
Аналитическая машина при жизни Бэббиджа так и не была достроена — она осталась чертежом на бумаге. И она была вычислителем, а не ИИ: фундамент, но не само мышление.

Персоны:Charles Babbage

1843Публикации

Ада Лавлейс: первая программа — и смелое видение

Чарльз Бэббидж спроектировал машину — но именно Ада Лавлейс поняла, на что та способна. В 1843 году британская математик перевела статью об Аналитической машине Бэббиджа и добавила собственные примечания, которые значительно превзошли оригинал по объёму и глубине. В своей заметке G она описала процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой. Ещё дальновиднее оказалось второе открытие: машина не обязана работать только с числами — она может обрабатывать символы любого рода и даже сочинять музыку. Тем самым Лавлейс на целый век опередила идею универсальной обработки данных. Если подходить честно: была ли она первым программистом — спорный вопрос: сам Бэббидж набрасывал программы раньше, а процедура вычисления чисел Бернулли создавалась в диалоге с ним. При этом Лавлейс полагала, что машина не способна создать ничего подлинно нового — возражение, которому Алан Тьюринг открыто противопоставил своё мнение в 1950 году.

В 1843 году Ада Лавлейс перевела статью об Аналитической машине Бэббиджа и дополнила её обширными собственными примечаниями, далеко превзошедшими оригинал.
Её заметка G содержит процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой.
Провидчески она увидела: машина способна на большее, чем вычисления — она может обрабатывать символы и даже сочинять музыку, то есть реализовывать идею универсальной обработки данных.
Спорно, была ли Лавлейс первым программистом (Бэббидж писал программы раньше; процедура вычисления чисел Бернулли создавалась вместе с ним). Кроме того, она считала, что машина не способна создавать что-то подлинно новое, — с чем Тьюринг поспорил в 1950 году.

Персоны:Ada Lovelace

1936Публикации

Машина Тьюринга: что такое вычисление

Прежде чем задаться вопросом, могут ли машины думать, нужно было выяснить, что вообще способна вычислить машина. На этот вопрос ответил британский математик Алан Тьюринг в 1936 году в своей статье 'On Computable Numbers'. В ней он описал удивительно простую мысленную модель — лента, читающая-записывающая головка, несколько правил, — получившую позднее название машины Тьюринга. С её помощью Тьюринг точно установил, что является вычислимым, а что нет. Его важнейшее открытие: одна универсальная машина Тьюринга способна имитировать любую другую. Это теоретический прообраз универсального компьютера — машины, которая при наличии нужной программы может выполнить любое вычислимое действие. Тем самым Тьюринг стал основоположником информатики и создал фундамент, на котором только и стала возможной идея мыслящих машин. Важная оговорка: машина Тьюринга — математическая идея, а не построенное устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само же название 'машина Тьюринга' ввели другие.

В 1936 году Алан Тьюринг опубликовал статью 'On Computable Numbers' и описал в ней простую мысленную вычислительную модель — впоследствии названную машиной Тьюринга.
С её помощью Тьюринг установил, что вообще является вычислимым. Универсальная машина Тьюринга способна имитировать любую другую — теоретический прообраз универсального компьютера.
Тем самым Тьюринг стал основоположником информатики. То, что одна машина способна выполнить любое вычислимое действие, составляет основу, на которой машины впоследствии должны были научиться думать.
Важная оговорка: машина Тьюринга — математическая идея, а не устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само название ввели другие.

Персоны:Alan Turing

1943Публикации

Маккалок и Питтс: первый искусственный нейрон

За тринадцать лет до Дартмутской конференции, в разгар войны, вышло истинное свидетельство о рождении искусственных нейронных сетей. Нейрофизиолог Уоррен Маккалок и самоучка-логик Уолтер Питтс — которому едва исполнилось двадцать лет и у которого не было никакой учёной степени — опубликовали в 1943 году в Bulletin of Mathematical Biophysics статью 'A Logical Calculus of the Ideas Immanent in Nervous Activity'. Их идея была радикально простой: нейрон можно описать как бинарный переключатель, который срабатывает по принципу 'всё или ничего', когда сумма его входных сигналов превышает порог. На основе чистой пропозициональной логики они доказали, что сети из таких элементов способны вычислять любую логическую функцию, а сети с петлями обратной связи обладают даже своеобразной памятью. В заключительной части авторы указали, что их сети способны вычислить то же, что и машина Тьюринга. Тем самым они создали первую математическую модель нейрона как логического вычислительного элемента. Главный изъян, определивший следующее десятилетие: их нейрон не умел учиться.

Первая математическая модель нейрона как логического вычислительного элемента: Маккалок и Питтс облекли работу нервной системы в формальную пропозициональную логику.
Всё или ничего: нейрон срабатывает, когда сумма входных сигналов превышает порог. Сети таких элементов вычисляют любую логическую функцию; петли обратной связи создают память.
Принципиальное ограничение: нет обучения. Веса и пороги были фиксированы, сеть нужно было проектировать вручную. Лишь правило Хебба (1949) и перцептрон Розенблатта (1957) принесли правила обучения.
Влияние вышло далеко за пределы биологии: архитектура компьютера фон Неймана (EDVAC, 1945), кибернетика Винера и, в конечном счёте, каждая искусственная нейронная сеть опираются на эту работу.

Персоны:Warren S. McCulloch, Walter Pitts

Организации:University of Illinois, College of Medicine, University of Chicago

1948Публикации

Теория информации Шеннона: рождение бита

В 1948 году в Bell Labs вышла статья, заложившая основы цифрового мира: 'A Mathematical Theory of Communication' Клода Шеннона. Шеннон показал, как можно измерить информацию математически — безотносительно её смысла. Он ввёл бит как наименьшую единицу информации и ввёл понятие энтропии: меру того, сколько неопределённости в среднем снимает сообщение. Тем самым он заложил фундамент для сжатия данных, безошибочной передачи информации и в конечном счёте для каждого компьютера. Для ИИ это нечто большее, чем просто предыстория: такие понятия, как перекрёстная энтропия и дивергенция Кульбака — Лейблера, которые сегодня служат целевыми функциями при обучении нейронных сетей, уходят корнями прямо в теорию Шеннона. Важная оговорка: Шеннон описывал передачу сообщений, а не мышление. Теория информации — математический инструмент, на котором строится ИИ, но сама она не является искусственным интеллектом.

В 1948 году Клод Шеннон опубликовал в Bell Labs статью 'A Mathematical Theory of Communication' и заложил основы теории информации.
Он ввёл бит как единицу измерения информации и определил энтропию — меру того, сколько неопределённости в среднем снимает сообщение.
Центральное значение для ИИ: перекрёстная энтропия и KL-дивергенция — прямо из теории Шеннона — сегодня являются стандартными целевыми функциями при машинном обучении.
Важная оговорка: Шеннон описывал передачу сообщений, а не интеллект. Теория информации — фундамент, на котором строится ИИ, а не результат работы ИИ. (Термин 'бит' предложил коллега Джон Тьюки.)

Персоны:Claude Shannon

Организации:Bell Labs

1949Публикации

Правило Хебба: как рождается обучение в мозге

В 1949 году канадский психолог Дональд Хебб опубликовал книгу 'The Organization of Behavior' и выдвинул простую, но важную идею: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется. Тем самым Хебб впервые предложил конкретный механизм того, как обучение может работать на уровне отдельных синапсов. Для ИИ это стало основополагающим принципом: обучение означает изменение силы связей — именно это делают искусственные нейронные сети, в том числе более поздние сети Хопфилда. Если подходить честно: знаменитый афоризм о том, что нейроны, возбуждающиеся вместе, соединяются вместе, принадлежит вовсе не Хеббу — его приписывают нейробиологу Карле Шатц (1992). И правило Хебба само по себе ещё не объясняет современное глубокое обучение, поскольку в нём отсутствует целенаправленная коррекция ошибок.

В 1949 году психолог Дональд Хебб опубликовал 'The Organization of Behavior' и сформулировал возможный механизм обучения в мозге на уровне синапсов.
Правило Хебба: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется.
Идея — обучение означает изменение силы связей — стала основополагающим принципом обучающихся нейронных сетей (например, в сетях Хопфилда).
Знаменитый афоризм (нейроны, которые возбуждаются вместе, соединяются вместе) принадлежит не Хеббу, а приписывается Карле Шатц (1992). Правило Хебба само по себе не объясняет современное глубокое обучение — для этого нужна коррекция ошибок.

Персоны:Donald Hebb

1950Публикации

Тест Тьюринга: игра в имитацию

Философская основа машинного интеллекта и первый эталонный тест ИИ. В 1950 году Алан Тьюринг опубликовал в журнале Mind статью 'Computing Machinery and Intelligence' и по-новому сформулировал вопрос 'Могут ли машины мыслить?'. Вместо философских определений Тьюринг предложил практическую 'Игру в имитацию': человек-оценщик анализирует текстовые расшифровки диалогов между человеком и машиной. Оценщик пытается определить, кто из собеседников является машиной; машина считается выдержавшей тест, если оценщик не может надёжно это определить. Решающим является не правильность ответов, а то, насколько они похожи на ответы человека. Этот тест на неотличимость можно распространить на все виды человеческой деятельности — как вербальные, так и невербальные (робототехника). Поведенческий подход Тьюринга заложил концептуальный фундамент для всей науки об ИИ и повлиял на ELIZA, ChatGPT и все современные системы разговорного ИИ.

Тест на неотличимость: оценщик пытается отличить машину от человека с помощью текстового диалога
Перенёс акцент с философских определений на поведенческие демонстрации интеллекта
Сформулировал основополагающий вопрос 'Могут ли машины мыслить?' и предложил операциональный подход
Установил первый эталонный тест ИИ и повлиял на все последующие разработки в области разговорного ИИ

Персоны:Alan Turing

Организации:University of Manchester, Mind Journal

1956Прорывы

Logic Theorist: первая программа для логического вывода

В то же лето, когда в Дартмуте был введён термин 'искусственный интеллект', Аллен Ньюэлл, Херберт Саймон и нередко забытый программист Клифф Шоу представили то, что принято называть 'первой программой ИИ' — с одной оговоркой. Их Logic Theorist доказывал математические теоремы: программа взялась за пропозициональную логику из 'Principia Mathematica' Уайтхеда и Рассела и самостоятельно нашла доказательства для 38 из первых 52 теорем. Примечательным был сам подход: вместо того чтобы перебирать все варианты подряд, программа использовала эвристический поиск — она оценивала, какие шаги перспективны, и работала от цели назад. Для одной теоремы она даже нашла более короткое доказательство, чем в оригинале; по имеющимся сведениям, Рассел был доволен, тогда как научный журнал отклонил представленное доказательство. Всё было написано на IPL — языке списков, предвосхитившем LISP Маккарти. Ограничение: игровые программы вроде дамок Самуэля работали раньше — Logic Theorist стал первой программой, целенаправленно воспроизводившей человеческое рассуждение на открытой интеллектуальной задаче.

Нередко называемая 'первой программой ИИ' — точнее: первая программа, которая должна была воспроизвести человеческое рассуждение на открытой интеллектуальной задаче (игровые программы появились раньше).
Эвристический поиск вместо грубой силы: от цели назад, с оценкой перспективных шагов (подстановка, отделение, сцепление) — под влиянием эвристики Пойа.
Доказала 38 из первых 52 теорем из главы 2 'Principia Mathematica' — для одной теоремы даже короче, чем в оригинале.
Написана на языке списков IPL (главным образом Шоу), который повлиял на LISP Маккарти; эвристический подход привёл непосредственно к General Problem Solver (1957).

Персоны:Allen Newell, Herbert A. Simon, John Clifford Shaw

Организации:RAND Corporation, Carnegie Institute of Technology

1956Конференции

Дартмутская конференция: рождение ИИ

Исторический момент, когда искусственный интеллект родился как научная область. С 18 июня по 17 августа 1956 года в Дартмутском колледже прошла первая летняя исследовательская конференция по ИИ. Джон Маккарти, Марвин Минский, Натаниэль Рочестер и Клод Шеннон разделяли смелое видение: 'Каждый аспект обучения или любую другую характеристику интеллекта можно описать достаточно точно, чтобы машина могла её смоделировать.' На этом восьминедельном семинаре Маккарти ввёл термин 'Artificial Intelligence' и тем самым заложил основу новой научной дисциплины. Некоторые участники приезжали лишь на несколько недель, другие присутствовали постоянно: Херберт Саймон и Аллен Ньюэлл в первые недели демонстрировали свой Logic Theorist, тогда как Рэй Соломонофф провёл все восемь недель на месте — обсуждения велись на верхнем этаже математического факультета. Из этой конференции выросли три исторических центра ИИ: Университет Карнеги — Меллон с Ньюэллом и Саймоном, MIT с Минским и Стэнфорд с Маккарти.

Рождение ИИ как самостоятельной исследовательской дисциплины благодаря 8-недельному семинару с ведущими учёными
Джон Маккарти ввёл термин 'Artificial Intelligence' и тем самым определил новую область исследований
Заложена исследовательская программа: машинный язык, абстракция, решение задач и самосовершенствование
Собрал отцов-основателей ИИ: Маккарти, Минского, Шеннона, Рочестера и будущего лауреата Нобелевской премии Херберта Саймона

Персоны:John McCarthy, Marvin Minsky, Nathaniel Rochester, Claude Shannon

Организации:Dartmouth College, IBM, Bell Labs

1957Публикации

Перцептрон: первая обучающаяся нейронная сеть

Рождение машинного обучения — первый обучаемый искусственный нейрон. В 1957 году Фрэнк Розенблатт в Cornell Aeronautical Laboratory разработал перцептрон — первую нейронную сеть, способную учиться на опыте. В январе 1957 года он опубликовал технический отчёт 'The Perceptron: A Perceiving and Recognizing Automaton' (Project PARA, Report 85-460-1). Формальная научная публикация вышла в ноябре 1958 года в журнале Psychological Review. Вдохновлённый биологическими нейронами, перцептрон объединял взвешенные входные данные через функцию Хевисайда, выдавая бинарные выходные значения. Новаторское правило обучения перцептрона корректировало веса каждый раз, когда пример классифицировался неверно, — ранний предшественник обучения в современных нейронных сетях (его не следует путать с более поздним дельта-правилом Уидроу и Хоффа, 1960 года). Сначала смоделированный на IBM 704 и публично анонсированный в 1958 году, аппаратный Mark I Perceptron был завершён лишь около 1960 года. Несмотря на ограниченность линейно разделимыми задачами, перцептрон заложил концептуальный фундамент для всех последующих нейронных архитектур.

Первый обучаемый искусственный нейрон со взвешенными входами и функцией Хевисайда
Бинарная классификация через пороговое решение, эффективная для линейно разделимых паттернов
Правило обучения перцептрона Фрэнка Розенблатта корректировало веса при каждой ошибке классификации, обеспечивая автоматическое обучение
Ограниченность линейно разделимыми задачами впоследствии вызвала критику XOR со стороны Минского и Пейперта

Персоны:Frank Rosenblatt

Организации:Cornell Aeronautical Laboratory, US Navy

1958Прорывы

LISP: язык ИИ

В 1958 году Джон Маккарти в Массачусетском технологическом институте разработал язык программирования, ставящий символьные вычисления в центр: LISP, сокращение от List Processing. Вместо того чтобы преимущественно обрабатывать числа, LISP манипулировал списками символов — именно то, что требовалось символическому ИИ. На протяжении десятилетий LISP оставался языком исследований в области ИИ: экспертные системы, обработка естественного языка и системы планирования создавались на нём. Язык Маккарти ввёл также идеи, которые сегодня стали само собой разумеющимися: рекурсию, автоматическую сборку мусора (garbage collection), функции как данные и интерактивное вычисление выражений. Стив Расселл реализовал теоретический механизм вычисления eval Маккарти в виде первого интерпретатора — и тем самым сделал LISP работающим. Если подходить честно: LISP не был первым языком высокого уровня (Fortran появился в 1957 году), но он второй по возрасту из тех, что используются до сих пор, — и самый значимый для ИИ.

Джон Маккарти разработал LISP в 1958 году в MIT для символьных вычислений (списки вместо чисел) — на протяжении десятилетий ГЛАВНЫЙ язык исследований ИИ (экспертные системы, NLP, планирование).
Ввёл идеи, ставшие сегодня стандартом: рекурсию, автоматическую сборку мусора, функции как данные, интерактивное вычисление выражений (REPL).
Опирался на обработку списков из IPL; Стив Расселл реализовал eval Маккарти в виде первого интерпретатора и сделал LISP работающим.
Не первый язык высокого уровня (Fortran 1957 появился раньше) — но второй по возрасту из тех, что используются до сих пор, и самый значимый для ИИ.

Персоны:John McCarthy, Steve Russell

Организации:MIT

1959Прорывы

Артур Самуэль: самообучающийся ИИ и термин 'машинное обучение'

За несколько лет до Дартмутской конференции Артур Самуэль в IBM научил машину играть в шашки — и заодно учиться. Его программа работала с 1952 года на IBM 701; главным, однако, стало то, что он изложил в своей статье 1959 года 'Some Studies in Machine Learning Using the Game of Checkers'. Программа совершенствовалась сама: она сыграла десятки тысяч партий против самой себя и корректировала веса своей оценочной функции по итогам игр. В названии этой статьи термин 'машинное обучение' (Machine Learning) зафиксирован в современном значении впервые — Самуэль считается его создателем. Ричард Саттон позднее оценил самоигру Самуэля как первое применение обучения с временными разностями (Temporal-Difference Learning), лежащего в основе современного обучения с подкреплением. Телевизионная демонстрация 1956 года и широко цитируемая победа над предполагаемым мастером попали в заголовки газет — однако оба события были значительно преувеличены: против действительно сильных игроков программа проигрывала, и шашки были полностью решены лишь несколько десятилетий спустя.

В названии статьи 1959 года Самуэль использовал термин 'Machine Learning' (машинное обучение) — первое задокументированное употребление в современном значении; он считается его создателем.
Первая публично продемонстрированная самообучающаяся программа: она самостоятельно корректировала веса своей оценочной функции и запоминала позиции (метод ротации).
Сыграв десятки тысяч партий против самой себя, программа предвосхитила самоигру, доведённую до совершенства в AlphaZero, — по оценке Саттона, это первое применение обучения с временными разностями (Temporal-Difference Learning).
Важная оговорка: прославленная победа 1962 года была одержана над переоценённым соперником; против мировых лидеров программа проигрывала. Шашки были полностью решены лишь в 2007 году (Chinook).

Персоны:Arthur Lee Samuel

Организации:IBM

1965Вехи

DENDRAL: пионер экспертных систем

В середине 1960-х годов ИИ сделал принципиальный поворот. В Стэнфордском университете Эдвард Фейгенбаум и генетик, лауреат Нобелевской премии Джошуа Ледерберг приступили к работе над DENDRAL — программой, которую часто называют первой экспертной системой и которая в любом случае стала первой, применившей ИИ к научному рассуждению. Вместо того чтобы действовать общим поиском, как прежние системы, DENDRAL использовала специализированные знания химиков: по данным масс-спектрометра она выводила структуру органических молекул. Вынесенный урок определил целое десятилетие развития ИИ: знание — это сила. Победит не самый умный общий алгоритм, а тот, кто располагает наибольшей экспертизой. Тем самым DENDRAL проложила путь к буму экспертных систем в 1980-х. Если подходить честно: DENDRAL сам по себе был успешным многолетним исследовательским проектом, а не отдельным продуктом. Однако его метод — утомительного ручного ввода всех знаний — впоследствии стал ахиллесовой пятой: он сделал коммерческие экспертные системы 1980-х годов ненадёжными и дорогостоящими, что способствовало наступлению зимы ИИ.

С середины 1960-х годов Эдвард Фейгенбаум, Джошуа Ледерберг и коллеги в Стэнфордском университете разрабатывали DENDRAL — часто называемый первой экспертной системой и первой программой, применившей ИИ к научному рассуждению.
DENDRAL выводил структуру органических молекул по данным масс-спектрометрии — используя специализированные знания химиков вместо общего поиска.
Вынесенный урок: знание — это сила. Вместо универсальных решателей задач ИИ сосредоточился на узко ограниченных, насыщенных знаниями областях — начало эпохи экспертных систем.
DENDRAL сам по себе был успешным многолетним проектом. Однако его метод — ручное кодирование знаний — стал слабым местом коммерческих экспертных систем 1980-х и способствовал зиме ИИ.

Персоны:Edward Feigenbaum, Joshua Lederberg, Bruce Buchanan

Организации:Stanford University

1965Публикации

Нечёткая логика: логика неточности

Важный математический прорыв в работе с неопределённостью и приближёнными рассуждениями. В 1965 году Лотфи Заде из Калифорнийского университета в Беркли опубликовал основополагающую статью 'Fuzzy Sets' — ответ на неспособность классической логики справляться с расплывчатой и неполной информацией. Его открытие состояло в осознании того, что люди принимают решения на основе неточных, нечисловых данных. Нечёткая логика допускает степени принадлежности от 0 до 1, в отличие от бинарной логики 'да/нет'. Сегодня работа Заде насчитывает более 100 000 цитирований и стала основой для мягких вычислений (Soft Computing) и современных подходов к ИИ. 'Точная логика неточности' позволила математически моделировать неопределённость, неполноту и противоречивую информацию. Нечёткая логика нашла применение в экспертных системах, системах управления и впоследствии в современных архитектурах ИИ для нечётких процессов принятия решений.

Статья Лотфи Заде 'Fuzzy Sets' 1965 года с более чем 100 000 цитирований существенно изменила подход к работе с неопределённостью
Обеспечила математическое моделирование неточности, неполноты и противоречивой информации
Нашла применение в экспертных системах, системах управления и приближённых процессах принятия решений
Заложила основу для мягких вычислений (Soft Computing) и современных подходов ИИ к работе с несовершенной информацией

Персоны:Lotfi Zadeh

Организации:UC Berkeley, Information and Control

1966Прорывы

ELIZA: первый чат-бот

Рождение разговора человека с машиной и непреднамеренный эксперимент в области человеческой психологии. Приблизительно с 1964 по 1966 год Джозеф Вейценбаум в MIT разработал ELIZA — первую программу, явно созданную для общения с людьми. С удивительно лаконичным кодом и простой технологией сопоставления шаблонов (Pattern Matching) ELIZA имитировала разговоры, особенно в варианте DOCTOR — в роли терапевта по методу Роджерса. Неожиданность крылась не в технологии, а в реакции людей: пользователи, включая собственную секретаршу Вейценбаума, формировали эмоциональные привязанности к программе и даже требовали конфиденциальности для своих 'сеансов терапии'. Вейценбаум рано описал и подверг критике это явление — тенденцию приписывать рудиментарным программам человеческие качества. Сам термин 'эффект ELIZA' был введён и популяризирован позже, в 1990-е годы. ELIZA доказала силу простой иллюзии и заложила основу для всех современных чат-ботов.

Первая компьютерная программа, явно разработанная для общения человека с машиной, завершена в 1966 году
Использовала простую технологию сопоставления шаблонов и подстановки — программа обходилась удивительно небольшим объёмом кода
Создавала иллюзию понимания и эмоционального интеллекта без реального понимания языка
Обнаружила то, что впоследствии назвали 'эффектом ELIZA', и предостерегла от приписывания человеческих качеств рудиментарным программам

Персоны:Joseph Weizenbaum

Организации:MIT, MIT AI Laboratory

1969Публикации

Perceptrons: книга, которая спровоцировала зиму ИИ

В 1969 году исследователи Массачусетского технологического института Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons. С математической строгостью они показали, что может, а чего не может однослойный перцептрон — простейшая форма нейронной сети. Их самый известный результат: такая сеть не способна выучить даже простую функцию XOR, потому что она не является линейно разделимой. Влияние оказалось огромным: доверие к нейронным сетям рухнуло, финансирование прекратилось более чем на десятилетие — книга стала важным фактором первой зимы ИИ. Важная оговорка: Минский и Пейперт отнюдь не опровергли нейронные сети. Они проанализировали лишь однослойный вариант; многослойные сети решают XOR без труда — что позднее, с 1986 года, стало практически применимым благодаря методу обратного распространения ошибки. Рассказ о том, что книга в одиночку уничтожила исследования, — отчасти миф. Однако резкое сокращение финансирования и внимания было вполне реальным.

В 1969 году Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons и математически проанализировали, что может, а чего не может однослойный перцептрон.
Их знаменитый результат: однослойный перцептрон не способен выучить простую функцию XOR, поскольку она не является линейно разделимой.
Книга считается одной из причин первой зимы ИИ: финансирование нейронных сетей прекратилось более чем на десятилетие.
Важная оговорка: Минский и Пейперт не опровергли нейронные сети как таковые — многослойные сети решают XOR (позднее с помощью метода обратного распространения, 1986). Утверждение, что книга в одиночку уничтожила область, отчасти является мифом; однако реальное сокращение финансирования было ощутимым.

Персоны:Marvin Minsky, Seymour Papert

Организации:MIT

1969Прорывы

Shakey: первый разумный мобильный робот

Рождение автономной робототехники через интеграцию логического мышления, планирования и физического действия. С 1966 по 1972 год команда Чарльза Розена в SRI International разрабатывала Shakey — первого мобильного робота, способного осмысливать собственные действия. Двухметровый робот объединял телекамеру, сонарный дальномер, процессоры и 'кошачьи усы' в качестве датчиков столкновения в единую автономную систему. Выдающиеся возможности Shakey включали восприятие окружающей среды, построение выводов из неявных фактов, составление планов и компенсацию ошибок — всё это управлялось с помощью естественного английского языка. Финансируемый ARPA (ныне DARPA) проект впервые объединил логическое мышление с физическим действием и заложил основы автономных систем. Разработки Shakey привели к созданию алгоритма поиска A*, методов графа видимости и влиятельного вычислительного варианта преобразования Хафа (Duda & Hart, SRI 1972). В 1970 году журнал Life Magazine назвал Shakey 'первой электронной личностью'.

Первый мобильный робот, способный осмысливать собственные действия и самостоятельно планировать сложные задачи
Объединял телекамеру, сонар, процессоры и датчики в автономную мобильную систему
Разработал систему планирования STRIPS для автоматического разбиения задач и поиска маршрутов
Объединил компьютерное зрение, навигацию и логическое мышление в единой физической системе

Персоны:Charles Rosen, Nils Nilsson, Bertram Raphael

Организации:SRI International, DARPA

1970Вехи

SHRDLU: понимание языка в мире кубиков

Около 1970 года Терри Виноград в Массачусетском технологическом институте создал программу, удивившую специалистов: SHRDLU. Ей можно было отдавать команды на простом английском — например, поставить красный куб на зелёный блок — и она выполняла их в виртуальном мире из цветных кубиков. SHRDLU понимала не только команды: она разрешала двусмысленные предложения, помнила сказанное, отвечала на вопросы о своём мире и могла даже объяснить, почему выполнила то или иное действие. Для многих это стало выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык. Важная оговорка: понимание SHRDLU работало только в её крошечном замкнутом мире кубиков. На реальный, необозримый мир с его бесконечными обыденными знаниями оно не распространялось. Со временем SHRDLU стала поучительным примером ограничений подобных микромиров — сам Виноград впоследствии отказался от этого подхода.

Около 1970 года Терри Виноград в МТИ создал SHRDLU — программу, которая понимала команды на простом английском и манипулировала виртуальным миром из кубиков.
SHRDLU умела разрешать двусмысленные предложения, помнить сказанное, отвечать на вопросы и даже объяснять, почему выполнила то или иное действие.
Она считалась выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык в ограниченном мире.
Важная оговорка: понимание SHRDLU работало только в её крошечном мире кубиков. На реальный мир оно не распространялось — поучительный пример ограничений таких микромиров.

Персоны:Terry Winograd

Организации:MIT

1970Публикации

Скрытые марковские модели получают признание

Математический фундамент для распознавания речи и моделирования последовательностей. С конца 1960-х до 1970 года Леонард Баум, Ллойд Уэлч и Тед Петри в Институте оборонных исследований (Institute for Defense Analyses) разработали скрытые марковские модели и создали алгоритм Баума-Уэлча. Эти статистические модели описывали скрытые состояния в последовательностях и предложили один из первых практически применимых подходов к выявлению латентных состояний в данных, зависящих от времени. С середины 1970-х HMM нашли первое практическое применение в распознавании речи — в работах Джеймса Бейкера в Университете Карнеги-Меллон и позднее в IBM. Метод коренным образом изменил автоматическое распознавание речи: от простых шаблонных методов (Template Matching) к статистическим подходам. HMM стали стандартом для моделирования последовательностей в многочисленных областях: от биоинформатики и финансового анализа до распознавания жестов. Алгоритм Баума-Уэлча, впоследствии признанный частным случаем алгоритма максимизации математического ожидания (Expectation-Maximization), сформулированного в общем виде в 1977 году, заложил фундамент для современных вероятностных методов машинного обучения.

Алгоритм Баума-Уэлча как частный случай Expectation-Maximization для оценки параметров HMM
Первое практическое применение в распознавании речи с середины 1970-х в Университете Карнеги-Меллон и IBM
Преобразовал моделирование последовательностей от шаблонного сопоставления к статистическим вероятностным подходам
Заложил математический фундамент для современных вероятностных методов машинного обучения

Персоны:Leonard Baum, Lloyd Welch, Ted Petrie

Организации:Institute for Defense Analyses

1972Вехи

Prolog: программирование с помощью логики

В 1972 году в Марсельском университете возник язык программирования, мысливший совершенно иначе, чем все остальные: Prolog, сокращение от Programmation en Logique. Его создатели Ален Кольмерауэр и Филипп Руссель — опираясь на теорию Роберта Ковальски — развивали захватывающую идею. Вместо того чтобы шаг за шагом указывать компьютеру, как что-то делать, в Prolog описывают лишь факты и правила некоторого мира. Логические выводы из них система делает сама. Prolog стал важнейшим языком символического ИИ: в экспертных системах, в обработке естественного языка и как основа амбициозного японского проекта пятого поколения (Fifth Generation). Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ. Масштабный японский проект, целиком построенный на Prolog, остался далеко позади своих обещаний. И прорыв обязан столько же теории Роберта Ковальски, сколько самому языку.

В 1972 году Ален Кольмерауэр и Филипп Руссель в Марсельском университете разработали язык Prolog — сокращение от Programmation en Logique.
Prolog является декларативным: описывают факты и правила, а система самостоятельно выводит логические следствия — вместо пошагового указания, как именно.
Prolog стал важнейшим языком логического, символического ИИ — в экспертных системах, обработке естественного языка и японском проекте пятого поколения.
Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ; японский проект пятого поколения, построенный на нём, не оправдал ожиданий. Важна также теория Роберта Ковальски, а не только сам язык.

Персоны:Alain Colmerauer, Philippe Roussel, Robert Kowalski

Организации:University of Aix-Marseille

1974Вехи

Первая зима ИИ

Период резких сокращений финансирования исследований и падения доверия к искусственному интеллекту. После чрезмерных обещаний 1960-х годов наступила горькая реальность: программы ИИ могли решать лишь тривиальные версии тех задач, с которыми им предстояло справляться. В Великобритании доклад Лайтхилла 1973 года стал уничижительной критикой, после чего Совет по научным исследованиям сократил финансирование нецелевых исследований в области ИИ. В США DARPA — под влиянием поправки Мэнсфилда — на несколько лет отказалась от нецелевых исследований; резкое сокращение финансирования понимания речи в 1974–1975 годах затронуло проект в Университете Карнеги — Меллона и привело к расторжению контракта на 3 миллиона долларов. Эта зима продолжалась примерно до 1980 года и преподала сообществу ИИ важный урок: реалистичные ожидания — ключ к устойчивому прогрессу.

DARPA в США и британский Совет по научным исследованиям в середине 1970-х годов резко сократили финансирование нецелевых исследований в области ИИ
Профессор Джеймс Лайтхилл в 1973 году жёстко раскритиковал исследования ИИ за недостижение поставленных целей и указал на проблему комбинаторного взрыва
DARPA расторгла контракт с Университетом Карнеги — Меллона на 3 миллиона долларов по системам понимания речи после разочаровывающих результатов
Программы ИИ начала 1970-х годов были ограничены тривиальными версиями реальных задач и воспринимались как умные 'игрушки'

Персоны:James Lighthill, J.C.R. Licklider, Hans Moravec

Организации:DARPA, British Science Research Council, Carnegie Mellon University

1980Публикации

Неокогнитрон: прародитель свёрточных нейронных сетей

В 1980 году японский исследователь Куниихико Фукусима представил нейронную сеть, намного опередившую своё время: неокогнитрон. Его образцом послужила природа — точнее, зрительная кора, которую изучали нобелевские лауреаты Хьюбел и Визел в опытах на кошках. В зрительной коре простые и сложные клетки поэтапно обрабатывают зрительные стимулы. Фукусима воспроизвёл этот принцип: многослойная сеть, распознающая признаки послойно — причём независимо от того, где именно в изображении они находятся. Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей (Convolutional Neural Networks), которые господствуют в распознавании изображений с 2012 года. Важная оговорка: неокогнитрон ещё не использовал метод обратного распространения ошибки и не мог обучаться так, как современные CNN. Лишь метод обратного распространения (1986) и LeNet Яна ЛеКуна (1989) превратили эту архитектуру в практически обучаемые сети. Первопроходческая роль Фукусимы до сих пор нередко недооценивается.

В 1980 году Куниихико Фукусима представил неокогнитрон — многослойную нейронную сеть для распознавания образов.
Образцом послужила зрительная кора (Хьюбел и Визел): простые и сложные клетки, которые поэтапно распознают признаки независимо от их положения.
Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей — локальные фильтры признаков и иерархическую обработку. LeNet ЛеКуна (1989) опирался на эти идеи.
Важная оговорка: неокогнитрон не использовал обратное распространение ошибки. Лишь метод обратного распространения (1986) и LeNet (1989) сделали из него практически обучаемые сети. Первопроходческая роль Фукусимы нередко недооценивается.

Персоны:Kunihiko Fukushima

Организации:NHK Broadcasting Science Research Laboratories

1980Вехи

Эра экспертных систем 1980-х годов

1980-е годы стали расцветом экспертных систем — временем, когда ИИ впервые достиг коммерческого успеха. Компании по всему миру внедряли эти основанные на правилах программы ИИ, воспроизводящие знания экспертов-людей в специализированных областях. Индустрия ИИ выросла с нескольких миллионов долларов в 1980 году до миллиардов в 1988-м. Две трети компаний из списка Fortune 500 использовали эту технологию. Системы вроде MYCIN достигали в исследованиях около 65% принятия своих терапевтических рекомендаций — наравне с экспертами факультетов, хотя MYCIN так и не применялась клинически. Однако бум завершился по классической схеме экономического пузыря, когда десятки компаний потерпели крах и обнаружились пределы технологии.

Индустрия ИИ выросла с нескольких миллионов долларов (1980) до миллиардов (1988)
Две трети компаний из списка Fortune 500 использовали экспертные системы в повседневной деловой практике
Терапевтические рекомендации MYCIN получали около 65% одобрения — сопоставимо с человеческими экспертами факультетов
Классическая схема экономического пузыря: подъём, за которым последовал масштабный крах

Персоны:Edward Feigenbaum, Bruce Buchanan, Edward Shortliffe

Организации:Stanford University, Fortune 500 Companies

1982Публикации

Сети Хопфилда: Ассоциативная память

Возрождение нейронных сетей благодаря ассоциативным возможностям памяти. В 1982 году Джон Хопфилд опубликовал основополагающую статью «Neural networks and physical systems with emergent collective computational abilities» в PNAS. Его инновация заключалась в связи нейробиологии и статистической физики: сети Хопфилда работают как content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов. Рекуррентная архитектура с симметричными двунаправленными связями сходится к аттракторам фиксированной точки через энергетическую функцию Ляпунова. Система «скатывается вниз» к ближайшему сохранённому воспоминанию. Работа Хопфилда возродила интерес к нейронным сетям и заложила теоретический фундамент для современных RNN. Хеббовское правило обучения позволило ассоциативное хранение паттернов — прорыв для понимания биологических и искусственных систем памяти.

Content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов
Рекуррентная архитектура с симметричными двунаправленными связями и эмерджентными коллективными свойствами
Энергетическая функция Ляпунова ведёт систему к аттракторам фиксированной точки через «скатывание вниз» к сохранённой памяти
Возродил интерес к нейронным сетям и заложил основу для развития современных RNN

Персоны:John Hopfield

Организации:California Institute of Technology, Bell Laboratories

1986Публикации

Алгоритм обратного распространения ошибки

Рождение современного машинного обучения благодаря элегантному алгоритму обучения. В октябре 1986 года Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали в журнале Nature статью 'Learning representations by back-propagating errors'. Этот алгоритм существенно изменил обучение нейронных сетей, предоставив эффективный метод корректировки весов в многослойных сетях. Метод итеративно корректирует веса связей, чтобы минимизировать разницу между фактическим и желаемым выходом. Ключевая инновация заключалась в способности обучать скрытые слои, которые автоматически распознают важные признаки задачи. Математические основы были заложены ранее — в частности, Полом Вербосом (1974) и Сеппо Линнайнмаа (1970), — однако именно эта статья сделала метод обратного распространения ошибки широко известным и убедительно продемонстрировала его эффективность. Метод обратного распространения стал рабочей лошадкой машинного обучения и сегодня лежит в основе всех современных приложений глубокого обучения.

Опубликовано в Nature 9 октября 1986 года под названием 'Learning representations by back-propagating errors'
Сделало эффективное обучение многослойных нейронных сетей посредством вычисления градиентов практически применимым и широко известным
Скрытые слои научились автоматически распознавать важные признаки — значительный прогресс по сравнению с перцептронами
Заложило математический фундамент для всех современных приложений глубокого обучения и архитектур трансформеров

Персоны:David Rumelhart, Geoffrey Hinton, Ronald Williams

Организации:University of California San Diego, Carnegie Mellon University, Nature

1987Вехи

Вторая зима ИИ

Крах рынка специализированного оборудования для ИИ и провал экспертных систем. В 1987 году рынок Lisp-машин рухнул, когда компьютеры Apple и IBM оказались дешевле и производительнее дорогостоящих ИИ-специфичных систем. Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании и негибкими для реального применения. Джек Шварц, новый руководитель IPTO, назвал экспертные системы 'умным программированием' и урезал финансирование ИИ 'глубоко и жестоко'. Упадок производителей Lisp-машин растянулся на несколько лет — лидер рынка Symbolics объявил о банкротстве лишь в 1993 году, — что привело к более длительной и глубокой зиме, чем первая в 1974 году. Эта зима продолжалась примерно до 1993 года и положила конец коммерческому ажиотажу вокруг экспертных систем и специализированного оборудования для ИИ — однако символический ИИ как направление исследований сохранился.

Рынок специализированных Lisp-машин рухнул в 1987 году, поскольку компьютеры Apple и IBM стали дешевле и производительнее
Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании, негибкими и неспособными работать с новыми данными
Джек Шварц урезал финансирование ИИ в DARPA 'глубоко и жестоко' и назвал экспертные системы 'умным программированием'
Затраты на ИИ-специфичное оборудование значительно превышали обещанные коммерческие выгоды

Персоны:Jacob T. Schwartz, Marvin Minsky, Roger Schank

Организации:DARPA, IPTO, Symbolics, Lisp Machines Inc, XCON

1987Наборы данных

Репозиторий UCI ML: библиотека наборов данных

Демократизация исследований в области машинного обучения с помощью стандартизированных эталонных наборов данных. В 1987 году аспирант UCI Дэвид Аха совместно с однокурсниками основал Репозиторий машинного обучения UCI (UCI Machine Learning Repository) как FTP-архив — коллекцию баз данных, предметных теорий и генераторов данных для эмпирического анализа алгоритмов машинного обучения. Эта инициатива устраняла критический дефицит стандартизированных общедоступных наборов данных для растущего сообщества в области машинного обучения. Репозиторий стал основным источником наборов данных для машинного обучения по всему миру и открыл студентам, преподавателям и исследователям доступ к высококачественным эталонным данным. За прошедшие годы он был процитирован десятки тысяч раз и входит в число наиболее используемых ресурсов в информатике. Сегодня репозиторий, управляемый Центром машинного обучения и интеллектуальных систем, предлагает наборы данных из здравоохранения, финансов и множества других областей. Репозиторий кардинально демократизировал образование и исследования в области машинного обучения.

Основан в 1987 году как FTP-архив Дэвидом Аха и студентами UCI для эмпирического анализа алгоритмов машинного обучения
Стал основным источником наборов данных для машинного обучения для студентов, преподавателей и исследователей по всему миру
Процитирован десятки тысяч раз — один из наиболее используемых ресурсов наборов данных в информатике
Демократизировал исследования в области машинного обучения, открыв доступ к стандартизированным высококачественным эталонным наборам данных

Персоны:David Aha, Patrick Murphy

Организации:University of California Irvine, UCI

1988Публикации

Байесовские сети: рассуждения в условиях неопределённости

Пока нейронные сети и экспертные системы соперничали за внимание, Джуда Перл в Калифорнийском университете в Лос-Анджелесе строил третий фундаментальный столп ИИ: рассуждения в условиях неопределённости. В своей книге 'Probabilistic Reasoning in Intelligent Systems' (1988) он популяризировал байесовские сети — графы, в которых узлы представляют переменные, а рёбра — их вероятностные зависимости. Вместо жёстких правил 'если — то' и произвольных весовых коэффициентов экспертных систем они позволяли аккуратно сочетать знания и неопределённость и эффективно делать выводы. Байесовские сети определили ИИ и машинное обучение в 1990-х и 2000-х годах; Перл получил премию Тьюринга в 2011 году и впоследствии обратился к каузальному выводу — вопросу о причинах, стоящих за данными. Если подходить честно: теорема Байеса сама по себе восходит к XVIII веку; вклад Перла состоял не в изобретении теории вероятностей, а в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым применительно к ИИ.

Джуда Перл (UCLA) утвердил рассуждение в условиях неопределённости как третий столп ИИ — наряду с символическим подходом и нейронными сетями.
Байесовские сети: графы из переменных (узлов) и вероятностных зависимостей (рёбер) — заменили произвольные весовые коэффициенты чётким и эффективным выводом.
Определили машинное обучение 1990-х и 2000-х; Перл получил премию Тьюринга в 2011 году и заложил основы современного каузального вывода.
Теорема Байеса восходит к XVIII веку; вклад Перла — в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым для ИИ, а не в изобретении теории вероятностей.

Персоны:Judea Pearl

Организации:UCLA

1989Публикации

Теорема об универсальной аппроксимации

Математическое доказательство теоретической мощи нейронных сетей. В 1989 году Курт Хорник, Максвелл Стинчкомб и Халберт Уайт опубликовали основополагающую статью 'Multilayer feedforward networks are universal approximators' в журнале Neural Networks. Их строгое доказательство показало: уже одного скрытого слоя с достаточным количеством нейронов хватает для сколь угодно точной аппроксимации любой борелевски измеримой функции. Эта теоретическая основа математически обосновала применение нейронных сетей и убедила исследователей в том, что достаточно большие сети способны моделировать сложные нелинейные зависимости в реальных данных. Параллельно появились схожие работы Джорджа Сайбенко и Фунахаси, использовавших различные методы. Теорема установила универсальность за счёт расширения скрытого слоя и стала теоретическим столпом для всех последующих разработок в области глубокого обучения. Хорник и соавторы создали математическую основу доверия, которая обеспечила возрождение нейронных сетей в 1990-е годы.

Строгое математическое доказательство универсальных аппроксимирующих возможностей нейронных сетей
Одного скрытого слоя с достаточным числом нейронов хватает для аппроксимации любой борелевски измеримой функции с любой точностью (параллельная работа Сайбенко показала это для непрерывных функций)
Доказывает способность к моделированию сложных нелинейных зависимостей в реальных данных
Обеспечил математическое обоснование применения нейронных сетей и теоретическую основу доверия

Персоны:Kurt Hornik, Maxwell Stinchcombe, Halbert White

Организации:University of California San Diego

1989Прорывы

Всемирная паутина: изобретение WWW

Изобретение, которое объединило мир и заложило основу для современных источников данных ИИ. 12 марта 1989 года Тим Бернерс-Ли подал в ЦЕРН предложение по 'системе управления информацией' — первоначально названной 'Mesh', а впоследствии 'World Wide Web'. Британский учёный осознал необходимость автоматизированного обмена информацией между исследователями по всему миру. К концу 1990 года он разработал три фундаментальные веб-технологии: HTML (HyperText Markup Language), HTTP (HyperText Transfer Protocol) и URI/URL. Первый веб-сервер info.cern.ch работал на компьютере NeXT вместе с первым браузером-редактором 'WorldWideWeb.app'. В 1991 году Сеть стала общедоступной. Экспоненциальный рост — примерно с 10 сайтов (1992) до нескольких сотен тысяч (1996) — создал информационную основу для последующих систем ИИ. Без Всемирной паутины не существовало бы наборов данных Common Crawl и больших языковых моделей.

Гипертекстовый проект со связанными документами, браузерами и 'горячими ссылками' — опирался на более ранние идеи гипертекста (Тед Нельсон, Memex Ваневара Буша), однако намеренно был проще, чем проект Xanadu Нельсона
Предложение по управлению информацией от 12 марта 1989 года в ЦЕРН для автоматизированного обмена научными данными
HTML, HTTP и URI/URL как фундаментальные веб-технологии, разработанные к концу 1990 года
Создал информационную инфраструктуру для последующих коллекций Common Crawl и обучения больших языковых моделей

Персоны:Tim Berners-Lee

Организации:CERN

1989Публикации

LeNet и рождение свёрточных нейронных сетей

Первое успешное практическое применение свёрточных нейронных сетей (CNN). В 1989 году Янн ЛеКун в AT&T Bell Labs впервые объединил метод обратного распространения ошибки (Backpropagation) с архитектурой CNN для распознавания рукописных символов. Эта система — впоследствии известная как прародитель семейства LeNet — распознавала рукописные почтовые индексы для Почтовой службы США (US Postal Service) с примечательной точностью: около 1% ошибок на обучающих данных и около 5% — на ранее не виденных тестовых данных; если сети разрешалось отклонять неуверенные случаи, ошибка на оставшихся цифрах снижалась примерно до 1%. Эти результаты доказали практическое превосходство CNN над традиционными подходами и заложили основу современного компьютерного зрения. Они показали, что нейронные сети — не просто теоретические конструкты, а инструмент для решения реальных бизнес-задач. Архитектура прошла несколько итераций улучшений и в 1998 году воплотилась в LeNet-5, достигшей точности 99,05% на MNIST. Эта работа заложила фундамент всех современных архитектур CNN.

Первое успешное сочетание свёрточных нейронных сетей (CNN) с обучением методом обратного распространения ошибки
Распознавала рукописные почтовые индексы для Почтовой службы США: около 5% ошибок на тестовых данных, около 1% — при возможности отклонять неуверенные случаи
Новаторская работа Янна ЛеКуна в Bell Labs утвердила CNN как практичное решение для задач компьютерного зрения
Заложила фундамент всех современных архитектур CNN — от AlexNet до современных систем компьютерного зрения

Персоны:Yann LeCun, Bernhard Boser, John Denker

Организации:AT&T Bell Labs, NIPS

1992Прорывы

TD-Gammon: обучение через игру против самого себя

Задолго до AlphaGo одна программа IBM показала, на что способно обучение с подкреплением: в 1992 году Джеральд Тесауро представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды. Примечательным был метод обучения. TD-Gammon тренировался почти исключительно за счёт сотен тысяч партий против самого себя, обучаясь по итогам игр с помощью метода временных разностей (Temporal Difference), постепенно корректирующего прогнозы. Никто не показывал ему хороших ходов. Сеть достигла почти мирового уровня и даже открыла начальные ходы, которые профессиональные игроки-люди впоследствии переняли. Важная оговорка: каким бы впечатляющим ни был этот успех, он долгое время не поддавался переносу на другие игры. Одна из причин — в кубиках: нарды являются игрой с элементом случайности, и случай сам по себе обеспечивает разнообразие при тренировках — преимущество для самоигры, которого детерминированные игры вроде шахмат или го не дают.

В 1992 году Джеральд Тесауро в IBM представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды.
Программа обучалась почти исключительно через партии против самой себя с помощью метода обучения с подкреплением Temporal Difference — без использования партий людей в качестве образца.
TD-Gammon достиг почти мирового уровня и открыл новые дебютные ходы, перенятые профессионалами, — предшественник AlphaGo почти на 25 лет раньше.
Важная оговорка: успех долгое время не поддавался переносу на другие игры. Кубики в нардах сами обеспечивают разнообразие при тренировках — преимущество для самоигры, которого шахматы или го не имеют.

Персоны:Gerald Tesauro

Организации:IBM

1992Публикации

Q-обучение: фундамент обучения с подкреплением

В 1992 году Крис Уоткинс и Питер Даян опубликовали математическое доказательство для Q-обучения (Q-learning) — алгоритма, которому предстояло существенно изменить мир ИИ. Основную идею Уоткинс разработал ещё в 1989 году в своей докторской диссертации 'Learning from Delayed Rewards' в King's College Cambridge. Q-обучение решало фундаментальную задачу: как агент может действовать оптимально, не нуждаясь в модели своей среды? Ответ был элегантным — через последовательную оптимизацию Q-функции, которая присваивает значение каждой паре состояние-действие. Доказательство сходимости 1992 года показало: при бесконечном исследовании Q-обучение гарантированно находит оптимальную стратегию для любой конечной задачи Маркова (Markov Decision Problem). Этот безмодельный метод стал краеугольным камнем современного обучения с подкреплением. От робототехники до финансовых рынков, от игр до автономных систем — Q-обучение применяется повсеместно. В конце 2013 года DeepMind представил глубокий вариант — Deep Q-Networks (DQN) (публикация в Nature в 2015 году), достигнув при этом на большинстве игр Atari уровня или превысив уровень человека. По сей день Q-обучение — прежде всего в форме Deep Q-Network — является одним из основных строительных блоков многочисленных систем ИИ.

1992 год, математическое доказательство сходимости: Q-обучение гарантированно находит оптимальные стратегии при бесконечном исследовании
Новаторский безмодельный подход: обучение оптимальным действиям без модели среды и вероятностей переходов
Элегантное решение задач принятия решений Маркова через последовательную оптимизацию Q-функции
Краеугольный камень современного обучения с подкреплением — по сей день ядро Deep Q-Networks и многочисленных систем ИИ

Персоны:Chris Watkins, Peter Dayan

Организации:King's College Cambridge, University College London

1993Наборы данных

Penn Treebank: синтаксическая разметка меняет NLP

Создание фундаментального корпуса для современных исследований в области синтаксического разбора. В 1993 году Митчелл Маркус, Беатрис Санторини и Мэри Энн Марцинкевич опубликовали основополагающую статью 'Building a Large Annotated Corpus of English: The Penn Treebank' в журнале Computational Linguistics. Более 4,5 миллиона слов американского английского, размеченных частями речи, и около 3 миллионов из них — с детальной синтаксической (скелетной) разметкой: Penn Treebank существенно изменил компьютерную лингвистику. Двухэтапный метод сочетал автоматическую POS-разметку с ручной корректурой, обеспечивая исключительное качество аннотации. За всё время проекта — около семи лет (1989–1996) — и в расширенном Penn Treebank II в общей сложности были созданы 7 миллионов слов с POS-разметкой, 3 миллиона текстов со скелетным разбором и 2 миллиона структур предикат-аргумент. Penn Treebank утвердил эмпирические методы в компьютерной лингвистике и стал основой современных алгоритмов синтаксического разбора. По сей день Penn Treebank служит современным NLP-системам важным эталоном для оценки синтаксического разбора и языкового моделирования.

4,5+ миллиона слов с разметкой частей речи, из них около 3 миллионов с детальной синтаксической разметкой — с помощью двухэтапного полуавтоматического метода
Утвердил эмпирические методы в компьютерной лингвистике и стал стандартным эталоном для исследований синтаксического разбора
Существенно изменил алгоритмы синтаксического разбора: от основанных на правилах к статистическим подходам
Заложил основы статистического синтаксического разбора и служит современным NLP-системам эталоном для оценки

Персоны:Mitchell Marcus, Beatrice Santorini, Mary Ann Marcinkiewicz

Организации:University of Pennsylvania, Linguistic Data Consortium

1995Публикации

AdaBoost: слабые обучающиеся становятся сильными

В 1995 году Йоав Фройнд и Роберт Шапир разработали AdaBoost (Adaptive Boosting) — алгоритм, существенно изменивший машинное обучение. Их ключевая идея: объединить множество 'слабых обучающихся' в высокоточную модель предсказания. Слабый обучающийся лишь немного лучше случайного угадывания — но сотни таких вместе способны достигать впечатляющих результатов. AdaBoost адаптируется: неверные предсказания на следующем шаге получают больший вес. Так система автоматически фокусируется на трудных случаях. Теоретическая элегантность подкупала — Фройнд и Шапир доказали, что ошибка на обучающей выборке убывает экспоненциально быстро, пока каждый слабый обучающийся лучше случайного. В 2003 году они получили за это обоснование теории бустинга Премию Гёделя — одну из самых престижных наград в теоретической информатике. AdaBoost нашёл практическое применение в биологии, компьютерном зрении и распознавании речи. Метод заложил фундамент для современных ансамблевых методов и вдохновил целое поколение алгоритмов бустинга вплоть до XGBoost.

Адаптивное взвешивание: трудные случаи получают больший вес для сфокусированного обучения на проблемных местах
Принцип слабых обучающихся: сотни простых классификаторов вместе дают высокоточные предсказания
Премия Гёделя 2003: одна из самых престижных наград теоретической информатики за обоснование теории бустинга
Фундамент современных ансамблевых методов: вдохновил XGBoost и целое поколение алгоритмов бустинга

Персоны:Yoav Freund, Robert Schapire

Организации:AT&T Bell Laboratories

1995Публикации

Метод опорных векторов: классификация с максимальным зазором

Утверждение элегантного геометрического подхода к надёжной классификации. В 1995 году Коринна Кортес и Владимир Вапник опубликовали в AT&T Bell Labs основополагающую статью 'Support-Vector Networks' в журнале Machine Learning. Метод опорных векторов (SVM) расширил ранний подход Вапника и Червоненкиса к максимальному зазору 1964 года ('Обобщённый портрет') до практического решения для неразделимых обучающих данных благодаря нововведению 'мягкого зазора' (Soft Margin). Ключевой принцип состоит в построении линейных решающих поверхностей в многомерных пространствах признаков с помощью нелинейных преобразований входных данных. Ядерный трюк (Kernel Trick) 1992 года позволил эффективно выполнять вычисления без явного преобразования. Методы опорных векторов максимизируют зазор между классами и тем самым обеспечивают высокую способность к обобщению. Набрав десятки тысяч цитирований, статья стала одной из наиболее цитируемых в области машинного обучения и доминировала в задачах классификации вплоть до революции глубокого обучения. Методы опорных векторов по-прежнему остаются надёжными, интерпретируемыми и эффективными для высокоразмерных задач.

Подход Вапника и Червоненкиса к максимальному зазору 1964 года расширен до практического решения для неразделимых данных
Ядерный трюк (Kernel Trick) обеспечивает нелинейную классификацию через неявные многомерные преобразования
Принцип максимального зазора максимизирует расстояние между классами для оптимального обобщения
Утвердил теоретически обоснованную альтернативу нейронным сетям с гарантиями обобщаемости

Персоны:Vladimir Vapnik, Corinna Cortes

Организации:AT&T Bell Labs

1995Наборы данных

WordNet: семантическая сеть языка

Первый лексический словарь для вычислительной лингвистики, построенный как семантическая сеть. В ноябре 1995 года Джордж Миллер опубликовал основополагающую статью 'WordNet: A Lexical Database for English' в журнале Communications of the ACM, представив идею, которую разрабатывал с 1986 года. WordNet организует английские существительные, глаголы, прилагательные и наречия в синсеты (synsets) — когнитивные группы синонимов, связанные семантическими и лексическими отношениями. Эта структура отражает семантическую память человека и позволяет перемещаться по сети слов и понятий, связанных по смыслу. Машиночитаемые словари существовали и прежде, однако WordNet стал первым, где словарный запас последовательно моделировался как сеть синсетов и отношений значений, соединяя традиционную лексикографическую информацию с современной обработкой данных. Разработка началась в 1986 году под руководством Миллера и его команды в Принстонском университете; WordNet стал основой для иерархий ImageNet и современных систем обработки естественного языка. Структура семантической сети повлияла на все последующие графы знаний и техники встраивания.

Первый лексический словарь, построенный как семантическая сеть из синсетов и отношений значений, с программным доступом
Синсеты, связанные семантическими и лексическими отношениями, образуют навигируемую сеть значений
Отражает семантическую память человека и связывает когнитивную науку с вычислительной лингвистикой
Заложил основу для иерархий ImageNet, графов знаний и современных семантических систем обработки естественного языка

Персоны:George Miller, Christiane Fellbaum

Организации:Princeton University, Cognitive Science Laboratory

1996Публикации

PageRank: алгоритм Google ценой в миллиарды

В 1996 году двое аспирантов Стэнфорда разработали алгоритм, которому предстояло существенно изменить интернет. Ларри Пейдж и Сергей Брин запустили проект 'BackRub', основанный на оригинальной идее: важность веб-страницы определяется не только её содержанием, но и ссылками, которые на неё указывают. Как при научном цитировании: чем чаще на страницу ссылаются, тем она важнее. Алгоритм PageRank моделирует 'случайного сёрфера', который случайным образом переходит по ссылкам в интернете. Чем чаще случайный сёрфер попадает на страницу через структуру ссылок, тем выше её значимость. Веб-краулер Пейджа стартовал в марте 1996 года с его собственной стэнфордской домашней страницы. Формальная публикация статьи по PageRank состоялась в январе 1998 года в виде технического отчёта Стэнфорда. К августу 1996 года BackRub уже обнаружил около 75 миллионов URL — адресов, найденных по ссылкам, из которых лишь часть была реально обойдена краулером. Даже ранний стэнфордский прототип давал более релевантные результаты, чем современные поисковые сервисы — Excite или Yahoo!. Стэнфорд получил патент и продал свои 1,8 миллиона акций Google в 2005 году за 336 миллионов долларов. Из университетского проекта выросла одна из самых успешных поисковых систем — и основа современного веб-ИИ.

Стэнфордский проект 'BackRub' анализировал данные обратных ссылок для определения веб-значимости — основа для Google
Новаторский анализ ссылок: важность веб-страниц по ссылкам, а не только по частоте ключевых слов
Модель случайного сёрфера: страница тем важнее, чем чаще случайный сёрфер попадает на неё через структуру ссылок
Из стэнфордских исследований выросла Google Inc. — PageRank как фундамент самой ценной поисковой системы

Персоны:Larry Page, Sergey Brin, Rajeev Motwani, Terry Winograd

Организации:Stanford University, Google Inc.

1997Соревнования

Deep Blue побеждает Каспарова

Первая победа машины над действующим чемпионом мира по шахматам в условиях турнира. 11 мая 1997 года Deep Blue вошёл в историю: суперкомпьютер IBM победил Гарри Каспарова в матче-реванше в Нью-Йорке со счётом 3,5:2,5. После поражения 1996 года IBM кардинально переработала систему: новые шахматные чипы удвоили скорость до 200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров повысили игровую силу. Решающая шестая партия длилась всего один час — после жертвы коня Каспаров быстро оказался в объективно проигранной позиции и сдался уже на 19-м ходу, что стало беспрецедентным моментом в его карьере. Победа впервые продемонстрировала превосходство компьютеров в сложном стратегическом мышлении и стала поворотным моментом в общественном восприятии ИИ. Призовой фонд в 700 000 долларов для Deep Blue подчеркнул историческое значение этого триумфа машинного интеллекта.

Первая победа компьютера над действующим чемпионом мира по шахматам в матче в стандартных турнирных условиях (одну отдельную партию Deep Blue уже выигрывал в 1996 году)
200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров
Технический триумф IBM после многолетней разработки начиная с ChipTest 1985 — через Deep Thought к Deep Blue
Поворотный момент в общественном восприятии ИИ и доказательство машинного превосходства в сложном стратегическом мышлении

Персоны:Garry Kasparov, Murray Campbell, Joe Hoane, Feng-hsiung Hsu

Организации:IBM, World Chess Championship

1997Публикации

LSTM: Долгая краткосрочная память

Решение проблемы затухающего градиента и рождение эффективного моделирования последовательностей. 15 ноября 1997 года Сепп Хохрайтер и Юрген Шмидхубер опубликовали основополагающую статью «Long Short-Term Memory» в Neural Computation. Их инновация решила фундаментальную проблему рекуррентных сетей: исчезновение градиентов на длинных последовательностях. LSTM ввёл специальные ячейки памяти с механизмами гейтов, обеспечивающими константный поток ошибки через тысячи временных шагов. Мультипликативные гейты учатся открывать и закрывать доступ к константной карусели ошибок. С O(1)-сложностью на временной шаг и локальным обучением LSTM значительно превзошёл все существовавшие тогда RNN-методы. Система впервые решила сложные проблемы с долгими временными задержками, которые ранее были нерешаемы. LSTM стал основой для современного распознавания речи, перевода и анализа временных рядов.

Решил проблему затухающего градиента через константный поток ошибки через тысячи временных шагов
Специальные ячейки памяти с константными каруселями ошибок для долгосрочного хранения информации
Мультипликативные Gate-Units учатся открывать и закрывать доступ к константному потоку ошибки
Сделал возможным эффективное моделирование долгосрочных последовательностей для распознавания речи и анализа временных рядов

Персоны:Sepp Hochreiter, Jürgen Schmidhuber

Организации:Technical University of Munich, IDSIA

1998Наборы данных

MNIST: стандарт машинного обучения

Создание одного из важнейших эталонных наборов данных для начинающих в области компьютерного зрения. В 1998 году Янн ЛеКун, Коринна Кортес и Кристофер Бёрджес представили набор данных MNIST — курированную коллекцию рукописных цифр, ставшую 'Hello World' машинного обучения. Основанный на Special Database 3 и Special Database 1 от NIST, MNIST содержит 70 000 нормализованных изображений размером 28x28 пикселей в оттенках серого: 60 000 для обучения и 10 000 для тестирования. Тщательная предобработка и сглаживание сделали MNIST идеальным для учебных целей без трудоёмкой подготовки данных. MNIST появился в статье 'Gradient-based learning applied to document recognition' (Proceedings of the IEEE, ноябрь 1998). Набор данных стал стандартным эталоном для бесчисленных алгоритмов машинного обучения и позволил целым поколениям студентов получить первые результаты в области компьютерного зрения. MNIST демократизировал образование в сфере машинного обучения по всему миру.

70 000 рукописных цифр в виде нормализованных изображений 28x28 пикселей в оттенках серого
Составлен Янном ЛеКуном, Коринной Кортес и Кристофером Бёрджесом на основе баз данных NIST
Стал 'Hello World' машинного обучения и стандартным эталоном для алгоритмов МО
Демократизировал образование в сфере МО благодаря простому доступу без трудоёмкой подготовки данных

Персоны:Yann LeCun, Corinna Cortes, Christopher Burges

Организации:AT&T Labs, Courant Institute

2001Публикации

Случайный лес: прорыв в ансамблевых методах

В 2001 году Лео Брейман из Калифорнийского университета в Беркли опубликовал одну из наиболее цитируемых статей по машинному обучению за всё время — 'Random Forests'. Его алгоритм существенно изменил концепцию ансамблевых методов и стал одним из важнейших инструментов современной статистики. Базовая идея была гениально проста: вместо одного дерева решений обучают сотни случайных деревьев и дают им проголосовать. Каждое дерево видит лишь случайное подмножество данных и признаков — 'бэггинг' (bagging) в сочетании с рандомизацией признаков. Результат: резкое снижение проблем переобучения (overfitting) и исключительная точность предсказаний. Брейман также предоставил теоретическую основу — границы ошибки обобщения, основанные на силе дерева и корреляции. Случайный лес стал одним из самых не требующих обслуживания алгоритмов машинного обучения типа 'подключи и работай': минимальная настройка, максимальная производительность. От биоинформатики до анализа финансовых рынков случайный лес по сей день доминирует в бесчисленных приложениях и сделал ансамблевые методы стандартным инструментом — параллельно с направлением бустинга (boosting), из которого впоследствии вырос XGBoost.

Прорыв в ансамблевых методах: сотни случайных деревьев решений совместно голосуют для получения более точных предсказаний
Бэггинг (bagging) + рандомизация признаков: каждое дерево видит разные данные и признаки для обеспечения разнообразия
Теоретическое обоснование: границы ошибки обобщения на основе силы дерева и корреляции
Алгоритм машинного обучения типа 'подключи и работай': минимальная настройка при исключительной производительности во всех областях

Персоны:Leo Breiman, Adele Cutler

Организации:UC Berkeley Statistics Department, Machine Learning Journal

2005Организации

Основание Future of Humanity Institute

Институционализация исследований безопасности ИИ и оценки экзистенциальных рисков. В 2005 году Ник Бостром основал Future of Humanity Institute в Оксфордском университете как мультидисциплинарную исследовательскую группу. Начав всего с трёх исследователей, FHI превратился в интеллектуальный центр притяжения для блестящих, нередко эксцентричных мыслителей и вырос примерно до 40 сотрудников. Институт создал новые исследовательские области: экзистенциальные риски, выравнивание ИИ (AI Alignment), управление ИИ (AI Governance) и долгосрочное мышление (Longtermism). Ранние публикации Бострома, такие как 'The fable of the dragon tyrant' (2005) и 'What is a singleton?' (2006), сформировали подходы к безопасности ИИ. Несмотря на относительно короткие 19 лет существования вплоть до закрытия в 2024 году, FHI внёс значительный вклад и создал новый способ мышления о ключевых вопросах человечества. Академическая легитимизация исследований безопасности ИИ через Оксфорд придала этой области научный авторитет.

В 2005 году основан в Оксфордском университете, вырос с 3 до примерно 40 исследователей к закрытию в 2024 году
Первопроходец в области экзистенциальных рисков, долгосрочного мышления (Longtermism) и управления ИИ (AI Governance) как новых исследовательских направлений
Утвердил выравнивание ИИ (AI Alignment) и безопасность ИИ (AI Safety) как легитимные академические дисциплины с глобальным влиянием
Придал исследованиям безопасности ИИ научный авторитет и уважение благодаря принадлежности к Оксфорду

Персоны:Nick Bostrom, Anders Sandberg

Организации:Oxford University, Future of Humanity Institute

2005Соревнования

DARPA Grand Challenge: рождение автономного вождения

8 октября 2005 года синий Volkswagen Touareg по имени 'Stanley' вошёл в историю. Под руководством Себастьяна Труна команда Stanford Racing Team выиграла DARPA Grand Challenge — первое в мире успешное соревнование автономных транспортных средств. После того как в 2004 году все участники потерпели неудачу (лучший результат: 7,4 мили, то есть 11,9 км), Stanley прошёл весь маршрут длиной 212 км по пустыне за 6 часов 53 минуты. Финишную черту пересекли пять машин, четыре из них — в рамках временного лимита; это был разительный прогресс по сравнению с нулём в предыдущем году. Stanley преодолел три узких тоннеля, более 100 крутых поворотов и опасный Beer Bottle Pass с его обрывами. Новаторство состояло в программном обеспечении, а не в аппаратной части: сенсоры LiDAR, машинное обучение и журнал решений человека-водителя дали Stanley возможности, которых прежде не было ни у одного робота. Призовые 2 миллиона долларов стали лишь началом — Stanley заложил основу для Tesla Autopilot, Google Waymo и всей индустрии автономных транспортных средств. Сегодня Stanley хранится в Смитсоновском музее.

'Stanley' Стэнфорда стал первым автономным транспортным средством, прошедшим маршрут по пустыне длиной 212 км менее чем за 7 часов
Прорыв от нуля успешных транспортных средств (2004) до пяти финишировавших (2005), четыре из которых уложились в лимит времени, — благодаря улучшенному ИИ
Определён как соревнование программного обеспечения: LiDAR, машинное обучение и данные о решениях человека-водителя — ключевые факторы успеха
Момент рождения современных технологий автономного вождения — вдохновил Tesla, Google и целую индустрию

Персоны:Sebastian Thrun, Mike Montemerlo, Stanley Thrun Team

Организации:DARPA, Stanford University, Stanford AI Lab

2006Публикации

Сети глубокого доверия: ренессанс глубокого обучения

В 2006 году Джеффри Хинтон изменил мир ИИ своей важной статьёй о сетях глубокого доверия (Deep Belief Networks). После многолетнего затишья в области нейронных сетей он показал, как можно эффективно обучать глубокие нейронные сети. Его инновация: послойное предобучение (Pre-Training) с помощью ограниченных машин Больцмана (Restricted Boltzmann Machines, RBM). Эта 'жадная' стратегия обучения решила проблему инициализации весов и сделала глубокое обучение (Deep Learning) практически применимым. Метод складывает RBM поверх друг друга и обучает каждый слой отдельно, после чего вся сеть дорабатывается в целом. Работа Хинтона положила конец многолетнему забвению нейронных сетей и открыла эпоху их возрождения. Уже в 2009 году DBN значительно снизили частоту ошибок в распознавании речи. В 2012 году команда Хинтона победила на соревновании ImageNet Challenge (ILSVRC) с AlexNet — глубокой свёрточной нейронной сетью, обученной с использованием GPU, ReLU и Dropout, которая уже не зависела от RBM-предобучения DBN. AlexNet достигла частоты ошибок top-5 на уровне 15,3% против 26,2% у второй команды — значительное улучшение. Этот момент знаменует возрождение нейронных сетей и начало нынешнего подъёма ИИ.

Жадный послойный алгоритм обучения впервые позволил эффективно обучать глубокие нейронные сети
Складывание ограниченных машин Больцмана (RBM) как строительных блоков для сложных представлений
Неконтролируемое предобучение решило проблему инициализации весов в глубоких сетях
Положило конец забвению нейронных сетей и дало начало современному подъёму глубокого обучения (Deep Learning) с 2006 года

Персоны:Geoffrey Hinton, Simon Osindero, Yee-Whye Teh

Организации:University of Toronto, Neural Computation

2006Соревнования

Приз Netflix: алгоритм за миллион долларов

Демократизация машинного обучения посредством краудсорсингового конкурса беспрецедентного масштаба — с открытым набором данных и призовым фондом в один миллион долларов. 2 октября 2006 года Netflix запустил этот конкурс с призом в миллион долларов: кто улучшит алгоритм рекомендаций Cinematch на 10 %? Предоставив более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов, Netflix создал один из крупнейших общедоступных наборов данных для машинного обучения. Зарегистрировалось более 40 000 команд из 186 стран, из которых более 5 000 попали в квалификационную таблицу лидеров и в совокупности подали около 44 000 допустимых решений. Когда 26 июня 2009 года команда 'BellKors Pragmatic Chaos' первой преодолела отметку в 10 %, это запустило 30-дневный финальный этап, завершившийся 26 июля 2009 года; официально победитель с улучшением на 10,06 % был объявлен на церемонии награждения 21 сентября 2009 года. Рецепт успеха: ансамблевое сочетание матричной факторизации и ограниченных машин Больцмана. Конкурс существенно изменил коллаборативную фильтрацию и продемонстрировал мощь краудсорсинга для решения сложных задач машинного обучения. Несмотря на то что Netflix так и не внедрил алгоритмы победителей в производство (слишком высокие затраты на реализацию), конкурс оказал долгосрочное влияние на современную индустрию рекомендательных систем.

Призовой фонд 1 миллион долларов за улучшение алгоритма Cinematch на 10 % в ходе трёхлетнего конкурса
Более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов в качестве общедоступного набора данных для МО
Существенно изменил коллаборативную фильтрацию благодаря матричной факторизации и ограниченным машинам Больцмана
Более 40 000 команд из 186 стран, свыше 5 000 в квалификационной таблице лидеров с около 44 000 заявками — мощь краудсорсинга для МО

Персоны:Reed Hastings, Netflix Team, BellKor Pragmatic Chaos Team

Организации:Netflix, BellKor, AT&T Research

2007Наборы данных

Основан фонд Common Crawl

Демократизация интернета как обучающих данных для искусственного интеллекта. В 2007 году Гил Эльбаз основал фонд Common Crawl с миссией: архивировать весь публичный интернет и делать его свободно доступным. С 2008 года начался систематический сбор данных (краулинг), и с тех пор корпус растёт на миллиарды страниц ежемесячно, достигнув к 2024 году порядка более 100 миллиардов веб-страниц и нескольких петабайт данных. Эта коллекция стала важнейшим источником обучающих данных для больших языковых моделей (Large Language Models) и обеспечила разработку GPT-3, ChatGPT, LLaMA и других современных систем ИИ. Common Crawl отличается от коммерческих подходов своей некоммерческой природой и открытой доступностью. Необработанные исходные данные требуют последующей обработки, однако фонд демократизировал доступ к обширным языковым данным и сделал ИИ-исследования менее зависимыми от проприетарных наборов данных.

Основан в 2007 году с миссией архивировать весь публичный интернет и делать его свободно доступным
С начала краулинга в 2008 года ежемесячно растёт на миллиарды страниц — к 2024 году: более 100 миллиардов веб-страниц и несколько петабайт данных
Стал важнейшим источником обучающих данных для GPT-3, ChatGPT, LLaMA и других современных больших языковых моделей
Некоммерческий подход демократизировал доступ к обширным языковым данным для ИИ-исследований по всему миру

Персоны:Gil Elbaz, Common Crawl Team

Организации:Common Crawl Foundation, Internet Archive, Alexa Internet

2007Вехи

CUDA: видеокарта становится двигателем ИИ

Революция ИИ 2012 года работала не только на алгоритмах — она работала на видеокартах. Почву для этого подготовила NVIDIA в 2007 году с CUDA: платформой, позволявшей запускать обычные программы на языке, подобном C, прямо на GPU — а не только графику. Анонсированная с чипом G80 в конце 2006 года, в феврале 2007 вышедшая в публичную бету и выпущенная в виде версии 1.0 в июне 2007 года, CUDA впервые открыла широкий доступ к огромному параллелизму графических процессоров. Это прекрасно сочетается с нейронными сетями, вычисления в которых сводятся к матричным умножениям — тысячи мелких операций одновременно. Пять лет спустя Крижевский, Суцкевер и Хинтон обучили AlexNet на двух картах NVIDIA GTX 580 с CUDA — прорыв, зажёгший глубокое обучение. С 2014 года cuDNN от NVIDIA поставлял оптимизированные строительные блоки, на которых сегодня работают TensorFlow, PyTorch и другие фреймворки. Если подходить честно: CUDA не изобрела GPGPU (программируемые шейдеры появились в 2001 году, BrookGPU — в 2004-м) и не стала единственной причиной глубокого обучения — но она сделала необходимые вычислительные мощности доступными, а без них ничего остального просто не было бы.

CUDA (2007, NVIDIA; авторы Иэн Бак — из проекта BrookGPU — и Джон Никколлс) позволяет запускать обычные программы на языке, подобном C, прямо на GPU — не только графику.
GPU выполняют тысячи операций параллельно. Это точно соответствует нейронным сетям, ядром которых являются матричные умножения.
Стала двигателем глубокого обучения: AlexNet (2012) обучалась на двух картах GTX 580 с CUDA; с cuDNN (2014) на ней работает практически каждый крупный фреймворк.
GPGPU существовала до CUDA (шейдеры 2001, BrookGPU 2004); CUDA не была единственной причиной глубокого обучения — она сделала вычислительные мощности доступными (необходимое, но не достаточное условие).

Персоны:Ian Buck, John Nickolls

Организации:NVIDIA

2008Публикации

Обучение с нулевым числом примеров: обучение без данных

Формализация обучения на невиданных ранее классах посредством семантических описаний. В июле 2008 года Хьюго Ларошель, Думитру Эрхан и Йошуа Бенжио представили на конференции AAAI работу 'Zero-data Learning of New Tasks', заложив теоретическую предварительную формализацию. Само название 'Zero-Shot Learning' закрепили в 2009 году две другие группы исследователей: Палатуччи с коллегами в статье 'Zero-Shot Learning with Semantic Output Codes' на конференции NIPS 2009 и Лямперт с коллегами, предложивший основанный на атрибутах подход на конференции CVPR 2009. Фундаментальная проблема: как модель может классифицировать классы, для которых отсутствуют обучающие данные, а есть только описания? Решение состояло в семантических векторных представлениях (embedding) и переносе обучения — повторном использовании обученных моделей для новых задач. Формализация Ларошеля была направлена на очень большие наборы классов, которые не могут быть полностью охвачены обучающими данными. Экспериментальный анализ подтвердил значительные способности к обобщению в этом контексте. Эта работа заложила концептуальный фундамент для современных возможностей Few-Shot и Zero-Shot в GPT-3, GPT-4 и других больших языковых моделях. Обучение с нулевым числом примеров стало ключевой технологией для масштабируемых систем ИИ.

Классификация классов без обучающих данных — только по семантическим описаниям целевых классов
Повторное использование обученных моделей для принципиально новых задач посредством семантических векторных представлений
Семантические представления позволяют обобщать знания на невиданные ранее концепты
Заложил фундамент для возможностей Few-Shot и Zero-Shot в современных больших языковых моделях

Персоны:Hugo Larochelle, Dumitru Erhan, Yoshua Bengio

Организации:University of Montreal

2009Наборы данных

Создание датасетов CIFAR

Создание фундаментального бенчмарка для компьютерного зрения. В 2009 году Алекс Крижевский, Винод Наир и Джеффри Хинтон в Университете Торонто разработали датасеты CIFAR-10 и CIFAR-100. Они были созданы как размеченные подмножества из 80-миллионного датасета изображений «Tiny Images». CIFAR-10 содержит 60 000 цветных изображений 32x32 пикселя в десяти категориях: самолёты, автомобили, животные и другие, а CIFAR-100 распределяет то же количество изображений по ста более детальным классам. Датасеты стали одним из важнейших бенчмарков в исследованиях компьютерного зрения и позволили стандартизировать сравнение различных алгоритмов. Примечательна связь с AlexNet: Крижевский использовал CIFAR-10 ещё до 2011 года для обучения небольших CNN на одиночных GPU — предшественник его позднейшего успеха ImageNet в 2012 году.

CIFAR-10 с 60 000 изображений в 10 категориях, CIFAR-100 со 100 более детальными классами как бенчмарки компьютерного зрения
Стал одним из важнейших стандартизированных бенчмарков для алгоритмов компьютерного зрения во всём мире
Позволил систематическую оценку и сравнение различных подходов машинного обучения
Крижевский использовал CIFAR-10 до 2011 года для обучения CNN — предвестник его успеха AlexNet в 2012 году

Персоны:Alex Krizhevsky, Vinod Nair, Geoffrey Hinton

Организации:University of Toronto, Canadian Institute for Advanced Research, CIFAR

2009Наборы данных

ImageNet: набор данных, изменивший всё

Создание набора данных, который открыл путь к развитию глубокого обучения. В 2009 году Фэй-Фэй Ли вместе со своей командой представила статью по ImageNet и продемонстрировала визуальную базу данных, призванную преобразовать компьютерное зрение. На момент запуска она насчитывала около 3,2 миллиона изображений с ручной разметкой примерно в 5 200 категориях. В полном объёме ImageNet впоследствии охватил более 14 миллионов изображений с ручными аннотациями и около 22 000 категорий, основанных на иерархиях WordNet, — тем самым устраняя критическое узкое место: нехватку больших, высококачественных обучающих данных. Разметку выполняли около 49 000 работников из 167 стран через Amazon Mechanical Turk — проект беспрецедентного масштаба. То, что начиналось как постер в углу конференц-зала в Майами-Бич, переросло в ежегодный ImageNet Challenge (ILSVRC) и стало одним из трёх движущих факторов развития современного ИИ. ImageNet открыл путь к прорыву AlexNet в 2012 году и заложил фундамент для автономных транспортных средств, распознавания лиц и медицинской визуализации.

На момент запуска в 2009 году — около 3,2 миллиона изображений, в полном объёме — более 14 миллионов изображений с ручной разметкой примерно в 22 000 категориях, созданных около 49 000 работниками из 167 стран
Основан на иерархиях WordNet для структурированной классификации визуальных объектов
Предоставил критически важные обучающие данные для прорыва AlexNet в 2012 году и развития глубокого обучения
Преобразовал исследования в области компьютерного зрения и открыл возможности для автономных транспортных средств, распознавания лиц и медицинской визуализации

Персоны:Fei-Fei Li, Jia Deng, Wei Dong, Richard Socher

Организации:Stanford University, Princeton University

2010Вехи

Основание DeepMind

Рождение лаборатории ИИ, которой предстояло делать заголовки новостей. В сентябре 2010 года Демис Хассабис, Шейн Легг и Мустафа Сулейман основали в Лондоне DeepMind Technologies. Их цель: разработать общий искусственный интеллект, объединив знания из нейронауки и машинного обучения. Хассабис, бывший вундеркинд в шахматах и разработчик игр, принёс уникальное видение: ИИ должен учиться подобно человеческому мозгу. В 2014 году Google приобрела стартап примерно за 500 миллионов долларов — одно из крупнейших приобретений в области ИИ в истории. Впоследствии DeepMind поразит мир прорывами AlphaGo, AlphaFold и другими достижениями.

Основана в сентябре 2010 года в Лондоне как DeepMind Technologies
Демис Хассабис (нейроучёный, разработчик игр), Шейн Легг и Мустафа Сулейман
Приобретена Google в 2014 году примерно за 500 миллионов долларов
Позже создала AlphaGo, AlphaFold и другие прорывные ИИ-системы

Персоны:Demis Hassabis, Shane Legg, Mustafa Suleyman

Организации:DeepMind, Google

2010Соревнования

ImageNet Challenge: начало соревнования

Учреждение важнейшего эталона компьютерного зрения в истории ИИ. В 2010 году стартовал первый ImageNet Large Scale Visual Recognition Challenge (ILSVRC) — стандартизированное соревнование, которое определило направление исследований компьютерного зрения на следующее десятилетие. С 1 000 категориями объектов и 1,2 миллиона обучающих изображений этот конкурс значительно превзошёл доступные на тот момент эталоны, например PASCAL VOC, располагавший лишь 20 классами. Оценка проводилась по метрикам Top-1 и Top-5 ошибок — стандартам, актуальным и по сей день. С 2010 по 2017 год точность Top-5 у победителей существенно выросла: с 71,8 % до 97,3 %, в конечном счёте превысив уровень человека. Ежегодный конкурс привлёк более 50 организаций со всего мира и катализировал достижения, кульминацией которых в 2012 году стал значительный прорыв AlexNet — уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности).

Первый ILSVRC в 2010 году: 1 000 категорий и 1,2 миллиона обучающих изображений — значительно больше, чем у PASCAL VOC
Утвердил метрики Top-1 и Top-5 ошибок как стандарты оценки компьютерного зрения
Ежегодный конкурс с 2010 года привлёк более 50 организаций по всему миру и стимулировал развитие исследований
Создал конкурсную структуру, которая в 2012 году открыла путь к прорыву AlexNet: уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности)

Персоны:Fei-Fei Li, Olga Russakovsky, Alexander Berg

Организации:Stanford University, ImageNet Team

2011Соревнования

Watson побеждает чемпионов Jeopardy

Триумф IBM в обработке естественного языка и доказательство машинного понимания речи. 16 февраля 2011 года система IBM Watson в телевизионном шоу Jeopardy! победила двух самых успешных чемпионов за всю историю: Кена Дженнингса (74 победы подряд) и Брэда Раттера (3,25 миллиона долларов выигрышей до 2005 года). Watson, разработанный командой DeepQA под руководством Дэвида Феруччи, состоял из 90 серверов IBM Power 750 (в 10 стойках) с 16 терабайтами оперативной памяти и 2 880 процессорными ядрами POWER7. Новаторство заключалось в обработке естественного языка: Watson понимал вопросы на обычном языке и отвечал точнее любой стандартной поисковой технологии — без подключения к интернету. Выиграв 77 147 долларов (пожертвованных на благотворительность), Watson обошёл своих соперников-людей более чем на 50 000 долларов. Знаменитая заключительная реплика Кена Дженнингса — 'I for one welcome our new computer overlords' — подчеркнула историческое значение этого рубежа в области обработки естественного языка.

Победил легенд Jeopardy Кена Дженнингса и Брэда Раттера в телевизионном состязании
Первая телевизионная демонстрация развитых возможностей обработки естественного языка для миллионов зрителей
Система DeepQA объединила поиск по базе знаний со сложным логическим выводом без подключения к интернету
Комментарий Кена Дженнингса про 'computer overlords' подчеркнул культурное значение прогресса в области ИИ

Персоны:David Ferrucci, Ken Jennings, Brad Rutter

Организации:IBM Research, Jeopardy!, Sony Pictures Television

2011Продукты

Запуск Siri: голосовой ассистент становится массовым явлением

4 октября 2011 года Apple существенно изменила взаимодействие человека с компьютером, представив Siri на iPhone 4S. Как первый голосовой ассистент, глубоко интегрированный в смартфон для широкой аудитории, Siri принесла ИИ в карманы миллионов людей. 'Какая сегодня погода?' или 'Найди мне хороший греческий ресторан' — внезапно пользователи смогли говорить со своим телефоном естественным образом. Siri не была совершенно новым изобретением: с 2010 года она существовала как отдельное iOS-приложение компании Siri Inc. (приобретённой Apple), а Google уже предлагал голосовой поиск Voice Actions. Но именно бесшовная интеграция Apple в операционную систему превратила голосового ассистента в массовое явление. Siri опиралась на десятилетия исследований в SRI International и проекте CALO от DARPA. Сьюзан Беннетт ещё в 2005 году неосознанно записала оригинальный голос. Стив Джобс, тяжело больной в последние дни жизни, сам не выступил на презентации — iPhone 4S представлял Тим Кук. На следующий день после представления Siri Джобс скончался. Siri не была идеальной — критики указывали на жёсткие команды и недостаточную гибкость. Но цель была достигнута: ИИ стал массовым явлением. Siri вдохновила Amazon Alexa, Google Assistant и Microsoft Cortana. Эпоха голосовых ассистентов началась.

Первый голосовой ассистент, глубоко интегрированный в смартфон для миллионов пользователей по всему миру
Продвинутая обработка естественного языка обеспечила интуитивное взаимодействие человека с компьютером
Один из последних значимых продуктов Стива Джобса до его смерти 5 октября 2011 года
Основала современную эпоху голосовых ассистентов и вдохновила всех конкурентов

Персоны:Steve Jobs, Susan Bennett, Tom Gruber, Adam Cheyer

Организации:Apple, SRI International, DARPA

2012Публикации

Dropout-регуляризация

В июле 2012 года Джеффри Хинтон, Нитиш Шривастава, Алекс Крижевский, Илья Суцкевер и Руслан Салахутдинов значительно изменили обучение нейронных сетей, изобретя Dropout-регуляризацию. Эта элегантная техника предотвращает переобучение (Overfitting) путём случайного отключения примерно половины всех нейронов во время обучения, что устраняет сложные совместные адаптации. Вместо того чтобы запоминать специфические комбинации признаков, каждый нейрон учится распознавать устойчивые, универсально полезные паттерны. Метод, опубликованный на arXiv 3 июля 2012 года, несколько месяцев спустя стал одним из ключевых элементов победы AlexNet на ImageNet в рамках ILSVRC 2012, результаты которого были представлены в октябре 2012 года, — наряду с GPU-обучением, ReLU-активацией и глубиной сети, — и превратился в стандарт большинства современных архитектур глубокого обучения. Dropout устанавливает новые рекорды в распознавании речи и объектов и решает центральную проблему переобучения глубоких сетей.

Решает центральную проблему переобучения (Overfitting) глубоких нейронных сетей
Случайное отключение половины всех нейронов во время обучения
Один из ключевых элементов прорыва AlexNet на ImageNet — наряду с GPU-обучением, ReLU и глубиной сети
Стал стандартом в большинстве современных архитектур глубокого обучения

Персоны:Geoffrey Hinton, Nitish Srivastava, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov

Организации:University of Toronto

2012Прорывы

Успех AlexNet

Переломный момент для глубокого обучения и современного ИИ. 30 сентября 2012 года были опубликованы результаты конкурса ImageNet Challenge, который AlexNet выиграл с таким отрывом, что это навсегда изменило компьютерное зрение. Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон из Университета Торонто разработали CNN-архитектуру, которая превзошла конкурентов на впечатляющие 10,9 процентных пункта — улучшение, признанное в научном сообществе исключительным. Имея 60 миллионов параметров и используя инновационные методы, такие как активации ReLU и слои Dropout, AlexNet наглядно продемонстрировал практическое превосходство глубокого обучения. Это был момент, когда интересная теория стала доминирующей технологией. Янн ЛеКун назвал это 'несомненным переломным моментом в истории компьютерного зрения'. Реализация на основе GPU открыла путь к современному развитию ИИ.

AlexNet выиграл конкурс ImageNet 2012 с частотой ошибок 15,3% — на 10,9 процентных пункта лучше второго участника (26,2%)
60 миллионов параметров, активации ReLU, слои Dropout и обучение на GPU установили новые технические стандарты
Наглядно продемонстрировал практическое превосходство глубокого обучения и положил конец скептицизму в отношении нейронных сетей
Дал старт современному развитию ИИ и сделал CNN-архитектуры стандартом в компьютерном зрении

Персоны:Alex Krizhevsky, Geoffrey Hinton, Ilya Sutskever

Организации:University of Toronto, ImageNet Challenge, NIPS

2012Прорывы

Революция глубокого обучения

Год, ознаменовавший начало современной эпохи ИИ благодаря сочетанию наборов данных, вычислительной мощи GPU и нейронных архитектур. 2012 год отметил подъём глубокого обучения (Deep Learning) как доминирующей технологии ИИ — катализатором стала впечатляющая победа AlexNet на ImageNet. Это стало возможным благодаря конвергенции трёх факторов: набор данных ImageNet, созданный Фэй-Фэй Ли, предоставил огромное количество размеченных обучающих данных; вычисления на GPU обеспечили необходимую мощность для обучения глубоких сетей; улучшенные методы обучения — ReLU-активации и Dropout-регуляризация — преодолели прежние ограничения. Команда Джеффри Хинтона — Алекс Крижевский, Илья Суцкевер и сам Хинтон — доказала в доме родителей Крижевского на двух картах Nvidia, что глубокие нейронные сети практически применимы. AlexNet стал поворотным моментом для компьютерного зрения. Этот успех значительно усилил интерес к глубокому обучению и открыл путь к VGG, ResNet и, наконец, к сегодняшнему развитию генеративного ИИ.

Глубокое обучение (Deep Learning) утвердилось как доминирующая технология ИИ, завершив эпоху традиционных подходов машинного обучения
Победа AlexNet на ImageNet впервые продемонстрировала практическое превосходство глубоких нейронных сетей
Вычисления на GPU открыли возможность обучать крупные нейронные сети и коренным образом изменили методы исследований в области ИИ
Вызвало масштабные инвестиции в исследования глубокого обучения и промышленное внедрение нейронных архитектур

Персоны:Geoffrey Hinton, Yann LeCun, Yoshua Bengio, Alex Krizhevsky, Ilya Sutskever

Организации:University of Toronto, NYU, University of Montreal

2013Публикации

Word2Vec: слова как векторы

Преобразование представления слов через семантические векторные пространства. 16 января 2013 года Томас Миколов вместе со своей командой в Google опубликовал основополагающую статью 'Efficient Estimation of Word Representations in Vector Space'. Word2Vec изменил обработку естественного языка, представив слова в виде плотных, низкоразмерных векторов (как правило, от 100 до 300 измерений), отражающих семантические и синтаксические связи, — в противовес огромным, разреженным one-hot-векторам прежних методов. Две архитектурных варианта — CBOW (Continuous Bag of Words) и Skip-Gram — обучались на больших текстовых корпусах на основе наблюдения, что схожие слова встречаются в схожих контекстах. Знаменитый пример продемонстрировал векторную арифметику: король - мужчина + женщина = королева. С более чем 49 000 цитирований работа Миколова стала одной из самых влиятельных в области обработки естественного языка. Word2Vec заложил фундамент для всех современных техник встраивания (embedding) и открыл возможность семантических рассуждений в векторных пространствах. Это новшество проложило путь к архитектурам Transformer и современным большим языковым моделям.

Первые эффективные плотные низкоразмерные векторные представления слов с семантическими отношениями
Семантические и синтаксические закономерности через векторную арифметику: король - мужчина + женщина = королева
Открыл возможность аналогических рассуждений в векторных пространствах с помощью косинусного сходства и метрик расстояния
Заложил фундамент для современных техник встраивания и больших языковых моделей на основе Transformer

Персоны:Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean

Организации:Google, Google Research

2013Публикации

VAE: вариационные автокодировщики

Разработка вероятностных генеративных моделей посредством моделирования скрытого пространства. 20 декабря 2013 года Дидерик Кингма и Макс Веллинг опубликовали статью 'Auto-Encoding Variational Bayes'. Вариационные автокодировщики (VAE) соединяют сети кодировщика и декодировщика через вероятностное скрытое пространство — как правило, многомерное гауссово распределение. В отличие от детерминированных автокодировщиков, кодировщик представляет данные как распределения, а не отдельные точки, что позволяет осуществлять непрерывную интерполяцию и генерацию данных. Трюк репараметризации (Reparameterization Trick) делает случайность дифференцируемым элементом входных данных модели и обеспечивает стандартную оптимизацию по градиенту. В своих экспериментах VAE генерировали рукописные цифры (MNIST) и небольшие изображения лиц (Frey Faces) — пусть и размытые, но служащие доказательством применимости вариационного вывода. Эта работа заложила фундамент современного генеративного ИИ и оказала влияние на последующие вероятностные подходы вплоть до диффузионных моделей.

Вариационный вывод (Variational Inference) для эффективного приближения неподдающихся вычислению апостериорных распределений в непрерывных скрытых переменных
Вероятностное скрытое пространство позволяет осуществлять непрерывную интерполяцию и генерацию новых точек данных
Новаторское соединение архитектуры автокодировщика с масштабируемым вероятностным генеративным моделированием посредством амортизированного вариационного вывода
Архитектура кодировщик-декодировщик с трюком репараметризации для дифференцируемой случайности

Персоны:Diederik P. Kingma, Max Welling

Организации:University of Amsterdam

2014Публикации

Adam: стандартный оптимизатор глубокого обучения

Чтобы нейронная сеть обучалась, оптимизатор должен шаг за шагом поворачивать миллионы настроечных параметров в нужную сторону. В 2014 году Дидерик Кингма и Джимми Ба представили метод, который быстро стал самым востребованным в отрасли: Adam — название происходит от английского Adaptive Moment Estimation и не является аббревиатурой. Хитрость Adam в том, что для каждого отдельного параметра ведётся собственная, автоматически адаптируемая скорость обучения. Метод объединяет две проверенные идеи — импульс (momentum), сохраняющий предыдущее направление, и адаптивный размер шага в духе RMSProp. Результат: сети обучаются надёжно, без мучительного подбора скорости обучения. Статья стала одной из наиболее цитируемых в исследованиях ИИ. Если подходить честно: Adam — не панацея. В ряде случаев более простой SGD лучше обобщает данные на новые ситуации. Кроме того, Adam опирается на предшественников — AdaGrad и RMSProp, — а более поздние варианты, такие как AdamW (2017), пришлось доработать, чтобы исправить слабые места оригинала.

В 2014 году Дидерик Кингма и Джимми Ба представили оптимизатор Adam — название происходит от Adaptive Moment Estimation (не аббревиатура).
Adam автоматически адаптирует скорость обучения для каждого параметра, объединяя две идеи: импульс (momentum) и адаптивный размер шага (как в RMSProp).
Adam стал стандартным инструментом для обучения нейронных сетей — надёжным и без мучительной настройки скорости обучения. Статья входит в число наиболее цитируемых в исследованиях ИИ.
Adam — не панацея: в ряде случаев простой SGD обобщает данные лучше. Метод опирается на предшественников (AdaGrad, RMSProp); более поздние варианты, например AdamW (2017), устранили его недостатки.

Персоны:Diederik Kingma, Jimmy Ba

2014Наборы данных

MS COCO: золотой стандарт компьютерного зрения

В 2014 году исследовательская группа под руководством Microsoft Research, Корнеллского университета и Калифорнийского университета в Беркли существенно изменила исследования в области компьютерного зрения с помощью набора данных COCO (Common Objects in Context). В отличие от ImageNet с изолированными объектами, COCO показывал предметы в их естественном контексте — так, как они встречаются в реальном мире. 2,5 миллиона аннотаций в 328 000 изображениях, разделённых на 91 категорию в исходной статье, из которых 80 образуют актуальный по сей день эталон для задач обнаружения объектов, — всё это предметы повседневной жизни, которые узнал бы четырёхлетний ребёнок. Инновация заключалась в деталях: маски сегментации с точностью до пикселя вместо обычных ограничивающих рамок. COCO впервые обеспечил возможность точной локализации объектов и понимания сложных сцен. Набор данных стал золотым стандартом для обнаружения объектов, сегментации экземпляров и создания описаний изображений. От YOLO до Mask R-CNN — все ведущие модели компьютерного зрения оцениваются по COCO. Стандартизированные метрики, такие как средняя точность (mAP), сделали сравнение моделей объективно возможным. Спустя более десяти лет COCO по-прежнему остаётся важнейшим эталоном в сообществе компьютерного зрения. Без COCO не было бы современных систем обнаружения объектов в автономных транспортных средствах, системах видеонаблюдения и дополненной реальности.

Объекты в естественном контексте, а не изолированно — существенно изменило компьютерное зрение: от искусственных сцен к реальным
2,5 миллиона точных до пикселя аннотаций в 328 000 изображениях — беспрецедентное качество и глубина разметки
Золотой стандарт с метриками mAP для объективного сравнения моделей — определил оценку в компьютерном зрении
Фундамент для YOLO, Mask R-CNN и всех современных систем компьютерного зрения — от автономных автомобилей до дополненной реальности

Персоны:Tsung-Yi Lin, Michael Maire, Serge Belongie

Организации:Microsoft Research, Cornell University, UC Berkeley

2014Публикации

GAN — генеративно-состязательные сети

Иэн Гудфеллоу изобрёл генеративно-состязательные сети (GAN) в 2014 году за одну ночь в Монреале после посещения паба. Его новаторский подход заставляет две нейронные сети соревноваться в игре с минимакс-стратегией: генератор создаёт искусственные данные, дискриминатор пытается отличить настоящие данные от поддельных. Это состязательное обучение кардинально изменило генеративный ИИ. Оригинальная GAN 2014 года генерировала лишь небольшие размытые изображения (например, цифры и лица), однако проложила путь к последующей фотореалистичной генерации изображений. Работа, опубликованная в 2014 году на arXiv, стала одной из наиболее влиятельных статей в области ИИ и принесла Гудфеллоу широкую известность. За ней последовали сотни вариантов GAN.

Две нейронные сети в игре с минимакс-стратегией: генератор против дискриминатора
Изобретено за одну ночь 2014 года в Монреале после посещения паба — заработало сразу же
Математически элегантный подход к состязательной оптимизации
Кардинально изменило генеративный ИИ — проложило путь к последующей фотореалистичной генерации изображений

Персоны:Ian Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio

Организации:University of Montreal, NIPS Conference

2014Публикации

Механизм внимания: ключ к современным большим языковым моделям

Сентябрь 2014 года: Дзмитры Бахданау, Кюнхён Чо и Йошуа Бенжио опубликовали статью, которой предстояло навсегда изменить мир обработки естественного языка (NLP). 'Neural Machine Translation by Jointly Learning to Align and Translate' решила фундаментальную проблему моделей Sequence-to-Sequence. Прежние архитектуры кодировщик-декодировщик сжимали каждое входное предложение в единственный вектор фиксированной длины — информационное узкое место при длинных предложениях. Attention Бахданау стала значительным шагом вперёд: вместо фиксированного вектора модель использовала динамическое внимание к различным частям входного предложения. Подобно тому как человеческий глаз перемещается при чтении, внимание ИИ перескакивает между релевантными словами. Эта 'Additive Attention' стала концептуальным предшественником современных NLP-систем. Трансформер (2017), появившийся позже, опирался на идею внимания, но заменил аддитивный вариант более эффективным Scaled-Dot-Product Attention. Без концепции Attention Бахданау не было бы трансформеров, без трансформеров — ни семейства GPT, ни BERT. Этот прорыв произошёл за три года до выхода статьи 'Attention Is All You Need'.

Устранил узкое место в архитектуре кодировщик-декодировщик: переменная длина предложений вместо сжатия в фиксированный вектор
Динамическое внимание вместо статического кодирования: адаптивная фокусировка на релевантных частях входных данных
Обучается выравниванию между языками: какие слова соответствуют друг другу при переводе?
Концептуальный предшественник трансформеров: идея Attention Бахданау открыла путь к GPT, BERT и ChatGPT

Персоны:Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio

Организации:University of Montreal, Jacobs University Bremen

2014Продукты

Запуск Amazon Alexa и Echo

6 ноября 2014 года Amazon представил Alexa и умную колонку Echo, существенно изменив взаимодействие человека с технологиями. Поначалу Echo продавался только по приглашениям и исключительно для участников Prime; лишь с началом открытых продаж в 2015 году голосовой ИИ стал доступен широкому кругу потребителей и превратил дом в управляемую голосом среду. Опираясь на польскую технологию синтеза речи Ivona, приобретённую 24 января 2013 года, Amazon создал принципиально новый пользовательский опыт. Echo стартовал как устройство для управления музыкой, однако быстро превратился в универсальный центр умного дома. Это новшество породило массовую категорию продуктов и ознаменовало начало масштабного развития рынка умных колонок, вдохновив многочисленных конкурентов.

Создал массовую категорию умных колонок с постоянной голосовой готовностью
С началом открытых продаж в 2015 году сделал голосовой ИИ доступным для миллионов потребителей, а не только для технических энтузиастов
Превратил гостиную в управляемый голосом центр умного дома
Ознаменовал начало масштабного развития рынка — Google, Apple и другие последовали примеру

Персоны:Jeff Bezos, Amazon Alexa Team

Организации:Amazon, Ivona (acquired 2013)

2015Прорывы

Deep Q-Networks: ИИ учится играть в Atari по пикселям

Задолго до того как AlphaGo попал в заголовки газет, DeepMind в 2015 году научила ИИ играть в видеоигры Atari, опираясь исключительно на сырые пиксели изображения, — и тем самым заложила фундамент глубокого обучения с подкреплением. В феврале 2015 года команда под руководством Владимира Мних опубликовала в Nature статью 'Human-level control through deep reinforcement learning' (предварительная версия вышла в 2013 году). Нейронная сеть, которая видела лишь экран и счёт, обучилась играть в 49 различных игр Atari — с одной и той же архитектурой, без дополнительной настройки под каждую игру. Технически DeepMind объединила свёрточную сеть с Q-обучением, буфером опыта (Experience Replay, введённым Лином в начале 1990-х) и стабилизирующей целевой сетью. При оценке важна точность: система достигала человеческого уровня примерно в половине игр и превзошла все прежние методы в 43 из 49 — однако в играх с редкими наградами, таких как Montezuma's Revenge, её результат был почти нулевым. Тем не менее это стало доказательством того, что глубокие сети и обучение с подкреплением совместимы в большом масштабе — мостом от Q-обучения 1990-х к AlphaGo и AlphaZero.

Обучение по сырым пикселям: система видела лишь экран и счёт — никаких ручных признаков, никаких специальных знаний для каждой игры.
Свёрточная сеть + Q-обучение + буфер опыта (Experience Replay, введённый Лином в начале 1990-х) + целевая сеть, добавленная в 2015 году для стабилизации обучения.
Человеческий уровень достигнут примерно в половине из 49 игр (43/49 лучше прежних методов) — в играх с редкими наградами (Montezuma's Revenge) результат близок к нулю.
Старт глубокого обучения с подкреплением; сделал DeepMind известным до AlphaGo — мост от Q-обучения к AlphaGo и AlphaZero.

Персоны:Volodymyr Mnih, David Silver, Demis Hassabis

Организации:Google DeepMind

2015Публикации

Batch Normalization: важный прогресс в обучении нейронных сетей

11 февраля 2015 года Сергей Иоффе и Кристиан Сегеди из Google опубликовали статью, которая существенно изменила обучение глубоких нейронных сетей. Их диагноз: 'Internal Covariate Shift' — распределение входных данных каждого слоя смещается в процессе обучения, что делает его нестабильным. Их элегантное решение: Batch Normalization (пакетная нормализация) нормализует активации каждого слоя для каждого мини-пакета. Эффект оказался значительным: примерно в 14 раз меньше шагов обучения до достижения той же точности. Стали возможны более высокие скорости обучения, Dropout нередко оказывался лишним, а инициализация — менее критичной. Метод выступал одновременно и как регуляризатор, и как ускоритель. Ансамбль на ImageNet достиг 4,8% ошибок в топ-5, превзойдя тем самым людей-оценщиков (около 5,1%). Примечательно: последующие исследования (Santurkar и др., 2018) показали, что истинный механизм действия связан не столько с подавлением Covariate Shift, сколько со сглаживанием ландшафта функции потерь — то есть исходное объяснение сегодня считается относительным. Статья, набравшая уже более 60 000 цитирований, вдохновила множество методов нормализации: GroupNorm, LayerNorm, InstanceNorm. Сегодня Batch Normalization является стандартом во многих современных архитектурах — от ResNet до актуальных CNN. Трансформеры, напротив, как правило используют вдохновлённую этой работой Layer Normalization.

Решил проблему Internal Covariate Shift путём нормализации активаций в каждом мини-пакете
Примерно в 14 раз меньше шагов обучения до той же точности — стали возможны более высокие скорости обучения и устойчивая инициализация
Двойная польза: ускорение И регуляризация — нередко заменяет Dropout в современных архитектурах
4,8% ошибок в топ-5 на ImageNet с ансамблем — превзошло людей-оценщиков (около 5,1%) и установило новый стандарт

Персоны:Sergey Ioffe, Christian Szegedy

Организации:Google Inc., ICML Conference

2015Публикации

YOLO: You Only Look Once

Трансформация детекции объектов в реальном времени через унифицированную однопроходную архитектуру. 8 июня 2015 года Джозеф Редмон, Сантош Диввала, Росс Гиршик и Али Фархади представили прорывную статью 'You Only Look Once: Unified, Real-Time Object Detection'. YOLO преодолел традиционную двухэтапную парадигму детекции объектов и сформулировал детекцию как задачу регрессии для пространственно разделённых bounding boxes. Одна нейронная сеть предсказывает bounding boxes и вероятности классов непосредственно из полных изображений за одну оценку. С базовой производительностью 45 fps и Fast YOLO на поразительных 155 fps система была в сотни-тысячи раз быстрее существующих детекторов. Архитектура на основе сетки разделяла изображения на ячейки, где каждая ячейка предсказывает объекты в своём центре.

Базовая производительность 45 fps, Fast YOLO 155 fps — в сотни-тысячи раз быстрее существующих детекторов
Однопроходная архитектура формулирует детекцию объектов как задачу регрессии вместо двухэтапной парадигмы
Разделение на ячейки с прямым предсказанием bounding box и вероятностей классов
Сделал возможным компьютерное зрение в реальном времени для автономных автомобилей, видеонаблюдения и мобильных приложений

Персоны:Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi

Организации:University of Washington, Allen Institute, Facebook AI Research

2015Прорывы

Разработка DeepMind AlphaGo

В октябре 2015 года DeepMind достиг исторического прорыва: AlphaGo стал первой системой ИИ, победившей профессионального игрока в го на полной доске без форы. AlphaGo обыграл европейского чемпиона по го Фань Хуэя со счётом 5:0, завоевав тем самым самую сложную классическую настольную игру в мире — на десятилетие раньше, чем прогнозировали эксперты. Поначалу матч оставался в тайне; публично об успехе объявили лишь 27 января 2016 года — одновременно с публикацией в научном журнале Nature. Го несравнимо сложнее шахмат — примерно в гугол (10^100) раз больше допустимых позиций, а число возможных конфигураций доски превышает количество атомов в наблюдаемой вселенной. Этот замечательный успех демонстрирует мощь нейронных сетей и поиска Монте-Карло по дереву.

Первая победа компьютера над профессиональным игроком в го на полной доске без форы (Фань Хуэй 5:0)
Новаторский подход с использованием глубоких нейронных сетей вместо жёстко закодированных алгоритмов
Преодоление 10^170 возможных конфигураций доски — больше, чем атомов во вселенной
Прорыв произошёл на десятилетие раньше, чем прогнозировали эксперты в области ИИ

Персоны:Demis Hassabis, David Silver, DeepMind Team

Организации:DeepMind, Google

2015Продукты

Автопилот Tesla: системы помощи водителю для массового рынка

14 октября 2015 года Tesla выпустила программную версию 7.0 и тем самым впервые активировала автопилот для автомобилей Model S. Аппаратное обеспечение было установлено в автомобилях ещё в сентябре 2014 года — за год до программной активации. Система использовала технологию Mobileye с фронтальной камерой, радаром и 12 ультразвуковыми датчиками. Водители получили возможность пользоваться адаптивным круиз-контролем, системой удержания полосы движения и автоматической парковкой — функциями, прежде доступными только в автомобилях премиум-класса. Tesla охарактеризовала это как автономность 2-го уровня: система помогает водителю, но не заменяет его. При выпуске Маск подчеркнул: 'Мы рекомендуем водителям держать руки на руле.' Уже в первый год автопарк Tesla собрал сотни миллионов километров с активным автопилотом — к концу 2016 года Tesla сообщила о примерно 222 миллионах пройденных миль. Концепция — предустановить аппаратное обеспечение, а функции открывать через обновления программного обеспечения — показала автомобильной промышленности новый путь. От Mercedes до чисто технологических поставщиков, таких как Mobileye, многочисленные игроки продвигали собственные системы помощи водителю.

Программное обновление от 14 октября 2015 года активировало предустановленное аппаратное обеспечение — новая концепция для автомобильной промышленности
Сенсорика на базе Mobileye: фронтальная камера, радар и 12 ультразвуковых датчиков для помощи водителю 2-го уровня
Адаптивный круиз-контроль, система удержания полосы и автоматическая парковка — прежде функции премиум-класса
Сотни миллионов километров уже в первый год — продемонстрировала готовность массового рынка к системам помощи водителю

Персоны:Elon Musk, Tesla Engineering Team

Организации:Tesla Inc., Mobileye

2015Продукты

TensorFlow: ML-фреймворк Google становится открытым

Демократизация машинного обучения благодаря мощному внутреннему инструменту Google. 9 ноября 2015 года Google открыл исходный код TensorFlow под лицензией Apache 2.0 и сделал свою вторую ML-систему доступной для всех. TensorFlow заменил внутреннюю систему DistBelief и предложил двукратную скорость с улучшенной масштабируемостью и готовностью к производству. Как универсальный процессор графов вычислений TensorFlow позволял не только глубокое обучение, но и любые дифференцируемые вычисления. Гибкий интерфейс Python, автоматическое дифференцирование и первоклассные оптимизаторы революционизировали ML-разработку. Стратегия Google: разработка на основе сообщества ускоряет прогресс ИИ для всех. Разработанный более чем 30 авторами из команды Google Brain, TensorFlow стал одной из ведущих ML-платформ и позволил миллионам разработчиков создавать продвинутые ИИ-приложения.

Лицензия Apache 2.0 сделала мощную внутреннюю ML-систему Google свободно доступной для всех
Заменил DistBelief с двукратной скоростью и улучшенной масштабируемостью
Гибкий интерфейс Python и автоматическое дифференцирование значительно улучшили ML-разработку
Позволил миллионам разработчиков получить доступ к продвинутой ИИ-технологии

Персоны:Martín Abadi, Ashish Agarwal, Paul Barham, Jeff Dean

Организации:Google, Google Brain

2015Публикации

ResNet: остаточные сети меняют глубокое обучение

Решение проблемы деградации очень глубоких сетей и рождение ультраглубоких нейронных архитектур. 10 декабря 2015 года команда Кайминга Хэ в Microsoft Research опубликовала статью 'Deep Residual Learning for Image Recognition' и существенно изменила глубокое обучение. До этого точность обучения ухудшалась при увеличении глубины сетей — не столько из-за затухающих градиентов, сколько потому, что глубокие сети было просто сложнее оптимизировать. ResNet ввёл остаточные соединения (residual connections) — пропускные связи, которые напрямую передают входные данные более поздним слоям и позволяют обучать ультраглубокие нейронные сети. При 152 слоях ResNet был в восемь раз глубже VGG, но менее сложным. Замечательный результат: 3,57 % ошибок Top-5 (ансамбль моделей) на ImageNet — триумф, который обеспечил первое место во всех категориях. ResNet выиграл ImageNet Classification, Detection, Localization, а также COCO Detection и Segmentation в 2015 году. Фреймворк остаточного обучения переосмыслил слои как обучение остаточным функциям (residual functions) вместо безреференсных функций. Это новшество открыло возможность обучать сети с сотнями слоёв.

Пропускные соединения напрямую передают входные данные и позволяют обучать ультраглубокие нейронные сети
152 слоя — в 8 раз глубже VGG, но менее сложный благодаря фреймворку остаточного обучения
3,57 % ошибок Top-5 (ансамбль) на ImageNet, победа во всех категориях ILSVRC и COCO 2015
Утвердил остаточные соединения (residual connections) как стандарт для современных архитектур глубокого обучения

Персоны:Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

Организации:Microsoft Research

2015Вехи

Основание OpenAI

Организация, стремившаяся сделать ИИ доступным для всех, — и изменившая мир. 11 декабря 2015 года Сэм Альтман, Илон Маск и другие известные технологические деятели объявили об основании OpenAI. Заявив о намерении привлечь миллиард долларов — финансовом обещании инвесторов, распределённом на несколько лет, из которого поначалу реально поступила лишь небольшая часть, — и поставив целью разработку безопасного общего ИИ на благо всего человечества, OpenAI вышла на арену как некоммерческая исследовательская организация. То, что начиналось как идеалистическое начинание, превратилось в наиболее влиятельную лабораторию ИИ в мире. В 2019 году была учреждена дочерняя коммерческая компания. С GPT-3 и ChatGPT OpenAI заново определила, на что способен ИИ.

Основана 11 декабря 2015 года в Сан-Франциско
Миссия: разработать безопасный общий ИИ на благо всего человечества
Обещано: 1 миллиард долларов от Илона Маска, Питера Тиля, Рида Хоффмана и других — финансовое обещание на несколько лет, не доступное немедленно
GPT-1 (2018) и GPT-2 (2019) были созданы ещё в период чисто некоммерческой деятельности; в 2019 году появилась структура capped-profit, в рамках которой создавались GPT-3 (2020) и ChatGPT (2022)

Персоны:Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, Wojciech Zaremba, John Schulman

Организации:OpenAI, Y Combinator

2016Соревнования

AlphaGo побеждает Ли Седоля

Исторический момент, когда ИИ впервые победил чемпиона мира в сложнейшей настольной игре. С 9 по 15 марта 2016 года в Сеуле прошёл матч DeepMind Challenge Match — пять партий между Ли Седолем, одним из лучших игроков в го в мире, и AlphaGo. Результат поразил мир: 4:1 в пользу машины. Особенно знаменитый «ход 37» во второй партии продемонстрировал машинную креативность — ход с вероятностью 1:10000, перевернувший вековые истины го. AlphaGo сочетал глубокое обучение с поиском по дереву Монте-Карло и обучался как на человеческих партиях, так и на самоигре. Однако ответ Ли Седоля в четвёртой партии с его «божественным ходом 78» показал, что человеческая интуиция всё ещё может удивлять. Более 200 миллионов человек по всему миру следили за этими партиями.

AlphaGo победил Ли Седоля 4:1 и впервые продемонстрировал превосходство ИИ в сложнейшей настольной игре
Знаменитый «ход 37» с вероятностью 1:10000 показал машинную креативность и бросил вызов традициям го
Сочетание глубокого обучения и поиска по дереву Монте-Карло позволило освоить сложность го
Более 200 миллионов человек следили за партиями — поворотный момент в общественном восприятии ИИ

Персоны:Lee Sedol, Demis Hassabis, David Silver, Aja Huang

Организации:DeepMind, Google, Korean Baduk Association

2016Публикации

XGBoost: Extreme Gradient Boosting доминирует в ML

Совершенствование градиентного бустинга и завоевание задач на структурированных данных. 9 марта 2016 года Тяньци Чен и Карлос Гестрин опубликовали на arXiv статью 'XGBoost: A Scalable Tree Boosting System', представленную в августе 2016 на конференции KDD. Разработанный из PhD-проекта Чена в University of Washington, XGBoost значительно улучшил традиционный градиентный бустинг через экстремальные оптимизации: L1- и L2-регуляризация предотвращала переобучение, градиенты второго порядка давали более точную информацию о направлении, а параллелизация значительно ускорила построение деревьев. XGBoost доминировал в соревнованиях машинного обучения 2010-х и стал стандартным выбором для команд-победителей на Kaggle. На Higgs Boson ML Challenge Тяньци Чен получил специальный приз, и XGBoost использовался многими топ-участниками.

Экстремальная оптимизация градиентного бустинга с L1/L2-регуляризацией и градиентами второго порядка
Доминировал в ML-соревнованиях 2010-х и стал стандартным выбором для команд-победителей Kaggle
Параллелизованное построение деревьев и масштабируемая сквозная архитектура для больших датасетов
Основной алгоритм для структурированных данных параллельно с революцией глубокого обучения

Персоны:Tianqi Chen, Carlos Guestrin

Организации:University of Washington

2016Продукты

Google Assistant: стратегия 'ИИ прежде всего' становится реальностью

18 мая 2016 года Сундар Пичаи на конференции Google I/O представил Google Assistant — ответ Google на Siri и Alexa. После многих лет отставания в области голосовых помощников Google догонял конкурентов в полную силу. Assistant был чем-то большим, чем просто обновление Google Now, — он стал фундаментом стратегии Пичаи 'ИИ прежде всего' (AI-First). 'Мы хотим, чтобы пользователи вели непрерывный диалог с Google', — объяснил Пичаи. 'Мы создаём индивидуальный Google для каждого пользователя.' Планировалось, что Assistant станет 'ambient experience', охватывающим все устройства — от смартфонов до Google Home и автомобилей. В отличие от конкурентов, работавших на основе команд, Google делал ставку на естественный диалог и понимание контекста. Поначалу Assistant был лишь анонсирован; первым его домом стало приложение для обмена сообщениями Allo, а затем, в конце 2016 года, умная колонка Google Home. Запуск ознаменовал серьёзный выход Google в разработку голосового ИИ и заложил основу для нынешнего доминирования компании в области ИИ.

Естественный диалог вместо команд — 'непрерывный разговор' как цель голосового ИИ
Фундамент стратегии Пичаи 'ИИ прежде всего' — 'индивидуальный Google' для каждого пользователя
Концепция ambient experience — бесшовное взаимодействие с ИИ на всех устройствах и платформах
Догоняющий марш Google против Siri и Alexa — от аутсайдера к претенденту на лидерство в голосовом ИИ

Персоны:Sundar Pichai, Google Assistant Team

Организации:Google Inc., Google I/O Conference

2016Организации

Partnership on AI: технологические гиганты объединяются

Значимый альянс ведущих технологических компаний ради ответственного развития ИИ. 28 сентября 2016 года Amazon, Facebook, Google, DeepMind, IBM и Microsoft основали 'Partnership on Artificial Intelligence to Benefit People and Society' — необычную коалицию бывших конкурентов. С Эриком Хорвицем (Microsoft Research) и Мустафой Сулейманом (DeepMind) в роли временных сопредседателей Partnership поначалу имела совет директоров, состоявший исключительно из корпоративных представителей, объявив о планах преобразовать его в паритетный орган с равным числом некорпоративных членов. Миссия охватывает исследования и лучшие практики в области этики, справедливости, прозрачности, защиты данных и взаимодействия человека и ИИ. Примечательно: Apple поначалу отсутствовала, но присоединилась в 2017 году. Partnership сознательно отказывается от лоббирования и сосредоточивается на научном сотрудничестве. Эта инициатива ознаменовала начало структурированного отраслевого саморегулирования в развитии ИИ.

Значимый альянс Amazon, Facebook, Google, DeepMind, IBM и Microsoft в области этики ИИ
Миссия: ИИ на благо людей и общества через этику, справедливость и прозрачность
Запланированный паритетный совет: на старте состоял из корпоративных представителей, позднее дополненный равным числом некорпоративных членов
Фокус на научном сотрудничестве и лучших практиках без лоббирования

Персоны:Mustafa Suleyman, Eric Horvitz, Partnership Team

Организации:Amazon, Apple, Facebook, Google, IBM, Microsoft

2016Прорывы

Распознавание речи достигает уровня человека

18 октября 2016 года Microsoft добился исторического успеха: впервые компания достигла производительности уровня человека в системе распознавания речи на эталонном тесте Switchboard для разговорной речи. После 25 лет исследований цель была достигнута — уровень ошибок слов 5,9 %, что соответствует точности профессиональных транскрибистов на этой задаче. (В 2017 году Microsoft скорректировал человеческий показатель до 5,1 % и был вынужден снова догонять.) Сюэдун Хуан, главный учёный Microsoft по речевым технологиям, объявил: 'Мы достигли паритета с человеком. Это историческое достижение.' Система использовала новейшие технологии глубокого обучения: свёрточные нейронные сети, архитектуры LSTM и нейронные языковые модели с непрерывными векторами слов. Сила заключалась в систематическом сочетании проверенных компонентов — ансамбль акустических моделей CNN и BLSTM, адаптация к диктору с помощью i-vector и переоценка с помощью языковой модели. Это стало возможным благодаря конвергенции трёх факторов: больших наборов данных (Switchboard Corpus), вычислений на GPU и улучшенных методов обучения. Это достижение открыло путь для современных голосовых ассистентов — однако оно подтверждает паритет лишь в узко определённой задаче транскрипции, а не общие когнитивные способности человека.

Уровень ошибок слов 5,9 % достигает человеческого уровня на Switchboard: точность профессиональных транскрибистов
Исторический рубеж: наименьший уровень ошибок, когда-либо зафиксированный в стандарте Switchboard
CNN + LSTM + нейронные языковые модели: систематическое сочетание передовых технологий глубокого обучения
25-летняя исследовательская цель достигнута: паритет с человеком в узко определённой задаче транскрипции

Персоны:Xuedong Huang, Microsoft AI Research Team

Организации:Microsoft AI and Research, Switchboard Corpus

2017Регулирование

Принципы Асиломара: экспертное сообщество устанавливает ориентиры

В начале 2017 года, задолго до ChatGPT, ведущие исследователи ИИ собрались в Асиломаре на побережье Калифорнии — там же, где биологи в 1975 году обсуждали риски генной инженерии. Конференцию по полезному ИИ организовал Future of Life Institute. Итогом стали 23 Асиломарских принципа ИИ: руководящие принципы в области исследований, таких ценностей, как безопасность и прозрачность, а также долгосрочных рисков. Под ними подписались более тысячи специалистов по ИИ, в том числе такие известные фигуры, как Стивен Хокинг и Илон Маск. Это была одна из первых масштабных попыток экспертного сообщества установить для себя ориентиры — за многие годы до того, как к теме обратились правительства. Если подходить честно: принципы носили добровольный и необязательный характер. Они повлияли на дискуссию, однако не имели юридической силы.

Январь 2017: Future of Life Institute собрал ведущих исследователей ИИ в Асиломаре (Калифорния) — на месте исторической конференции по генной инженерии 1975 года.
Итог: 23 Асиломарских принципа ИИ по исследованиям, ценностям (безопасность, прозрачность) и долгосрочным рискам — одна из первых масштабных добровольных обязательств экспертного сообщества.
Более тысячи исследователей ИИ и других подписантов (в т. ч. Стивен Хокинг, Илон Маск) — ранний консенсус о том, что ИИ должен служить общественному благу.
Принципы носили добровольный и необязательный характер — важный дискуссионный ориентир, но без механизма исполнения.

Персоны:Stephen Hawking, Elon Musk

Организации:Future of Life Institute

2017Публикации

MobileNet — ИИ для смартфонов

В апреле 2017 года Google Research существенно изменил мобильный ИИ с помощью MobileNet — одной из первых моделей глубокого обучения, специально разработанной для смартфонов, интернета вещей и встраиваемых систем (предшественники, такие как SqueezeNet, уже существовали). Благодаря инновационной архитектуре Depthwise Separable Convolution MobileNet снижает вычислительные затраты при сохранении той же эффективности примерно до одной восьмой по сравнению с обычными свёртками. Эта примечательная эффективность — около девяти раз меньше вычислительных операций при ядрах 3x3 — открывает путь к обработке изображений в реальном времени на мобильных устройствах. MobileNet демократизировал компьютерное зрение для миллиардов смартфонов и утвердил граничные вычисления (edge computing) как новую ИИ-парадигму за пределами облачных решений.

Одна из первых моделей глубокого обучения, специально разработанная для смартфонов и устройств интернета вещей
Depthwise Separable Convolutions: около девяти раз меньше вычислительных затрат при той же эффективности
Обеспечивает обработку ИИ непосредственно на устройствах, а не в облаке — граничные вычисления (edge computing)
Снижает вычислительные затраты примерно до одной восьмой по сравнению с обычными свёртками при сопоставимой точности

Персоны:Andrew Howard, Menglong Zhu, Bo Chen, Google Research Team

Организации:Google, Google Research

2017Публикации

Публикация исследовательской статьи о RLHF

Техника, которая сделала ChatGPT возможным — за годы до прорыва. В июне 2017 года исследователи из OpenAI и DeepMind опубликовали статью «Deep Reinforcement Learning from Human Preferences». Идея: вместо обучения ИИ-систем с идеально определёнными функциями вознаграждения, они учатся напрямую из человеческой обратной связи. Люди оценивают различные выводы ИИ, и система учится, какое поведение предпочтительно. Этот метод, позже известный как RLHF (обучение с подкреплением на основе человеческой обратной связи), стал ключевой технологией за ChatGPT и другими современными языковыми моделями. RLHF позволил сделать ИИ-системы более полезными, честными и безопасными.

Статья «Deep Reinforcement Learning from Human Preferences» опубликована в июне 2017 года
Ключевая идея: ИИ учится из человеческих предпочтений вместо предопределённых вознаграждений
Совместное исследование OpenAI и DeepMind, в т.ч. Пол Кристиано и Дарио Амодеи
RLHF стал ключевой технологией для ChatGPT и современных ИИ-ассистентов

Персоны:Paul Christiano, Jan Leike, Dario Amodei, Tom Brown

Организации:OpenAI, DeepMind

2017Публикации

Трансформер: 'Attention Is All You Need'

12 июня 2017 года восемь исследователей — преимущественно из Google, среди которых был и стажёр Университета Торонто — опубликовали на arXiv статью 'Attention Is All You Need' — основу современных больших языковых моделей. Эшиш Васвани, Ноам Шазир и их коллеги предложили новую архитектуру: трансформер (Transformer). В отличие от прежних моделей последовательностей, трансформер отказывается от рекуррентных и свёрточных слоёв. Вместо них используются чистые механизмы внимания. Механизм самовнимания (Self-Attention) улавливает связи между всеми позициями последовательности параллельно — последовательная обработка больше не нужна. Многоголовое внимание (Multi-Head Attention) использует несколько параллельных голов внимания, обучающихся различным аспектам отношений между словами. На наборе WMT 2014 модель достигла показателя 28,4 BLEU для пары английский — немецкий и 41,8 BLEU для пары английский — французский — новые рекорды. Архитектура оказалась широко применимой: GPT, BERT, ChatGPT и многие другие модели основаны на вариантах трансформера. Статья набрала значительно более 100 000 цитирований — и эта цифра неуклонно растёт — и входит в число наиболее цитируемых научных работ XXI века.

Механизм самовнимания (Self-Attention) улавливает зависимости между всеми позициями последовательности одновременно
Отказ от рекуррентности обеспечивает параллельную обработку — значительно быстрее, чем последовательные модели
28,4 BLEU WMT английский — немецкий, 41,8 BLEU английский — французский — новые стандарты машинного перевода
Стал основой всех современных больших языковых моделей: GPT, BERT, ChatGPT построены на архитектуре трансформера

Персоны:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin

Организации:Google Brain, Google Research

2017Регулирование

Генеральный план Китая по ИИ: борьба за мировое лидерство

20 июля 2017 года Государственный совет Китая объявил 'План развития искусственного интеллекта нового поколения' — первую комплексную национальную стратегию в области ИИ такого масштаба. Цель: к 2030 году стать мировой державой-лидером в области ИИ. Трёхэтапный план был чётко сформулирован: к 2020 году — конкурентоспособность на глобальном уровне; к 2025 году — мировое лидерство в отдельных областях и крупные прорывы в фундаментальной теории ИИ; к 2030 году — ведущая ИИ-сверхдержава с объёмом индустрии в 1 триллион юаней. Китай прямо обозначил ИИ как 'фокус международной конкуренции' и 'стратегическую технологию для национальной безопасности'. Инвестиции значительны: десятки миллиардов долларов направляются в исследования, инфраструктуру и развитие кадров. План охватывает военные и гражданские применения: от автономного оружия до умных городов. Принципы открытого исходного кода призваны содействовать международному сотрудничеству, тогда как Китай одновременно добивается технологической независимости. Эта стратегия существенно изменила глобальный ИИ-ландшафт и спровоцировала волну национальных ИИ-инициатив в США и Европе.

Первая национальная ИИ-стратегия такого масштаба: скоординированное государственное планирование для достижения глобального технологического лидерства
Трёхэтапная временная шкала: к 2020 — конкурентоспособность, к 2025 — мировое лидерство в отдельных областях, к 2030 — ведущая ИИ-сверхдержава
Инвестиции в триллион юаней: масштабное государственное финансирование исследований в области ИИ, инфраструктуры и кадров
Амбиция мирового лидерства: начало глобального ИИ-соревнования между Китаем, США и Европой

Персоны:State Council of China, Chinese AI Research Community

Организации:State Council of China, Chinese Academy of Sciences

2017Регулирование

Монреальская декларация об ответственном ИИ

Первая международная инициатива, разработавшая этические принципы ИИ посредством демократического участия граждан. 3 ноября 2017 года Университет Монреаля запустил процесс совместного создания Монреальской декларации об ответственном развитии ИИ. Форум по общественно ответственному развитию ИИ собрал более 400 участников из различных секторов и дисциплин. В ходе 15 дискуссионных семинаров на протяжении трёх месяцев более 500 граждан, экспертов и заинтересованных сторон обсуждали общественные вызовы, связанные с ИИ. Опубликованная 4 декабря 2018 года декларация представляет 10 принципов и 59 рекомендаций, основанных на таких ценностях, как благополучие, автономия, справедливость, конфиденциальность и демократия. Набрав более 500 подписантов, Монреальская декларация утвердила партисипативный подход к управлению ИИ и оказала влияние на последующие международные усилия по ответственному развитию ИИ.

10 этических принципов и 59 рекомендаций по ответственному развитию ИИ с демократической легитимностью
Акцент на благополучии, автономии, справедливости, конфиденциальности, демократии и экологической устойчивости
Инициирован Университетом Монреаля с участием более 400 представителей различных секторов
Более 500 подписантов; повлиял на международное управление ИИ и последующие регуляторные инициативы

Персоны:Yoshua Bengio, Montreal AI Ethics Team

Организации:Université de Montréal, Montreal Institute for Learning Algorithms

2017Прорывы

AlphaZero осваивает три игры

Рождение универсального игрового ИИ посредством чистого самообучения. В декабре 2017 года DeepMind представил AlphaZero — систему, освоившую три совершенно разные стратегические игры без каких-либо предварительных знаний: шахматы, сёги и го. Подход tabula rasa означал: никаких дебютных баз, никаких человеческих стратегий — только правила игры в качестве отправной точки. За 24 часа AlphaZero достиг сверхчеловеческого уровня — в шахматах уже через 4 часа, в сёги через 2 часа. В матче из 100 партий против Stockfish он выиграл 28 партий, не проиграл ни одной и свёл 72 к ничьей. Особенность заключалась в эффективном поиске: пока Stockfish оценивает 60 миллионов позиций в секунду, AlphaZero анализирует лишь 60 000 — но значительно целенаправленнее благодаря своей глубокой нейронной сети. Это достижение убедительно продемонстрировало универсальность и доменную независимость чистого обучения с подкреплением.

Освоил три сложные игры полностью с нуля — только на основе правил, без человеческих знаний или баз данных
Достиг сверхчеловеческого уровня в шахматах (4 ч), сёги (2 ч) и го (~8 ч) посредством чистого самоигры
Обучался через миллионы партий самоигры и обучение с подкреплением без внешних данных
Оценивал лишь 60 000 позиций в секунду против 60 миллионов у Stockfish — но значительно целенаправленнее

Персоны:David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou

Организации:DeepMind, Google, Science Magazine, ArXiv

2018Вехи

Премия Тьюринга за глубокое обучение

В 2019 году ИИ получил высшую награду информатики: премия А.М. Тьюринга 2018 года — нередко именуемая Нобелевской премией по информатике — была присуждена Йошуа Бенжио, Джеффри Хинтону и Яну ЛеКуну, трём крёстным отцам глубокого обучения. Ассоциация вычислительной техники (ACM) отметила их концептуальные и технические прорывы, сделавшие глубокие нейронные сети центральным элементом информатики — от метода обратного распространения ошибки и свёрточных сетей до идей, обеспечивших прорыв 2012 года. Награда стала запоздалым официальным признанием революции, над которой десятилетиями насмехались. Важная оговорка: у глубокого обучения много авторов — такие исследователи, как Юрген Шмидхубер, публично критиковали недостаточную оценку важных вкладов. Премия отмечает центральную роль трио, но не единоличное авторство.

Йошуа Бенжио, Джеффри Хинтон и Ян ЛеКун — три крёстных отца глубокого обучения — за прорывы, лежащие в основе современных нейронных сетей.
Премия А.М. Тьюринга (объявлена в марте 2019 года) является высшей наградой в области информатики; отмечены глубокие нейронные сети как центральный элемент вычислений.
Официальное признание революции глубокого обучения 2012 года — и предвестник Нобелевской премии по физике 2024 года за ту же исследовательскую линию.
Важная оговорка: у глубокого обучения множество авторов (например, Шмидхубер, публично критиковавший недооценку своих работ); премия отмечает центральную роль трио, но не единоличное авторство.

Персоны:Yoshua Bengio, Geoffrey Hinton, Yann LeCun

Организации:ACM

2018Регулирование

GDPR: переломный момент в защите данных с влиянием на ИИ

25 мая 2018 года вступил в силу Общий регламент по защите данных ЕС (GDPR/DSGVO) — переломный момент для ИИ и защиты данных во всём мире. Как 'мать всех законов о защите данных' он заменил устаревшую директиву 95/46/ЕС 1995 года, принятую в эпоху зарождения интернета. GDPR ввёл принцип 'Privacy by Design' как обязательное требование: защита данных должна быть встроена в системы ИИ с самого начала. Глобальный охват регламента оказался весьма широким — даже технологические гиганты США обязаны соблюдать стандарты ЕС при обработке европейских данных. Для ИИ это стало принципиальным вызовом: как объяснить работу алгоритмов-'чёрных ящиков', когда GDPR требует прозрачности? Наблюдатели усмотрели в этом стимул к разработке более экономных с точки зрения данных систем ИИ, а методы вроде Transfer Learning приобрели большее значение. GDPR вдохновил законы о защите данных по всему миру — от Калифорнии до Сингапура. Регламент подготовил почву для Закона об ИИ ЕС 2024 года: от защиты данных к регулированию ИИ был всего один логичный шаг.

Обязательный принцип 'Privacy by Design': защита данных должна быть интегрирована в системы ИИ с самого начала
Вызов прозрачности ИИ: алгоритмы-'чёрные ящики' против требований GDPR об объяснимости
Глобальный охват: даже технологические компании США обязаны соблюдать стандарты ЕС при работе с европейскими данными
Регуляторный образец: вдохновил законы о защите данных по всему миру и проложил путь к Закону об ИИ ЕС

Персоны:EU Parliament, European Commission

Организации:European Union, European Parliament

2018Публикации

GPT-1: рождение генеративного предобучения

Основа всех современных больших языковых моделей — через обучение без учителя. 11 июня 2018 года Алек Рэдфорд с командой OpenAI опубликовал основополагающую статью 'Improving Language Understanding by Generative Pre-Training'. Эта работа впервые объединила архитектуру Transformer с предобучением без учителя и заложила двухэтапную парадигму: сначала генеративное обучение на больших текстовых корпусах, затем дообучение (Fine-Tuning) под конкретные задачи. Располагая 117 миллионами параметров и обучаясь на наборе данных BooksCorpus, включавшем более 7 000 неопубликованных книг различных жанров, GPT-1 доказал, что Transfer Learning работает для понимания языка. Двенадцатислойная архитектура Transformer на основе декодера с маскированным самовниманием (masked self-attention) задала шаблон для всей серии GPT. Это открытие превратило архитектуру Transformer 2017 года в практический инструмент для широкого круга задач обработки естественного языка (NLP) и положило начало эпохе больших языковых моделей.

Утвердило предобучение без учителя на больших текстовых корпусах как основу языковых моделей
Доказало успешное применение Transfer Learning для широкого круга задач обработки естественного языка (NLP)
Двенадцатислойная архитектура Transformer на основе декодера стала шаблоном для всей серии GPT
Положило начало эпохе больших языковых моделей и парадигме предобучение — дообучение

Персоны:Alec Radford, Karthik Narasimhan, Tim Salimans, Ilya Sutskever

Организации:OpenAI

2018Публикации

BERT существенно улучшил понимание языка

Важный прогресс двунаправленных языковых моделей и рождение современной обработки естественного языка (NLP). В октябре 2018 года Джейкоб Девлин и его команда в Google Research опубликовали статью о BERT — Bidirectional Encoder Representations from Transformers (двунаправленные представления кодировщика на основе трансформеров). Эта новаторская разработка существенно изменила обработку языка: впервые были обучены глубокие двунаправленные представления на неразмеченных текстах. В отличие от предыдущих моделей, BERT одновременно учитывает как левый, так и правый контекст во всех слоях. Результат оказался примечательным: BERT достиг новых лучших показателей в одиннадцати задачах NLP и улучшил показатель GLUE на 7,7 процентных пункта — до 80,5%. Само предварительное обучение (Pre-Training) заняло несколько дней на множестве TPU, однако открытая публикация демократизировала передовые технологии: готовую предобученную модель можно было тонко настроить (Fine-Tuning) под собственную задачу примерно за 30 минут на одном облачном TPU. BERT установил парадигму Pre-Training — Fine-Tuning, которая сегодня лежит в основе всех крупных языковых моделей.

Первая глубокая двунаправленная языковая модель, одновременно учитывающая левый и правый контекст во всех слоях
Достигла новых лучших показателей в 11 задачах NLP и улучшила показатель GLUE на 7,7 процентных пункта — до 80,5%
Открытая публикация позволила выполнять тонкую настройку (Fine-Tuning) предобученной модели под собственные задачи примерно за 30 минут на одном облачном TPU
Установила парадигму Pre-Training — Fine-Tuning для всех современных языковых моделей

Персоны:Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

Организации:Google Research, Google AI Language

2019Публикации

GPT-2 - "Слишком опасно для публикации"

В феврале 2019 года OpenAI выпустила GPT-2, но неожиданно решила придержать полную модель с 1,5 миллиарда параметров — якобы «слишком опасную» для полного релиза. Это беспрецедентное решение разделило ИИ-сообщество: сторонники хвалили ответственную позицию перед лицом рисков злоупотребления, таких как фейковые новости и автоматический спам. Критики обвинили OpenAI в «закрытии» исследований и раздувании необоснованных страхов. Через девять месяцев без серьёзных свидетельств злоупотреблений OpenAI выпустила полную модель, отметив поворотный момент в дебатах об ответственной разработке ИИ.

Беспрецедентное решение: OpenAI придерживает полную модель с 1,5B параметров
Опасения по поводу фейковых новостей, кражи личности и автоматического спама в соцсетях
ИИ-сообщество разделилось: прогресс этики vs обвинение в закрытии исследований
Через 9 месяцев полный релиз из-за отсутствия доказательств злоупотреблений

Персоны:Alec Radford, Jeffrey Wu, Rewon Child, David Luan

Организации:OpenAI

2019Соревнования

AlphaStar достигает уровня гроссмейстера

Завоевание самой сложной стратегии в реальном времени искусственным интеллектом. В июле и августе 2019 года AlphaStar компании DeepMind анонимно участвовал в рейтинговых матчах на Battle.net; 30 октября 2019 года DeepMind сообщил в журнале Nature, что система стала первым ИИ, достигшим уровня гроссмейстера в StarCraft II — игре, которая считалась слишком сложной для машин. AlphaStar превзошёл более 99,8% всех активных игроков Battle.net и освоил все три расы: Протоссов, Терранов и Зергов. Ранее AlphaStar уже победил профессиональных игроков Гжегожа 'MaNa' Кэминча и Дарио 'TLO' Вюнша со счётом 5:0 каждого. Особенностью стала архитектура многоагентного обучения с подкреплением (Multi-Agent Reinforcement Learning), обучавшая различные стратегии и контрстратегии в рамках лиги. Совершая в среднем 280 действий в минуту, AlphaStar оставался даже ниже показателей профессиональных игроков-людей, однако демонстрировал более точное исполнение. Это достижение стало важной вехой для ИИ в видеоиграх и принятии решений в реальном времени.

AlphaStar достиг уровня гроссмейстера во всех трёх расах StarCraft II и превзошёл более 99,8% всех игроков Battle.net
Победил профессиональных игроков MaNa и TLO со счётом 5:0 каждого ещё до публичного успеха
Многоагентное обучение с подкреплением (Multi-Agent Reinforcement Learning) с лиговым обучением различных стратегий и контрстратегий
Первый ИИ, освоивший популярную киберспортивную игру без ограничений на высшем уровне

Персоны:Oriol Vinyals, Igor Babuschkin, Wojciech Czarnecki, Grzegorz Komincz, Dario Wünsch

Организации:DeepMind, Team Liquid, Blizzard Entertainment, Battle.net

2019Публикации

T5 — Text-to-Text Transfer Transformer

В октябре 2019 года Google AI существенно изменил NLP с помощью T5, Text-to-Text Transfer Transformer, который преобразует все задачи обработки языка в единый формат «текст-в-текст». С инновационным подходом «Everything is Text» перевод, резюмирование, ответы на вопросы и классификацию можно выполнять одной моделью, одной функцией потерь и одними гиперпараметрами. T5 вводит обширный датасет C4 и достигает почти человеческой производительности на бенчмарках SuperGLUE. Как базовая модель с до 11 миллиардами параметров, T5 прокладывает путь для современных больших языковых моделей и утверждает единую парадигму текст-в-текст как стандарт.

Инновационный единый подход: все NLP-задачи как проблема текст-в-текст
Парадигма «Everything is Text» унифицирует перевод, резюмирование, Q&A
Утверждает парадигму базовых моделей для современных больших языковых моделей
Вводит обширный датасет C4 — Colossal Clean Crawled Corpus

Персоны:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee

Организации:Google AI, Google Research

2020Публикации

RAG: языковые модели с внешней памятью

Языковая модель знает лишь то, что содержалось в её обучающих данных, — и при неопределённости уверенно что-то придумывает. В 2020 году Патрик Льюис и его коллеги из Facebook AI предложили выход: Retrieval-Augmented Generation, сокращённо RAG (генерация с поиском и дополнением). Идея подкупает своей простотой. Прежде чем модель ответит, она ищет в внешнем источнике знаний — например, в Википедии — подходящие фрагменты текста и опирает ответ на найденное. Это позволяет обновлять знания без переобучения модели, а ответ становится проверяемым. После успеха ChatGPT RAG превратился в стандартный метод привязки языковых моделей к актуальным, проверяемым источникам — основу почти всех приложений, позволяющих общаться с собственными документами. Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их. Если найденное содержит ошибки или модель неверно его интерпретирует, ошибки сохраняются. Метод даёт ссылки, но не настоящее понимание — и опирается на более ранние исследования в области поиска информации.

В 2020 году Патрик Льюис и коллеги из Facebook AI представили метод Retrieval-Augmented Generation (RAG) — генерацию с поиском и дополнением.
Вместо того чтобы отвечать только из памяти, языковая модель сначала находит подходящие документы (например, из Википедии) и опирает на них свой ответ.
После ChatGPT RAG стал стандартным методом привязки языковых моделей к актуальным, проверяемым источникам — основой почти всех приложений для общения с собственными документами.
Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их — если найденное ошибочно или неверно понято, модель всё равно ошибается. Метод даёт ссылки, но не настоящее понимание, и опирается на более ранние исследования в области поиска (например, DPR, REALM).

Персоны:Patrick Lewis

Организации:Facebook AI Research, University College London, New York University

2020Публикации

Законы масштабирования нейросетей

Джаред Каплан, Сэм МакКандлиш, Том Браун и Дарио Амодеи в январе 2020 года открыли фундаментальные математические законы масштабирования нейросетей и тем самым существенно изменили разработку больших языковых моделей. Основополагающая работа OpenAI и Университета Джонса Хопкинса показала, что производительность подчиняется степенным законам в зависимости от размера модели, объёма набора данных и вычислительной мощности — с трендами, охватывающими семь порядков величины. Элегантные уравнения впервые позволили систематически прогнозировать распределение ресурсов и утвердили парадигму 'чем больше — тем лучше'. Эти математические основы непосредственно привели к успеху GPT-3 и преобразовали разработку ИИ: от экспериментального метода проб и ошибок к научно обоснованному, предсказуемому масштабированию. Конкретное правило распределения ресурсов по Каплану — активно масштабировать размер модели при слабом увеличении объёма данных — было скорректировано в 2022 году статьёй Chinchilla от DeepMind: оптимальное по вычислениям обучение требует значительно большего объёма обучающих данных, чем рекомендовалось изначально.

Открытие фундаментальных степенных законов, охватывающих семь порядков величины
Элегантные уравнения позволяют систематически прогнозировать распределение ресурсов; в 2022 году уточнены работой Chinchilla
Утверждает парадигму 'чем больше — тем лучше' для систематической разработки больших языковых моделей
Преобразует разработку ИИ от метода проб и ошибок к научной методологии

Персоны:Jared Kaplan, Sam McCandlish, Tom Brown, Dario Amodei

Организации:OpenAI, Johns Hopkins University

2020Публикации

GPT-3: модель с 175 миллиардами параметров

Прорыв к обучению с несколькими примерами (Few-Shot Learning) и проявляющимся способностям ИИ. 28 мая 2020 года команда OpenAI под руководством Тома Брауна представила значимую статью 'Language Models are Few-Shot Learners' — GPT-3 со 175 миллиардами параметров, более чем в 100 раз превышающей GPT-2. Масштабирование выявило проявляющиеся способности: модель могла решать новые задачи лишь с несколькими примерами, без дообучения. От переводов до словесных головоломок и трёхзначной арифметики GPT-3 демонстрировал впечатляющую универсальность. Оценщики-люди едва могли отличить написанные GPT-3 новостные статьи от настоящих. Только за счёт обучения в контексте (In-Context Learning) GPT-3 приближался к передовому уровню на отдельных подзадачах SuperGLUE — однако на общем тесте набирал около 71,8 балла, заметно уступая дообученным лидирующим моделям (около 89). 31 исследователь OpenAI (Том Браун и 30 соавторов) доказали: масштабное увеличение числа параметров способно порождать качественно новые возможности. GPT-3 заложил фундамент для ChatGPT и современной эпохи больших языковых моделей.

175 миллиардов параметров — более чем в 100 раз больше GPT-2 со значительными эффектами масштабирования
Проявляющиеся способности Few-Shot без дообучения: новые задачи решаются с несколькими примерами
Продемонстрировал проявляющиеся способности: перевод, арифметика, генерация текста на человеческом уровне
Заложил фундамент для ChatGPT и коммерциализировал большие языковые модели через доступ по API

Персоны:Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah

Организации:OpenAI

2020Публикации

DDPM: Диффузионные модели утверждены

Математическая основа современной генерации изображений через процессы шумоподавления. В июне 2020 года Джонатан Хо, Аджай Джейн и Питер Эббил опубликовали влиятельную статью «Denoising Diffusion Probabilistic Models» — класс латентных переменных моделей, вдохновлённый неравновесной термодинамикой. Их инновация заключалась во взвешенной вариационной границе и связи между диффузионными моделями и Denoising Score Matching с динамикой Ланжевена. Результаты были впечатляющими: показатель FID 3,17 на CIFAR-10 и показатель Inception 9,46. DDPM установили прогрессивный подход с потерями при декомпрессии, который можно интерпретировать как обобщение авторегрессивного декодирования. Эта работа заложила математический фундамент для Stable Diffusion и всей современной генерации изображений из текста.

Новый класс генеративных моделей, основанных на неравновесной термодинамике и процессах шумоподавления
Прогрессивный подход с потерями при декомпрессии как обобщение авторегрессивного декодирования
Заложил математический фундамент для Stable Diffusion и современной генерации изображений из текста
FID-показатель 3,17 на CIFAR-10 продемонстрировал качество изображений, сопоставимое с GAN, и утвердил диффузию как стандарт

Персоны:Jonathan Ho, Ajay Jain, Pieter Abbeel

Организации:UC Berkeley

2020Публикации

Vision Transformer: 'An Image is Worth 16x16 Words'

Архитектура Transformer в компьютерном зрении. 22 октября 2020 года команда Алексея Досовицкого в Google Research опубликовала статью 'An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale'. Vision Transformer (ViT) показал, что свёрточные нейронные сети (CNN) не обязательны — чистые Transformer могут напрямую применяться к последовательностям фрагментов изображения. Ключевой вывод ('at Scale'): лишь после масштабного предварительного обучения на огромных наборах данных (ImageNet-21k или JFT-300M) ViT достигает сравнимых или лучших результатов, чем современные CNN; на наборах среднего размера без такого предобучения ViT показывает более слабые результаты. Система разбивает изображения на фрагменты — как правило, 16x16 пикселей, хотя в зависимости от варианта размер может меняться — обрабатывает их как последовательности токенов и применяет стандартную архитектуру Transformer. Универсальность архитектуры Transformer стала очевидна: та же технология, которая изменила обработку естественного языка, работает и в компьютерном зрении. ViT вдохновил новое поколение моделей компьютерного зрения на основе механизма внимания и продемонстрировал мощь унифицированных архитектур.

Первое масштабируемое, основанное на фрагментах применение чистой архитектуры Transformer в компьютерном зрении без компонентов CNN
Фрагменты изображения (как правило, 16x16 пикселей) обрабатываются как последовательности токенов, что изменило подход к преобразованию изображения в последовательность
Self-Attention для обработки изображений доказал универсальность архитектуры Transformer
После масштабного предварительного обучения достиг уровня современных CNN и вдохновил модели компьютерного зрения на основе механизма внимания

Персоны:Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov

Организации:Google Research, Google Brain

2020Прорывы

Успех AlphaFold

Решение 50-летней биологической загадки с помощью искусственного интеллекта. В ноябре 2020 года AlphaFold 2 от DeepMind доминировал на соревновании CASP14 с точностью, которую учёные назвали «поразительной» и «трансформационной». Система достигла показателя GDT 92,4 из 100 баллов в предсказании структуры белков — точность, сравнимая с экспериментальными методами вроде рентгеновской кристаллографии. При этом AlphaFold значительно превзошёл 145 других команд, решив проблему, над которой биология билась с 1970-х годов. Архитектура нейронной сети на основе механизма внимания может за несколько дней предсказать, как сворачиваются белки — процесс, фундаментальный для понимания жизни. За это достижение Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года.

AlphaFold 2 доминировал на CASP14 с показателем GDT 92,4 и значительно превзошёл 145 других команд
Решил 50-летнюю проблему укладки белков и фундаментально изменил структурную биологию
Архитектура на основе механизма внимания достигла экспериментальной точности в предсказании структуры белков
Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года за это достижение

Персоны:Demis Hassabis, John Jumper

Организации:DeepMind, Google, CASP, University of Washington

2021Прорывы

CLIP: мост между изображением и языком

В тот же день, когда OpenAI представила DALL-E — 5 января 2021 года, — вышла, пожалуй, более значимая модель: CLIP. Она не генерировала изображения, а обучалась понимать картинку и текст в едином пространстве. Команда Алека Радфорда обучила два энкодера контрастным методом на примерно 400 миллионах пар изображение — текст из интернета, пока связанные изображения и подписи к ним не оказались в одной точке общего векторного пространства. Эффект оказался поразительным: CLIP мог классифицировать изображения в режиме zero-shot — категории просто описывались словами, без какого-либо обучения на конкретной задаче. Так модель достигла 76,2 % на ImageNet — наравне с ResNet-50, обученной на 1,28 миллиона размеченных примеров, — хотя CLIP не видел ни одного из них. Для общей картины это принципиально: CLIP стал фундаментом волны генерации изображений по тексту — DALL-E 2 опирается на эмбеддинги CLIP, а Stable Diffusion напрямую использует его текстовый энкодер. Если быть точным: контрастивные модели 'изображение — текст' уже существовали (ConVIRT вышел месяцами раньше) — вклад CLIP заключался в масштабе, ширине zero-shot и открытых весах, которые запустили целую экосистему.

Контрастивное обучение: два энкодера (изображение + текст) обучаются на примерно 400 млн веб-парах, чтобы помещать связанные изображения и тексты в одно векторное пространство.
Zero-shot: категории описываются словами, обучение на конкретной задаче не нужно — 76,2 % на ImageNet, наравне с ResNet-50, которой потребовалось 1,28 млн размеченных изображений.
Фундамент волны генерации изображений по тексту: DALL-E 2 опирается на эмбеддинги CLIP, Stable Diffusion напрямую использует его текстовый энкодер.
Контрастивные модели 'изображение — текст' уже существовали (ConVIRT, окт. 2020). Вклад CLIP: масштаб, ширина zero-shot, открытые веса — но вместе с ними и предвзятость веб-данных.

Персоны:Alec Radford, Jong Wook Kim, Ilya Sutskever

Организации:OpenAI

2021Продукты

DALL-E создаёт изображения из текста

Важный прорыв в генерации изображений по тексту и значительный прогресс в области творческих возможностей ИИ. 5 января 2021 года OpenAI представила DALL-E — систему, которая создаёт связные и нередко поразительно креативные изображения на основе текстовых описаний. Модели преобразования текста в изображение существовали и прежде (например, alignDRAW в 2015 году или подходы на основе GAN — StackGAN и AttnGAN), однако DALL-E подняла связность и универсальность на принципиально новый уровень. Основанная на версии GPT-3 с 12 миллиардами параметров, DALL-E доказала, что границу между пониманием языка и восприятием изображений можно преодолеть. Система обучалась на 250 миллионах пар 'изображение — текст' из интернета и в результате приобрела примечательные способности: очеловечивать животных, правдоподобно объединять несвязанные концепции и даже воспроизводить текст в изображениях. Марк Ридль из Технологического института Джорджии отметил, что результаты 'поразительно более связны', чем у всех прежних систем преобразования текста в изображение. DALL-E успешно расширила языковое понимание GPT на область зрительного восприятия и открыла принципиально новое измерение творческих возможностей ИИ.

Подняла генерацию изображений по тексту на новый уровень — связные, креативные изображения из описаний на естественном языке (предшественники наподобие alignDRAW или StackGAN уже существовали)
Проявила поразительные творческие способности: очеловечивание персонажей, объединение концепций, воспроизведение текста
Версия GPT-3 с 12 миллиардами параметров, обученная на 250 миллионах пар 'изображение — текст' из интернета
Открыла новое измерение творческих возможностей ИИ и вдохновила движение генеративного ИИ

Персоны:Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray

Организации:OpenAI, DALL-E Team

2021Вехи

Основание Anthropic

Бывшие руководители OpenAI решили воплотить собственное видение безопасного ИИ. В январе 2021 года Дарио и Даниэла Амодеи вместе с пятью другими бывшими исследователями OpenAI — в том числе Томом Брауном, Джаредом Капланом и Крисом Ола — основали Anthropic; всего семь сооснователей. Брат и сестра ранее занимали ключевые должности в OpenAI — Дарио в должности вице-президента по исследованиям. Их новая компания должна была сосредоточиться на безопасности ИИ и разработке надёжных, интерпретируемых систем. С помощью Constitutional AI компания Anthropic разработала инновационный подход к обучению ИИ-систем на основе принципов, а не только человеческой обратной связи. Claude, их ИИ-ассистент, стал одним из ведущих конкурентов ChatGPT.

Основана в январе 2021 года в Сан-Франциско
Дарио Амодеи (генеральный директор, бывший вице-президент по исследованиям в OpenAI) и Даниэла Амодеи (президент) — часть команды из семи сооснователей
Фокус на безопасности ИИ, интерпретируемости и Constitutional AI
Разработала Claude — одного из ведущих ИИ-ассистентов

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Jared Kaplan, Sam McCandlish, Jack Clark, Chris Olah

Организации:Anthropic, OpenAI

2021Продукты

GitHub Copilot: ИИ-парный программист

Демократизация ИИ-разработки программного обеспечения для миллионов разработчиков. 29 июня 2021 года GitHub анонсировал Technical Preview Copilot — первого ИИ-парного программиста на базе OpenAI Codex. Основанный на варианте GPT-3, обученном на миллиардах строк публичного кода из репозиториев GitHub, Copilot мог генерировать автодополнения кода и целые функции из комментариев. Базовая модель Codex достигла 28,8% успеха с первой попытки в бенчмарке HumanEval — значительно лучше GPT-3 с 0%. Особенно впечатляюще: со 100 попытками семплирования успешность выросла до 70,2%. Copilot особенно хорошо работал с Python, JavaScript, TypeScript, Ruby и Go. Ограниченный Technical Preview вызвал огромный интерес и утвердил ИИ-программирование как практичный инструмент. Copilot фундаментально изменил опыт разработчиков и проложил путь новому поколению ИИ-инструментов для программирования.

Technical Preview 29 июня 2021 с ограниченным доступом через список ожидания для избранных разработчиков
На базе OpenAI Codex, обученного на миллиардах строк кода из публичных GitHub-репозиториев
28,8% успеха с первой попытки (HumanEval), 70,2% со 100 попытками семплирования
Утвердил ИИ-программирование как практичный инструмент и вдохновил новые инструменты кодирования

Персоны:Nat Friedman, GitHub Team, OpenAI Team

Организации:GitHub, OpenAI, Microsoft

2021Продукты

OpenAI Codex: ИИ программирует для людей

10 августа 2021 года OpenAI опубликовала Codex через API и существенно изменила разработку программного обеспечения — масштабная система ИИ для генерации кода. Основанный на GPT-3, но обученный на 159 гигабайтах кода Python из 54 миллионов репозиториев GitHub, Codex преобразовывал естественный язык в работоспособный код. 'Создай функцию для простых чисел' превращалось в реальный код Python за считанные секунды. Ещё раньше, 29 июня 2021 года, из партнёрства с GitHub появился Technical Preview Copilot — ИИ-ассистент программирования, уже работавший на ранней версии Codex. Codex владел более чем дюжиной языков программирования: Python, JavaScript, Go, Ruby, Swift и другими. В бенчмарке HumanEval точно настроенная модель Codex-S решала около 37 % задач с первой попытки (pass@1) — базовая модель справлялась примерно с 29 %; впечатляет, но не является меркой для произвольных запросов. GitHub Copilot оказался значительным инструментом повышения производительности для разработчиков. Codex доказал: ИИ способен поддерживать творческую, когнитивно сложную работу. От генерации кода к его пониманию — Codex открыл дверь в разработку программного обеспечения с поддержкой ИИ.

Естественный язык в код: 'Напиши функцию сортировки' превращается в работоспособный Python/JavaScript
GitHub Copilot (Technical Preview с 29 июня 2021 года): ведущий ИИ-ассистент программирования, обученный на 54 миллионах репозиториев кода
12+ языков программирования: от Python до Swift — ИИ понимает намерения разработчика на естественном языке
Заметный прирост производительности: Codex доказал потенциал ИИ для творческой когнитивной работы

Персоны:OpenAI Team, GitHub Development Team

Организации:OpenAI, GitHub, Microsoft

2022Публикации

InstructGPT: мост к ChatGPT

Между методом и мировым успехом пролегал решающий промежуточный шаг — и он назывался InstructGPT. В начале 2022 года OpenAI показала в статье 'Training language models to follow instructions with human feedback', как заставить GPT-3 действительно делать то, чего хотят пользователи: с помощью обучения с подкреплением на основе обратной связи от людей (RLHF). Поразительный результат: InstructGPT с 1,3 миллиарда параметров люди предпочитали ответам GPT-3 в сто раз большего размера (175 миллиардов параметров). Разницу определяла не грубая величина, а согласованность с намерением. InstructGPT стал прямым техническим мостом между идеей RLHF (2017) и ChatGPT, который в конце 2022 года сделал этот метод широко известным. Если подходить честно: InstructGPT не изобрёл RLHF — это сделала статья 2017 года, — но именно InstructGPT впервые показал в большом масштабе, насколько согласованность делает языковую модель полезнее.

OpenAI применила RLHF (обучение с подкреплением на основе обратной связи от людей) к GPT-3, чтобы модель следовала инструкциям и соответствовала намерениям пользователей.
Поразительно: InstructGPT с 1,3 млрд параметров люди предпочитали GPT-3 в 100 раз большего размера (175 млрд) — согласованность побеждает грубую величину.
Прямой мост между идеей RLHF (2017) и ChatGPT (конец 2022) — именно это объясняет, почему ChatGPT так хорошо работал.
InstructGPT не изобрёл RLHF (это сделала статья 2017 года); он впервые показал в большом масштабе, насколько согласованность делает модель полезнее.

Персоны:Long Ouyang

Организации:OpenAI

2022Публикации

Chinchilla: масштабирование осмыслено заново

В 2022 году DeepMind задала неудобный вопрос: а не строим ли мы свои ИИ-модели неправильно? В статье 'Training Compute-Optimal Large Language Models' команда под руководством Джордана Хоффмана показала, что крупнейшие языковые модели того времени — GPT-3, Gopher — имели множество параметров, но слишком мало обучающих данных. Предложенная ими корректировка, сегодня известная как законы масштабирования Chinchilla: при заданном вычислительном бюджете размер модели и объём данных должны расти примерно в одном темпе. В качестве доказательства они обучили Chinchilla с 70 миллиардами параметров на 1,4 триллиона токенов — и превзошли вчетверо большую модель Gopher (280 миллиардов). Это изменило подход к обучению практически каждой последующей ведущей модели. Если подходить честно: Chinchilla не изобрела законы масштабирования, а скорректировала более ранние законы Каплана (2020); более поздние модели вроде Llama намеренно выходили за пределы оптимального по вычислениям соотношения ради повышения эффективности при использовании.

Законы масштабирования Chinchilla: при фиксированном вычислительном бюджете размер модели и обучающие данные должны расти примерно в одном темпе.
Крупнейшие модели (GPT-3, Gopher) были избыточны по параметрам и недостаточно обучены на данных. Chinchilla (70 млрд, 1,4 трлн токенов) превзошла вчетверо большую Gopher (280 млрд).
Изменила подход к обучению практически каждой последующей ведущей модели (соотношение данных и параметров); повлияла в том числе на Llama.
Chinchilla не изобрела законы масштабирования, а скорректировала Каплана (2020); более поздние модели намеренно превышают оптимальное соотношение ради большей эффективности при использовании.

Персоны:Jordan Hoffmann

Организации:Google DeepMind

2022Продукты

PaLM: гигантская языковая модель Google на 540 миллиардов параметров

В 2022 году Google продемонстрировал, насколько высоко можно масштабировать языковые модели: PaLM (Pathways Language Model) насчитывал 540 миллиардов параметров и обучался с помощью системы Pathways на тысячах TPU-чипов. Впечатляло не столько огромное число параметров, сколько то, на что PaLM оказался способен. С так называемыми подсказками цепочки мыслей (Chain-of-Thought Prompts), при которых модель записывает своё рассуждение шаг за шагом, PaLM решал многоэтапные текстовые задачи и даже объяснял суть анекдотов. PaLM стал символом идеи эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели. Это был апогей эпохи масштабирования Google и предтеча PaLM 2 и Gemini. Важная оговорка: 540 миллиардов параметров были чрезвычайно дорогостоящими, и PaLM так и не был опубликован как открытая модель. Тезис об эмерджентных способностях также вызывает споры — некоторые подобные скачки отчасти являются артефактом выбранной метрики измерения.

В 2022 году Google представил PaLM — языковую модель с 540 миллиардами параметров, обученную на тысячах TPU-чипов.
PaLM блеснул в многоэтапном рассуждении: с подсказками цепочки мыслей (Chain-of-Thought) он решал текстовые задачи и даже объяснял анекдоты.
Это поддержало идею эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели.
Важная оговорка: 540 миллиардов параметров обходились крайне дорого, и PaLM так и не был опубликован в открытом доступе. Тезис об эмерджентных способностях спорен — некоторые скачки отчасти являются артефактом метрики измерения (Schaeffer и др., 2023).

Организации:Google

2022Продукты

Stable Diffusion: генерация изображений с открытым кодом

Демократизация ИИ-генерации изображений благодаря первой мощной модели с открытым исходным кодом. 22 августа 2022 года Stability AI выпустила Stable Diffusion и существенно изменила доступ к продвинутой технологии преобразования текста в изображение. Как первая модель своего класса с открытым кодом, Stable Diffusion могла генерировать фотореалистичные изображения 512x512 пикселей на потребительских GPU — важный прогресс для скорости и доступности. Основанная на латентных диффузионных моделях (LDM), система итеративно «удаляет шум» в латентных пространствах вместо прямой манипуляции пикселями. С 860 миллионами параметров в U-Net и 123 миллионами в текстовом энкодере она оставалась относительно лёгкой несмотря на высокую производительность. Исходный код на GitHub позволил взрывообразно растущему сообществу разрабатывать бесчисленные варианты и инструменты. Stable Diffusion разрушила монополию проприетарных систем и сделала высококачественную ИИ-генерацию изображений доступной для каждого.

Первая мощная модель преобразования текста в изображение с открытым кодом и исходным кодом на GitHub
Латентные диффузионные модели с итеративным удалением шума в латентных пространствах вместо прямой манипуляции пикселями
Взрывообразный рост сообщества с бесчисленными вариантами, инструментами и приложениями
Разрушила монополию проприетарных систем и демократизировала высококачественную ИИ-генерацию изображений

Персоны:Emad Mostaque, Robin Rombach, Andreas Blattmann

Организации:Stability AI, CompVis, Runway

2022Прорывы

OpenAI выпускает Whisper

Когда распознавание речи наконец стало надёжным — и доступным для всех. 21 сентября 2022 года OpenAI выпустила Whisper — систему распознавания речи, обученную работать устойчиво с различными языками, акцентами и фоновыми шумами. В отличие от ранних систем, обучавшихся на чистых аудиоданных, Whisper использовал 680 000 часов многоязычных данных из интернета. Результат — система, способная транскрибировать речь на 99 языках и конкурирующая с коммерческими решениями. OpenAI сделала Whisper общедоступным в виде открытого исходного кода — подарок разработчикам по всему миру, открывший возможности для бесчисленных приложений.

Выпущен 21 сентября 2022 года как программное обеспечение с открытым исходным кодом
Охватывает 99 языков и уверенно транскрибирует речь даже с акцентами и фоновыми шумами — наиболее точен в английском, поскольку большая часть обучающих данных на английском
Обучен на 680 000 часах многоязычных аудиоданных из интернета
Демократизировал высококачественное распознавание речи благодаря открытому исходному коду

Персоны:Alec Radford, Jong Wook Kim, Tao Xu

Организации:OpenAI

2022Продукты

ChatGPT обозначил поворотный момент в использовании ИИ

Момент, когда ИИ стал доступен всем и началась новая эра. 30 ноября 2022 года OpenAI выпустила ChatGPT как бесплатный Research Preview — без масштабного маркетинга и с минимальными ожиданиями. То, что последовало, превзошло все прогнозы: через 5 дней ChatGPT достиг 1 миллиона пользователей, а через два месяца — 100 миллионов. Это был тогда самый быстрый рост аудитории, который когда-либо демонстрировало потребительское приложение (в июле 2023 года этот рекорд побил Threads от Meta). Основанный на GPT-3.5, ChatGPT впервые открыл широкой аудитории прямой доступ к мощной системе ИИ без технических барьеров. Кевин Рус из New York Times назвал его 'лучшим ИИ-чат-ботом, когда-либо выпущенным для широкой публики'. ChatGPT демократизировал искусственный интеллект и превратил исследовательскую область в инструмент повседневного использования. Этот выпуск ознаменовал начало нынешней волны генеративного ИИ.

30 ноября 2022 года стал доступен широкой публике как бесплатный Research Preview
Достиг 1 миллиона пользователей за 5 дней, 100 миллионов — за 2 месяца; тогда это был самый быстрый рост потребительского приложения (впоследствии превзойдённый Threads)
Первый мощный ИИ без технических барьеров — прямой веб-доступ для любого пользователя интернета
Демократизировал ИИ и дал толчок нынешней волне генеративного ИИ в обществе и экономике

Персоны:Sam Altman, Greg Brockman, Ilya Sutskever, John Schulman

Организации:OpenAI, Microsoft, ChatGPT

2022Публикации

Constitutional AI — безопасность ИИ через принципы

В декабре 2022 года компания Anthropic представила Constitutional AI (CAI) — новый метод разработки безвредных, полезных и честных систем ИИ. 'Конституция' из этических принципов позволяет ИИ самостоятельно критиковать и улучшать собственные ответы на вредоносный контент — без необходимости использовать человеческую разметку именно для оценки вреда. (Явную привязку этих принципов к Всеобщей декларации прав человека ООН и другим основополагающим документам Anthropic описала лишь в мае 2023 года в 'Claude's Constitution'; в исходной статье применялся прагматично составленный набор принципов.) Новаторский метод RLAIF (Reinforcement Learning from AI Feedback — обучение с подкреплением на основе обратной связи от ИИ) заменяет человеческую обратную связь лишь применительно к безвредности — посредством самокритики ИИ; полезность же по-прежнему обучается на основе человеческих предпочтений (RLHF). Таким образом, CAI устанавливает подход 'безопасность прежде всего' как альтернативу чисто производительностному подходу ChatGPT и прокладывает путь к ответственной разработке ИИ.

ИИ самостоятельно критикует и улучшает свои ответы на вредоносный контент — без человеческой разметки для этой оценки
Альтернатива 'безопасность прежде всего' по отношению к чисто производительностным подходам наподобие ChatGPT
Тройная цель: полезный, честный и безвредный — через этические принципы
RLAIF: Reinforcement Learning from AI Feedback заменяет человеческие оценки при обеспечении безвредности (полезность по-прежнему обучается через RLHF)

Персоны:Yuntao Bai, Andy Jones, Kamal Ndousse, Dario Amodei, Anthropic Team

Организации:Anthropic

2023Регулирование

Система NIST AI: США определяют стандарты надёжного ИИ

26 января 2023 года Национальный институт стандартов и технологий США (NIST) опубликовал первую комплексную систему управления рисками ИИ (AI RMF 1.0) — ответ Америки на глобальное регулирование искусственного интеллекта. После 18 месяцев разработки при участии более 240 организаций из промышленности, науки и гражданского общества NIST впервые определил федеральные стандарты надёжного ИИ. Система устанавливает четыре основные функции: Govern, Map, Measure, Manage — и семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный. Как добровольный стандарт, он призван минимизировать риски ИИ для отдельных людей, организаций и общества. Публикация последовала за Сводом прав ИИ Байдена (2022) и была дополнена его указом об ИИ (октябрь 2023 года). AI RMF был создан по поручению Национального закона об инициативе в области ИИ 2020 года — NIST продолжил свою устоявшуюся роль федерального органа по стандартизации. Система стала основой для отраслевых стандартов и международной координации — противовесом государственному контролю над ИИ в Китае и регуляторному подходу Европы.

Четыре основные функции: Govern, Map, Measure, Manage для систематического управления рисками ИИ
Семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный
Добровольный многосторонний подход: более 240 организаций совместно разработали стандарты
Федеральный орган по стандартизации: NIST разработал AI RMF по поручению Национального закона об инициативе в области ИИ 2020 года

Персоны:NIST AI Team, 240+ Contributing Organizations

Организации:NIST, US Department of Commerce, Biden Administration

2023Продукты

LLaMA: открытая базовая языковая модель

Демократизация больших языковых моделей через открытые исследовательские модели. 24 февраля 2023 года Meta AI опубликовала LLaMA (Large Language Model Meta AI) — набор базовых моделей от 7B до 65B параметров, обученных исключительно на общедоступных данных. Основополагающая статья 'LLaMA: Open and Efficient Foundation Language Models' доказала, что результаты уровня state-of-the-art достижимы без проприетарных наборов данных. LLaMA открыла исследователям без доступа к крупной инфраструктуре возможность изучать передовые языковые модели. Код вывода был опубликован под лицензией GPLv3, тогда как доступ к весам модели предоставлялся в отдельных случаях исключительно для академических исследований. Благодаря обучению на триллионах токенов и различным размерам моделей LLaMA отвечала разным аппаратным требованиям. Эта работа катализировала волну открытых исследований в области больших языковых моделей и вдохновила многочисленные производные модели в сообществе открытого программного обеспечения.

Код вывода под лицензией GPLv3; веса модели предоставлялись в отдельных случаях исключительно для некоммерческих исследований
Модели от 7B до 65B параметров, обученные исключительно на общедоступных наборах данных
Открыла исследователям без крупной инфраструктуры возможность изучать передовые языковые модели
Различные размеры моделей для различных аппаратных требований и исследовательских задач

Персоны:Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet

Организации:Meta AI, FAIR

2023Продукты

Claude и Constitutional AI

Представление ИИ со встроенной системой ценностей и этическими принципами. В марте 2023 года Anthropic представила Claude — ИИ-ассистента на базе Constitutional AI, который установил новый подход к безопасности ИИ. В отличие от традиционных систем, Claude обучается двухфазным методом: сначала модель критикует и улучшает свои собственные ответы на основе конституции из этических принципов, затем улучшается через обратную связь, генерируемую ИИ — без человеческих оценок для предотвращения вреда. Результат — система, которая действует одновременно полезно и безвредно. Anthropic одновременно выпустила Claude и Claude Instant, причём последний представляет более быструю и экономичную версию. Метод Constitutional AI оказался улучшением по Парето по сравнению с человеческой обратной связью и открыл новые пути для масштабируемого контроля ИИ.

Фреймворк Constitutional AI с двухфазным обучением: самокритика на основе этических принципов, затем улучшение на основе ИИ-обратной связи
Новый подход к безопасности без человеческих оценок вреда — исключительно через ИИ-супервизию
Одновременный выпуск Claude и Claude Instant для различных требований к приложениям
Установил «helpful, harmless, honest» как центральные ценности ответственной разработки ИИ

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Chris Olah

Организации:Anthropic, Constitutional AI, AI Safety

2023Продукты

GPT-4: мультимодальная модель ИИ

Прорыв к человеческому уровню в профессиональных и академических тестах. 14 марта 2023 года OpenAI представил GPT-4 — большую мультимодальную модель (Large Multimodal Model), обрабатывающую текстовые и графические данные и достигающую человеческого уровня в различных дисциплинах. Улучшения были существенными: если GPT-3.5 сдавал экзамен на право занятия адвокатской практикой (Bar Exam) в нижних 10 %, то GPT-4 достиг верхних 10 %. На тесте SAT по математике результат вырос с 70-го до 89-го перцентиля. После шести месяцев итеративного выравнивания с учётом результатов программы тестирования на устойчивость к атакам (adversarial testing) и обратной связи от ChatGPT весь стек глубокого обучения был выстроен заново. Мультимодальные возможности позволяют обрабатывать документы, диаграммы и скриншоты с тем же качеством, что и чисто текстовые запросы. GPT-4 установил новые стандарты безопасности и производительности ИИ.

Большая мультимодальная модель с текстовыми и графическими данными, возможностями компьютерного зрения для документов и диаграмм
Bar Exam — верхние 10 % против нижних 10 % у GPT-3.5; SAT по математике — рост с 70-го до 89-го перцентиля
6 месяцев итеративного выравнивания с adversarial testing и обратной связью ChatGPT для повышения безопасности
Интеграция в ChatGPT Plus сделала передовой мультимодальный ИИ доступным для широкой аудитории

Персоны:Sam Altman, OpenAI Team

Организации:OpenAI

2023Продукты

Midjourney V5: фотореалистичное ИИ-искусство

Фотореалистичная генерация изображений с помощью ИИ достигает нового уровня качества и существенно меняет творческую индустрию. 15 марта 2023 года Midjourney выпустила версию 5, сделав качественный скачок, который пользователи описывали как 'пугающий' и 'слишком совершенный'. Альфа-версия впервые позволила создавать фотореалистичные изображения, практически неотличимые от настоящих фотографий. Особенно примечательно: хроническая проблема с некорректным изображением рук была существенно улучшена — в большинстве случаев V5 правильно отображала пять пальцев. Графический дизайнер Джули Виланд сравнила этот опыт с 'тем, как наконец надеть очки после того, как слишком долго мирился с плохим зрением' — вдруг всё видишь в качестве 4K [источник: Ars Technica, март 2023]. Улучшенная чувствительность к запросам (промптам) обеспечила более точный творческий контроль, а автоматическое масштабирование позволяло увеличивать базовые изображения размером 1024x1024 пикселей без дополнительных затрат на GPU. V5 вызвала интенсивные дискуссии о будущем человеческого творчества.

Фотореалистичное качество изображений, практически неотличимых от настоящих фотографий
Вызвала интенсивную реакцию в творческом сообществе — от восторга до экзистенциальных опасений
Существенно улучшила ИИ-арт благодаря точному изображению рук и улучшенной чувствительности к запросам
Установила новые стандарты для коммерческой генерации изображений с помощью ИИ с ощутимым влиянием на творческую индустрию

Персоны:David Holz, Midjourney Team

Организации:Midjourney Inc

2023Регулирование

Указ Байдена об ИИ — первое комплексное регулирование США

30 октября 2023 года президент Байден подписал Executive Order 14110 о 'безопасной, защищённой и заслуживающей доверия разработке и использовании искусственного интеллекта' — первый комплексный нормативный акт США в области ИИ и, со своими 110 страницами, самый длинный президентский указ в истории. Этот масштабный документ обязывал разработчиков мощных систем ИИ раскрывать результаты тестирований безопасности и устанавливал строгие стандарты Red Team через NIST. Указ предусматривал защиту от мошенничества с применением ИИ посредством аутентификации контента и водяных знаков, а также затрагивал риски для критической инфраструктуры и биологические угрозы. На момент подписания этот указ задавал глобальные стандарты ответственной разработки ИИ и позиционировал США как лидера в области управления ИИ (AI Governance). Однако его действие оказалось недолгим: 20 января 2025 года президент Трамп отменил EO 14110 своим указом EO 14148 — таким образом, этот документ отражает регуляторное положение дел по состоянию на 2023 год.

Наиболее комплексное управление ИИ за всю историю — 110 страниц, самый длинный президентский указ в истории
Обязательные тестирования безопасности и результаты Red Team для мощных систем ИИ
Закон об оборонном производстве: обязательная отчётность для систем ИИ, создающих риски национальной безопасности
В 2023 году позиционировал США как лидера в ответственном управлении ИИ — однако в 2025 году был отменён

Персоны:Joe Biden, Kamala Harris

Организации:White House, NIST, Department of Homeland Security

2023Регулирование

Письмо о паузе и Блетчли: безопасность ИИ становится глобальной темой

В 2023 году, в первое потрясение после ChatGPT, мир искал правила для внезапно обретшей мощь технологии. В марте тысячи подписантов — среди них Ёшуа Бенджио и Илон Маск — потребовали в открытом письме Future of Life Institute шестимесячной паузы в обучении ИИ-систем мощнее GPT-4. Паузы не последовало, однако письмо поставило тему на мировую повестку дня. В ноябре прошёл первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — намеренно в том самом месте, где Тьюринг некогда взламывал шифры. 28 государств и ЕС, в том числе США и Китай, подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ. Это был первый случай, когда соперничающие державы заговорили вместе о безопасности ИИ, — старт серии саммитов (Сеул 2024, Париж 2025). Если подходить честно: пауза так и не наступила, а Блетчлийская декларация носила необязательный характер — оба события поставили темы на повестку дня, но не создали механизмов принуждения.

Март 2023: открытое письмо Future of Life Institute (тысячи подписантов, в т. ч. Бенджио, Маск) потребовало 6-месячной паузы в обучении ИИ мощнее GPT-4.
Ноябрь 2023: первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — там, где Тьюринг во время войны взламывал шифры.
28 государств и ЕС — в том числе США и Китай — подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ; старт серии саммитов (Сеул 2024, Париж 2025).
Пауза так и не наступила; декларация носила необязательный характер. Оба события поставили темы на повестку, но не создали механизмов принуждения.

Организации:Future of Life Institute, UK Government

2023Продукты

Mistral и Mixtral: открытые европейские модели

Пока в 2023 году заголовки новостей в основном определяли американские компании, из Парижа выступил конкурент: Mistral AI, основанный весной 2023 года Артуром Меншем (ранее работавшим в Google DeepMind), а также Гийомом Лямплем и Тимоте Лакруа (ранее работавшими в Meta). Уже в сентябре небольшая модель Mistral 7B удивила профессиональное сообщество — она распространялась свободно под лицензией Apache 2.0 и превосходила значительно более крупную Llama 2 13B. В декабре последовала Mixtral 8x7B: открытая модель типа Mixture-of-Experts, достигшая на многих задачах уровня GPT-3.5, однако активировавшая лишь малую часть своих параметров на каждый запрос (около 13 из 47 миллиардов). Mistral стала европейским символом открытых моделей и привлекла миллиарды инвестиций. Важная оговорка: открытые веса — это не то же самое, что открытый исходный код; данные и код обучения остаются закрытыми. И Mixtral достигла уровня GPT-3.5, но не тогдашней флагманской модели GPT-4; при этом сама архитектура Mixture-of-Experts значительно старше.

Весна 2023: в Париже Артур Менш (экс-Google DeepMind), Гийом Лямпль и Тимоте Лакруа (экс-Meta) основали Mistral AI — европейский ответ американским лабораториям.
Сентябрь 2023: Mistral 7B — небольшая модель со свободными весами (Apache 2.0), превзошедшая более крупную Llama 2 13B.
Декабрь 2023: Mixtral 8x7B, открытая модель Mixture-of-Experts — на многих тестах на уровне GPT-3.5, но эффективная (только ~13 млрд активных из ~47 млрд параметров).
Важная оговорка: открытые веса не означают открытый исходный код (данные и код обучения закрыты); Mixtral достигла GPT-3.5, но не GPT-4. Архитектура Mixture-of-Experts значительно старше (в частности, Shazeer 2017).

Персоны:Arthur Mensch, Guillaume Lample, Timothée Lacroix

Организации:Mistral AI

2023Продукты

Google Gemini: мультимодальное семейство ИИ

Ответ Google на ChatGPT и прорыв к нативной мультимодальности. 6 декабря 2023 года Google представил Gemini 1.0 — семейство ИИ-моделей, разработанных с нуля для мультимодальности. Совместная работа DeepMind и Google Brain воплотилась в три размера моделей: Gemini Ultra для высококомплексных задач, Gemini Pro как сбалансированное решение и Gemini Nano для использования непосредственно на устройствах. В отличие от систем, расширенных мультимодальностью постфактум, Gemini изначально создавался с нативным пониманием текста, аудио, кода и видео. В шести из восьми тестов Gemini Pro превзошёл стандарт GPT-3.5, включая тесты MMLU. В день анонса обычный Bard получил новые возможности на базе Gemini Pro; более мощный Bard Advanced с Gemini Ultra Google объявил на начало 2024 года. Gemini стал стратегическим ответом Google на доминирование OpenAI и закрепил мультимодальный ИИ как новый стандарт для больших языковых моделей.

Разработан с нуля для мультимодальности: нативная интеграция понимания текста, аудио, кода и видео
Превзошёл GPT-3.5 в 6 из 8 стандартных тестов и утвердил Google как серьёзную альтернативу ChatGPT
Три размера моделей: Ultra (сложные задачи), Pro (сбалансированный), Nano (на устройстве) для разных применений
Обычный Bard получил Gemini Pro в день анонса; Bard Advanced с Gemini Ultra был объявлен на начало 2024 года

Персоны:Sundar Pichai, Demis Hassabis, Gemini Team

Организации:Google, DeepMind, Google AI

2024Продукты

Воплощённый ИИ: модели обретают тело

Долгие годы крупные ИИ-модели существовали только на экранах — они писали тексты, создавали изображения, вели беседы. В 2024 году это начало меняться: год стал годом воплощённого ИИ (embodied AI). Идея состоит в том, чтобы помещать те же базовые модели, которые понимают язык и изображения, в настоящие тела — прежде всего в человекоподобных роботов. Компания Figure объединилась с OpenAI и показала робота, который говорит, видит и манипулирует предметами. NVIDIA представила Project GR00T — базовую модель специально для гуманоидов, а молодые компании, такие как Physical Intelligence, оценивались в миллиарды долларов. Многие уже говорили о своём 'ChatGPT-моменте' для робототехники. Если подходить честно: большинство из этого пока оставалось демонстрациями и анонсами, а не надёжно работающими в повседневной жизни машинами. Физический мир несравнимо сложнее для робота, чем экран, — ловкость, безопасность и надёжность по-прежнему остаются нерешёнными проблемами.

2024 стал годом воплощённого ИИ: языковые модели, прежде существовавшие только в чате, переселились в роботов — особенно в человекоподобных.
Figure объединилась с OpenAI и показала говорящего, действующего гуманоида; NVIDIA представила Project GR00T — базовую модель для гуманоидов; стартапы вроде Physical Intelligence оценивались в миллиарды.
Надежда: робот, объединяющий язык, зрение и действие в единой базовой модели, мог бы обучиться решению общих задач в реальном мире — своего рода ChatGPT-момент для робототехники.
Большинство из этого пока оставались демонстрациями и анонсами, а не надёжно работающими продуктами. Реальный мир несравнимо сложнее для роботов, чем экран, — ловкость, безопасность и надёжность остаются нерешёнными задачами.

Организации:Figure AI, NVIDIA, Physical Intelligence

2024Продукты

Waymo: беспилотное такси становится реальностью

Более десяти лет автономное вождение служило показательным примером обещаний ИИ, которые постоянно откладывались. В 2024 году оно стало реальностью: Waymo, дочерняя компания Google по разработке роботизированных автомобилей, впервые в широком масштабе открыла беспилотные такси для широкой публики — в Сан-Франциско, Лос-Анджелесе и Финиксе. Летом 2024 года компания сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём. После многих лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный, повседневный сервис. Важная оговорка: Waymo работает только в строго ограниченных, тщательно картированных городских районах — не везде и не в любую погоду. Поломки и заблокированные автомобили по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей; уход конкурента Cruise после серьёзного происшествия в 2023 году показал, насколько технология ещё хрупка.

В 2024 году Waymo, дочерняя компания Google по разработке роботизированных автомобилей, стала первым поставщиком беспилотных такси в широком масштабе — открытых для широкой публики в нескольких городах США.
Летом 2024 года Waymo сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём.
После более чем десяти лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный сервис.
Важная оговорка: Waymo работает только в строго ограниченных, картированных городских районах — не везде. Поломки по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей (уход конкурента Cruise показал хрупкость технологии).

Организации:Waymo, Alphabet

2024Продукты

Sora: видео из текста, созданное ИИ

Прогресс в создании фотореалистичных видео с помощью ИИ и его влияние на киноиндустрию. 15 февраля 2024 года OpenAI представила Sora — модель преобразования текста в видео, которая по кратким описаниям генерирует детализированные HD-видео продолжительностью до одной минуты. Названная в честь японского слова, означающего 'небо', Sora символизирует 'безграничный творческий потенциал'. Как диффузный трансформер (Diffusion Transformer), Sora адаптирует технологию DALL-E 3 для временной согласованности и нередко — хотя и не всегда надёжно — симулирует физически правдоподобное движение. Демонстрационные видео превзошли все существующие системы преобразования текста в видео и установили новые стандарты для ИИ-творчества. Режиссёр Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов из-за опасений по поводу влияния Sora на индустрию. OpenAI придерживалась осторожного подхода, проводя тестирование в Red Team на предмет дезинформации и предвзятости перед более широким выпуском.

Фотореалистичная генерация видео из текста с HD-видео длительностью в несколько минут, превосходящая существующие системы
Диффузный трансформер (Diffusion Transformer) на основе технологии DALL-E 3 для временной согласованности
Нередко симулирует физически правдоподобное движение и сохраняет согласованность на протяжении всего видео
Потенциальное изменение киноиндустрии: Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов

Персоны:Tim Brooks, Bill Peebles, Connor Holmes, Will DePue

Организации:OpenAI

2024Продукты

Семейство Claude 3 с мультимодальными возможностями

Представление семейства ИИ с поддержкой зрения и тремя специализированными моделями. 4 марта 2024 года Anthropic представила семейство Claude 3: Opus, Sonnet и Haiku — три модели с различными сильными сторонами для разных сценариев использования. Ключевой функцией стала продвинутая обработка изображений, способная анализировать фотографии, графики, диаграммы и технические чертежи. Claude 3 Opus установил новые рекорды в когнитивных задачах, превзойдя конкурентов в бенчмарках MMLU и GPQA. Sonnet предложил идеальный баланс между интеллектом и скоростью для бизнеса, а Haiku отличался почти мгновенным временем отклика. С контекстным окном в 200 000 токенов (расширяемым до 1 миллиона) и доступностью в 159 странах Claude 3 установил новые стандарты для мультимодальных ИИ-систем.

Продвинутая обработка изображений для фотографий, графиков, диаграмм и технических чертежей
Opus (высший интеллект), Sonnet (баланс), Haiku (скорость) для различных сценариев использования
Мультимодальные возможности позволяют обрабатывать визуальные форматы параллельно с текстом
Claude 3 Opus достиг новых рекордов в MMLU, GPQA и других когнитивных бенчмарках

Персоны:Dario Amodei, Daniela Amodei, Tom Brown, Claude 3 Team

Организации:Anthropic, Claude API, Amazon Bedrock

2024Продукты

Devin: первый автономный ИИ-инженер по программному обеспечению

Рождение полностью автономной разработки программного обеспечения с помощью искусственного интеллекта. 12 марта 2024 года компания Cognition Labs представила Devin — позиционируемый фирмой как первый в мире полностью автономный ИИ-инженер по программному обеспечению. Система способна самостоятельно планировать, клонировать репозитории, писать код, отлаживать, тестировать и даже развёртывать его. На сложном тесте SWE-Bench Devin достиг 13,86% успешных решений реальных задач из GitHub — огромный скачок по сравнению с предыдущим лучшим результатом в 1,96%. Стартап получил оценку около 350 миллионов долларов на раннем раунде финансирования; вскоре после запуска появились сообщения об оценке около 2 миллиардов долларов. Несмотря на впечатляющие результаты, тесты выявили и ограничения: только 3 из 20 задач были решены успешно, нередко с непредсказуемыми сбоями.

Полностью автономная разработка программного обеспечения: планирование, программирование, отладка, тестирование и развёртывание без участия человека
Справляется со сложными инженерными задачами — от миграции кода до полной разработки приложений
13,86% успешных решений на SWE-Bench — в 7 раз лучше предыдущего лучшего результата в 1,96%
Вызвало дискуссию о будущем разработки программного обеспечения и вдохновило на создание открытых альтернатив, таких как OpenHands

Персоны:Scott Wu, Steven Hao, Walden Yan

Организации:Cognition Labs, SWE-Bench

2024Прорывы

AlphaFold 3: ИИ предсказывает взаимодействие молекул

Спустя четыре года после прорыва AlphaFold 2 в мае 2024 года Google DeepMind сделала следующий шаг — совместно с дочерней компанией Isomorphic Labs. AlphaFold 2 предсказывал, как отдельный белок сворачивается в трёхмерную структуру. AlphaFold 3 идёт принципиально дальше: он моделирует, как белки взаимодействуют с другими молекулами — с ДНК, РНК, ионами и небольшими молекулами лекарственных веществ. Именно это взаимодействие имеет ключевое значение для фармацевтических исследований: так можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью. Если подходить честно: предсказания впечатляют, но не безупречны — их точность варьируется в зависимости от типа молекулы, и в лаборатории их по-прежнему необходимо проверять. Кроме того, AlphaFold 3 изначально вышел без открытого исходного кода, только в виде ограниченного веб-сервиса, что вызвало в научном сообществе критику относительно воспроизводимости результатов.

В мае 2024 года Google DeepMind и Isomorphic Labs представили AlphaFold 3.
Если AlphaFold 2 предсказывал сворачивание отдельных белков, то AlphaFold 3 моделирует их взаимодействие — с ДНК, РНК, молекулами лекарственных веществ и ионами.
Особенно ценно для фармацевтических исследований: можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью.
Предсказания не безупречны и требуют лабораторной проверки. AlphaFold 3 изначально вышел без открытого кода — только как ограниченный веб-сервис, что вызвало критику относительно воспроизводимости результатов.

Организации:Google DeepMind, Isomorphic Labs

2024Соревнования

AlphaProof: ИИ завоёвывает серебро на математической олимпиаде

Математика долгое время считалась королевской дисциплиной, недоступной для ИИ: слишком творческой, слишком требовательной к подлинному пониманию. В июле 2024 года Google DeepMind поставила восклицательный знак: система AlphaProof совместно с AlphaGeometry 2 решила четыре из шести задач Международной математической олимпиады. Это соответствовало уровню серебряной медали — всего на одно очко ниже золота. Принципиально важна методика работы: AlphaProof формулирует доказательства на формальном языке Lean, в котором каждый шаг поддаётся машинной проверке — значит, ИИ не может 'схитрить'. Обучение проходило с применением метода обучения с подкреплением. Впервые ИИ достиг медального уровня на этом престижном соревновании. Если подходить честно: это были не настоящие условия соревнования. Там, где участники располагают четырьмя с половиной часами, ИИ иногда работал несколько дней, и специалистам пришлось вручную переводить задачи на формальный язык. Две комбинаторные задачи так и остались нерешёнными.

В июле 2024 года AlphaProof от Google DeepMind вместе с AlphaGeometry 2 решил четыре из шести задач Международной математической олимпиады — на уровне серебряной медали.
AlphaProof формулирует доказательства на формальном языке Lean и проверяет их самостоятельно; обучен с применением метода обучения с подкреплением. AlphaGeometry 2 взял на себя геометрическую задачу.
Впервые ИИ достиг медального уровня на этом престижном соревновании — важная веха для машинного рассуждения с проверяемыми доказательствами.
Не настоящие условия соревнования: ИИ потребовались дни вместо 4,5 часов, а люди переводили задачи на формальный язык. Две комбинаторные задачи остались нерешёнными.

Организации:Google DeepMind

2024Регулирование

Закон ЕС об ИИ: первый комплексный закон об искусственном интеллекте

Первое в мире комплексное регулирование искусственного интеллекта вступает в силу. 1 августа 2024 года Закон ЕС об ИИ приобрёл юридическую силу — основанный на оценке рисков свод правил, включающий 180 преамбульных пунктов и 113 статей для всего жизненного цикла систем ИИ. Закон классифицирует системы ИИ по четырём уровням риска: недопустимые приложения запрещены, системы высокого риска в образовании, занятости и правосудии подлежат детальным требованиям по соблюдению нормативов, системы ограниченного риска обязаны выполнять требования о прозрачности, а подавляющее большинство систем с минимальным риском остаются в значительной мере нерегулируемыми. Параллельно действуют отдельные правила для базовых моделей общего назначения (GPAI), таких как GPT, лежащих в основе ChatGPT. Экстерриториальное действие закона распространяется также на поставщиков за пределами ЕС, обслуживающих европейских пользователей. За нарушения грозят штрафы до 35 миллионов евро или 7% мирового годового оборота. Подобно GDPR 2018 года, Закон об ИИ может установить глобальные стандарты и определить, как ИИ влияет на нашу жизнь. Поэтапное введение в действие начинается в 2025 году и завершается к 2027 году.

Первый в мире комплексный закон об ИИ с 180 преамбульными пунктами и 113 статьями для всего жизненного цикла систем ИИ
Четыре уровня риска: запрещённые, высокого риска, ограниченного риска и минимального риска — плюс отдельные правила для базовых моделей GPAI
Экстерриториальное действие по образцу GDPR может установить глобальные стандарты ИИ и повлиять на соблюдение нормативов во всём мире
Штрафы до 35 млн евро или 7% годового оборота, поэтапное введение в действие 2025–2027

Персоны:Ursula von der Leyen, Thierry Breton

Организации:European Union, European Parliament, European Commission

2024Продукты

OpenAI O1 — прогресс в рассуждении

12 сентября 2024 года OpenAI выпустила сначала o1-preview (и o1-mini), существенно расширив возможности ИИ в области рассуждения (reasoning) благодаря цепочке размышлений (chain-of-thought), обученной методом обучения с подкреплением (reinforcement learning). O1 — первая широко доступная языковая модель, которая систематически 'думает' перед ответом: используя закрытую цепочку размышлений, она анализирует проблемы шаг за шагом. Этот новый подход открывает дополнительное измерение масштабирования — масштабирование на этапе вывода (test-time scaling), при котором более длительное 'обдумывание' даёт лучшие результаты. Полная модель o1 в бенчмарк-тестах достигает уровня, сопоставимого с кандидатами PhD в физике, химии и биологии, и решает 83 % задач American Invitational Mathematics Examination (GPT-4o: 13 %). Технология показывает, что ИИ способен значительно улучшить навыки решения задач за счёт структурированного рассуждения.

Первая модель, чья цепочка размышлений (chain-of-thought) обучается и масштабируется с помощью обучения с подкреплением — для структурированного рассуждения
Новое измерение масштабирования: чем дольше модель думает, тем лучше результаты
Новый подход: от воспроизведения паттернов к улучшенному решению задач
Важный шаг вперёд в сложном рассуждении — улучшенные способности к решению задач

Персоны:Sam Altman, Noam Brown, OpenAI Team

Организации:OpenAI

2024Вехи

Нобелевские премии по ИИ 2024 года

В октябре 2024 года произошло нечто беспрецедентное: сразу две Нобелевские премии по естественным наукам отметили основы современного ИИ. 8 октября Нобелевская премия по физике была присуждена Джону Хопфилду и Джеффри Хинтону — за фундаментальные открытия, открывшие путь к машинному обучению с искусственными нейронными сетями. То, что именно физика отметила нейронные сети, вызвало дискуссии — однако вдохновлённые физикой сети Хопфилда (1982) и методы обучения Хинтона действительно заложили фундамент. Днём позже Нобелевскую премию по химии разделили Дэвид Бейкер (за компьютерное проектирование белков), а также Демис Хассабис и Джон Джампер из DeepMind — за AlphaFold, решивший 50-летнюю проблему предсказания структуры белков. Впервые фундаментальные исследования в области ИИ были признаны на высшем уровне мировой науки. Примечательно: Хинтон, только что удостоенный премии, воспользовался трибуной, чтобы одновременно предупредить об опасностях технологии, у истоков которой стоял.

8 октября 2024: Нобелевская премия по физике присуждена Джону Хопфилду и Джеффри Хинтону за основы машинного обучения с нейронными сетями — премия по физике за ИИ.
9 октября 2024: Нобелевская премия по химии присуждена Дэвиду Бейкеру (проектирование белков), а также Демису Хассабису и Джону Джамперу из DeepMind (AlphaFold, предсказание структуры белков).
Впервые две Нобелевские премии по естественным наукам в один год отметили основы ИИ — поворотный момент в статусе этой области.
Дискуссионный вопрос: являются ли нейронные сети физикой? Премии отмечают многолетние фундаментальные разработки (сети Хопфилда 1982, машина Больцмана Хинтона). Хинтон одновременно предупредил об опасностях ИИ.

Персоны:John Hopfield, Geoffrey Hinton, Demis Hassabis, John Jumper, David Baker

Организации:Royal Swedish Academy of Sciences

2024Прорывы

OpenAI o3: прорыв на тесте ARC-AGI

Незадолго до конца 2024 года, 20 декабря, OpenAI анонсировала o3 — преемника o1 и доказательство того, что масштабирование рассуждений во время работы модели (Test-Time Scaling) можно продолжать. Особое внимание привлёк один результат: o3 набрала 87,5 % на ARC-AGI — тесте, намеренно построенном так, чтобы его нельзя было пройти простым запоминанием; предыдущие модели оставались здесь почти на нуле. Тем самым o3 впервые приблизилась к человеческому уровню на этом тесте и одновременно продемонстрировала высокие результаты в математике и программировании. Вместе с o1 и DeepSeek-R1, o3 ознаменовала эру моделей-рассуждателей (Reasoning Models) (o3-mini последовала в конце января 2025 года, полная o3 — в апреле). Важная оговорка: 87,5 % были получены в режиме максимальной производительности с огромными — и очень дорогостоящими — вычислительными затратами на каждую задачу; организаторы ARC Prize особо подчеркнули, что o3 не является AGI и показывает значительно худшие результаты на более сложном тесте ARC-AGI-2.

o3 (анонсирована 20.12.2024) развивает Test-Time Scaling из o1: больше вычислений во время работы модели — лучшие результаты, высшие оценки в математике и коде.
87,5 % на ARC-AGI — тесте, защищённом от простого запоминания, на котором предыдущие модели почти не набирали очков: заметный прыжок в сторону человекоподобной адаптивности.
Вместе с o1 и DeepSeek-R1 открыла эру моделей-рассуждателей; o3-mini — конец января 2025, полная o3 — апрель 2025.
Важная оговорка: 87,5 % получены в дорогостоящем режиме максимальной производительности декабрьской предварительной версии (позднее выпущенная o3 показала более низкие результаты); организаторы ARC подчёркивают: o3 — НЕ AGI и на более сложном ARC-AGI-2 опускается примерно до 3 %.

Организации:OpenAI

2025Продукты

Агентный ИИ выходит в массы

В 2024–2025 годах изменилось само предназначение ИИ: от ответов — к действиям. Первой ласточкой стала Anthropic: в октябре 2024 года она первой из крупных ИИ-лабораторий представила модель, которая умеет самостоятельно управлять компьютером — видеть экран, двигать мышью, кликать, печатать. В январе 2025 года OpenAI выпустила Operator — агента, который самостоятельно выходит в интернет и выполняет задачи, а вскоре после этого — Deep Research, способный проводить многоэтапные исследования и составлять подкреплённые ссылками отчёты. Чат-бот, выдающий текст, превратился в систему, действующую от имени пользователя, — качественный сдвиг, намеченный ещё Devin в 2024 году. Если подходить честно: первые версии работали медленно, часто давали сбои и справлялись лишь с узко очерченными задачами; системы, выпущенные в 2025 году под маркой агентов, продвигались активнее, чем позволяла реальная надёжность.

Anthropic, Computer Use (окт. 2024): первая frontier-модель с управлением компьютером в открытой бете — экран, мышь, клавиатура.
OpenAI: Operator (янв. 2025) самостоятельно выходит в интернет; Deep Research (февр. 2025) проводит многоэтапные исследования и составляет подкреплённые ссылками отчёты.
Переход от чат-бота (выдавать текст) к агенту (действовать) — намечен Devin (2024), в 2025 году стал продуктовым мейнстримом.
Ранние версии работали медленно, давали сбои, были ограничены узкими задачами; системы продвигались активнее, чем позволяла их реальная надёжность в 2025 году.

Организации:Anthropic, OpenAI

2025Продукты

DeepSeek-R1: ИИ-шок из Китая

В конце января 2025 года ИИ-модель впервые ощутимо пошатнула мировые фондовые рынки. 20 января 2025 года китайская лаборатория DeepSeek опубликовала R1 — модель рассуждения (reasoning model) на уровне o1 от OpenAI, но с открытыми весами (лицензия MIT) и стоимостью обучения, оказавшейся значительно ниже ожидаемой. Это стало возможным благодаря масштабному обучению с подкреплением на базовой модели DeepSeek-V3. Когда неделю спустя приложение DeepSeek возглавило американские чарты, настроение переломилось: 27 января акции Nvidia упали примерно на 17 % — около 600 миллиардов долларов за один день, крупнейшие однодневные потери в истории американской биржи, — поскольку инвесторы усомнились в том, что передовому ИИ непременно нужны бесконечно дорогие чипы. R1 одновременно поколебал несколько убеждений: что только американские гиперскейлеры могут конкурировать на вершине, что модели рассуждения остаются закрытыми и что наращивание вычислительных мощностей — единственный путь вперёд. Если подходить честно: расхожая цифра в несколько миллионов долларов относится только к финальному обучающему прогону базовой модели V3 (не к R1 как таковой, не к исследованиям и оборудованию в целом) — и R1 превосходила o1 далеко не по всем показателям.

R1 (20 янв. 2025): модель рассуждения на уровне o1 с открытыми весами (лицензия MIT), обученная с применением масштабного обучения с подкреплением на DeepSeek-V3.
Обучена при значительно меньших затратах, чем ожидалось, — это поставило под сомнение тезис о том, что передовой ИИ непременно требует огромных вычислительных бюджетов.
27 янв. 2025: Nvidia -около 17 % (около 600 млрд $ за один день, рекорд США); Китай на вершине ИИ — ИИ стал зримым вопросом рынка и геополитики.
Несколько миллионов долларов относятся лишь к финальному обучающему прогону базовой модели V3 — не к самой R1 и не к исследованиям или оборудованию в целом; R1 превосходила o1 не по всем показателям.

Персоны:Liang Wenfeng

Организации:DeepSeek

2025Вехи

Stargate: ИИ как инфраструктура национального масштаба

21 января 2025 года искусственный интеллект оказался в Белом доме на сцене — как инфраструктурный проект национального масштаба. OpenAI, SoftBank, Oracle и инвестиционная компания MGX объявили о проекте Stargate: до 500 миллиардов долларов за четыре года на центры обработки данных для ИИ в США, причём вложение 100 миллиардов долларов должно было начаться немедленно. Тем самым стало очевидно, что следующая фаза ИИ — это меньше вопрос алгоритмов и больше вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций и промышленных парков. Для области, красной нитью которой со времён AlexNet является вычислительная мощь (см. CUDA 2007), это была логичная, но грандиозная следующая ступень — и сигнал того, что ИИ стал национальным геополитическим приоритетом. Важная оговорка: объявление — это не готовый центр обработки данных. Полнота финансирования в размере 500 миллиардов долларов вызывала сомнения с самого начала — в том числе у участников и наблюдателей, публично высказывавших скептицизм.

До 500 млрд долларов за четыре года на центры обработки данных для ИИ в США (OpenAI, SoftBank, Oracle, MGX); вложение 100 млрд долларов должно было начаться немедленно.
Объявлено в Белом доме: ИИ открыто превратился в вопрос национальной инфраструктуры и геополитики.
Следующая фаза ИИ — это вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций (красная нить, начиная с CUDA/AlexNet).
Важная оговорка: объявление — не готовый центр обработки данных; полнота финансирования в 500 млрд долларов вызывала сомнения с самого начала.

Персоны:Sam Altman, Masayoshi Son, Larry Ellison

Организации:OpenAI, SoftBank, Oracle

2025Регулирование

Парижский саммит по ИИ (AI Action Summit)

10 и 11 февраля 2025 года в парижском Гран-Пале встретились главы государств и правительств, технологические компании и исследователи на саммите AI Action Summit — третьем крупном международном форуме по ИИ после Блетчли (2023) и Сеула (2024), который совместно возглавляли президент Франции Макрон и премьер-министр Индии Моди. Примечательным стал сдвиг в тоне: если первый саммит уделял главное внимание безопасности ИИ, то в Париже речь шла прежде всего о возможностях, инвестициях и конкурентоспособности — вице-президент США открыто выступал против избыточного регулирования. В итоге 58 государств, а также ЕС и Африканский союз подписали декларацию об инклюзивном и устойчивом ИИ — однако США и Великобритания от подписи отказались. Тем самым саммит обнажил трансатлантический раскол в сфере управления ИИ. Важная оговорка: декларация носила необязательный характер, а критики назвали саммит упущенной возможностью для решения вопросов безопасности.

Третий глобальный саммит по ИИ (после Блетчли 2023, Сеула 2024): 10-11 февраля 2025, Гран-Пале, под руководством Макрона и Моди.
Смена тона: от безопасности к возможностям и конкуренции — Париж сделал акцент на инвестициях, а не рисках; вице-президент США выступал против избыточного регулирования.
58 государств плюс ЕС и Африканский союз подписали итоговую декларацию — США и Великобритания отказались от подписи (открытый трансатлантический раскол).
Важная оговорка: декларация носила необязательный характер; критики назвали саммит упущенной возможностью для обсуждения безопасности ИИ.

Персоны:Emmanuel Macron, Narendra Modi

2025Продукты

Frontier-модели 2025 года

В 2025 году способность к рассуждению, которую запустили o1 и R1, превратилась в стандарт ведущих моделей — в темпе, за которым было трудно успевать. В марте Google представила Gemini 2.5 Pro, в мае Anthropic выпустила Claude 4 (Opus 4 и Sonnet 4), в августе OpenAI — GPT-5; между ними вышли Claude 3.7 (первая гибридная модель, по выбору отвечающая быстро или рассуждающая дольше), GPT-4.5, Llama 4 от Meta и Grok от xAI. Новое поколение объединило две линии: пошаговое рассуждение reasoning-моделей и способность действовать самостоятельно (агентность). Особое место заняло автономное программирование на длинных дистанциях. Если подходить честно: лаборатории каждую неделю перебивали друг друга в рекордах по бенчмаркам, и каждая заявляла о своём первенстве — реальный прогресс есть, но часто употребляемое слово AGI оставалось скорее маркетингом, чем реальностью.

В 2025 году рассуждение (пошаговое обдумывание) и агентность (самостоятельные действия) стали стандартом ведущих моделей; Claude 3.7 ввёл гибридную модель, способную отвечать быстро или рассуждать дольше.
Плотная гонка: Gemini 2.5 Pro (март), Claude 4 / Opus 4 (май), GPT-5 (август) — плюс Llama 4, Grok, DeepSeek. Несколько лабораторий на вершине.
В центре внимания: автономное программирование на длинных дистанциях (например, Claude Code) — модели, самостоятельно выполняющие целые задачи.
Рекорды бенчмарков каждую неделю, каждая лаборатория заявляет о лидерстве; реальный прогресс есть, но AGI оставался скорее маркетингом, чем реальностью.

Организации:Anthropic, OpenAI, Google DeepMind