Хронология ИИ
Хронология, которая показывает: ИИ объявляли мёртвым минимум трижды — и каждый раз он возвращался.
Аналитическая машина Бэббиджа: идея компьютера
История ИИ начинается не с компьютеров, а с идеи компьютера. В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину и впервые подробно описал её в 1837 году — на бумаге это был первый универсальный программируемый вычислительный прибор в мире. Его проект на целый век опережал своё время: в нём уже были арифметическое устройство, которое Бэббидж называл 'мельницей' (mill), память (store), программирование с помощью перфокарт и даже условные переходы — основные строительные блоки любого современного компьютера. При жизни изобретателя машина так и не была построена: она оказалась слишком сложной для механики XIX века. Тем не менее она является далёкой прародительницей каждого вычислительного устройства — а значит, и того оборудования, на котором вообще может работать искусственный интеллект. Если подходить честно: Аналитическая машина осталась незавершённым проектом, и она была вычислительным, а не мыслящим устройством. Она заложила фундамент — способность вычислять, но не мыслить.
Ада Лавлейс: первая программа — и смелое видение
Чарльз Бэббидж спроектировал машину — но именно Ада Лавлейс поняла, на что та способна. В 1843 году британская математик перевела статью об Аналитической машине Бэббиджа и добавила собственные примечания, которые значительно превзошли оригинал по объёму и глубине. В своей заметке G она описала процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой. Ещё дальновиднее оказалось второе открытие: машина не обязана работать только с числами — она может обрабатывать символы любого рода и даже сочинять музыку. Тем самым Лавлейс на целый век опередила идею универсальной обработки данных. Если подходить честно: была ли она первым программистом — спорный вопрос: сам Бэббидж набрасывал программы раньше, а процедура вычисления чисел Бернулли создавалась в диалоге с ним. При этом Лавлейс полагала, что машина не способна создать ничего подлинно нового — возражение, которому Алан Тьюринг открыто противопоставил своё мнение в 1950 году.
Машина Тьюринга: что такое вычисление
Прежде чем задаться вопросом, могут ли машины думать, нужно было выяснить, что вообще способна вычислить машина. На этот вопрос ответил британский математик Алан Тьюринг в 1936 году в своей статье 'On Computable Numbers'. В ней он описал удивительно простую мысленную модель — лента, читающая-записывающая головка, несколько правил, — получившую позднее название машины Тьюринга. С её помощью Тьюринг точно установил, что является вычислимым, а что нет. Его важнейшее открытие: одна универсальная машина Тьюринга способна имитировать любую другую. Это теоретический прообраз универсального компьютера — машины, которая при наличии нужной программы может выполнить любое вычислимое действие. Тем самым Тьюринг стал основоположником информатики и создал фундамент, на котором только и стала возможной идея мыслящих машин. Важная оговорка: машина Тьюринга — математическая идея, а не построенное устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само же название 'машина Тьюринга' ввели другие.
Маккалок и Питтс: первый искусственный нейрон
За тринадцать лет до Дартмутской конференции, в разгар войны, вышло истинное свидетельство о рождении искусственных нейронных сетей. Нейрофизиолог Уоррен Маккалок и самоучка-логик Уолтер Питтс — которому едва исполнилось двадцать лет и у которого не было никакой учёной степени — опубликовали в 1943 году в Bulletin of Mathematical Biophysics статью 'A Logical Calculus of the Ideas Immanent in Nervous Activity'. Их идея была радикально простой: нейрон можно описать как бинарный переключатель, который срабатывает по принципу 'всё или ничего', когда сумма его входных сигналов превышает порог. На основе чистой пропозициональной логики они доказали, что сети из таких элементов способны вычислять любую логическую функцию, а сети с петлями обратной связи обладают даже своеобразной памятью. В заключительной части авторы указали, что их сети способны вычислить то же, что и машина Тьюринга. Тем самым они создали первую математическую модель нейрона как логического вычислительного элемента. Главный изъян, определивший следующее десятилетие: их нейрон не умел учиться.
Теория информации Шеннона: рождение бита
В 1948 году в Bell Labs вышла статья, заложившая основы цифрового мира: 'A Mathematical Theory of Communication' Клода Шеннона. Шеннон показал, как можно измерить информацию математически — безотносительно её смысла. Он ввёл бит как наименьшую единицу информации и ввёл понятие энтропии: меру того, сколько неопределённости в среднем снимает сообщение. Тем самым он заложил фундамент для сжатия данных, безошибочной передачи информации и в конечном счёте для каждого компьютера. Для ИИ это нечто большее, чем просто предыстория: такие понятия, как перекрёстная энтропия и дивергенция Кульбака — Лейблера, которые сегодня служат целевыми функциями при обучении нейронных сетей, уходят корнями прямо в теорию Шеннона. Важная оговорка: Шеннон описывал передачу сообщений, а не мышление. Теория информации — математический инструмент, на котором строится ИИ, но сама она не является искусственным интеллектом.
Правило Хебба: как рождается обучение в мозге
В 1949 году канадский психолог Дональд Хебб опубликовал книгу 'The Organization of Behavior' и выдвинул простую, но важную идею: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется. Тем самым Хебб впервые предложил конкретный механизм того, как обучение может работать на уровне отдельных синапсов. Для ИИ это стало основополагающим принципом: обучение означает изменение силы связей — именно это делают искусственные нейронные сети, в том числе более поздние сети Хопфилда. Если подходить честно: знаменитый афоризм о том, что нейроны, возбуждающиеся вместе, соединяются вместе, принадлежит вовсе не Хеббу — его приписывают нейробиологу Карле Шатц (1992). И правило Хебба само по себе ещё не объясняет современное глубокое обучение, поскольку в нём отсутствует целенаправленная коррекция ошибок.
Тест Тьюринга: игра в имитацию
Философская основа машинного интеллекта и первый эталонный тест ИИ. В 1950 году Алан Тьюринг опубликовал в журнале Mind статью 'Computing Machinery and Intelligence' и по-новому сформулировал вопрос 'Могут ли машины мыслить?'. Вместо философских определений Тьюринг предложил практическую 'Игру в имитацию': человек-оценщик анализирует текстовые расшифровки диалогов между человеком и машиной. Оценщик пытается определить, кто из собеседников является машиной; машина считается выдержавшей тест, если оценщик не может надёжно это определить. Решающим является не правильность ответов, а то, насколько они похожи на ответы человека. Этот тест на неотличимость можно распространить на все виды человеческой деятельности — как вербальные, так и невербальные (робототехника). Поведенческий подход Тьюринга заложил концептуальный фундамент для всей науки об ИИ и повлиял на ELIZA, ChatGPT и все современные системы разговорного ИИ.
Logic Theorist: первая программа для логического вывода
В то же лето, когда в Дартмуте был введён термин 'искусственный интеллект', Аллен Ньюэлл, Херберт Саймон и нередко забытый программист Клифф Шоу представили то, что принято называть 'первой программой ИИ' — с одной оговоркой. Их Logic Theorist доказывал математические теоремы: программа взялась за пропозициональную логику из 'Principia Mathematica' Уайтхеда и Рассела и самостоятельно нашла доказательства для 38 из первых 52 теорем. Примечательным был сам подход: вместо того чтобы перебирать все варианты подряд, программа использовала эвристический поиск — она оценивала, какие шаги перспективны, и работала от цели назад. Для одной теоремы она даже нашла более короткое доказательство, чем в оригинале; по имеющимся сведениям, Рассел был доволен, тогда как научный журнал отклонил представленное доказательство. Всё было написано на IPL — языке списков, предвосхитившем LISP Маккарти. Ограничение: игровые программы вроде дамок Самуэля работали раньше — Logic Theorist стал первой программой, целенаправленно воспроизводившей человеческое рассуждение на открытой интеллектуальной задаче.
Дартмутская конференция: рождение ИИ
Исторический момент, когда искусственный интеллект родился как научная область. С 18 июня по 17 августа 1956 года в Дартмутском колледже прошла первая летняя исследовательская конференция по ИИ. Джон Маккарти, Марвин Минский, Натаниэль Рочестер и Клод Шеннон разделяли смелое видение: 'Каждый аспект обучения или любую другую характеристику интеллекта можно описать достаточно точно, чтобы машина могла её смоделировать.' На этом восьминедельном семинаре Маккарти ввёл термин 'Artificial Intelligence' и тем самым заложил основу новой научной дисциплины. Некоторые участники приезжали лишь на несколько недель, другие присутствовали постоянно: Херберт Саймон и Аллен Ньюэлл в первые недели демонстрировали свой Logic Theorist, тогда как Рэй Соломонофф провёл все восемь недель на месте — обсуждения велись на верхнем этаже математического факультета. Из этой конференции выросли три исторических центра ИИ: Университет Карнеги — Меллон с Ньюэллом и Саймоном, MIT с Минским и Стэнфорд с Маккарти.
Перцептрон: первая обучающаяся нейронная сеть
Рождение машинного обучения — первый обучаемый искусственный нейрон. В 1957 году Фрэнк Розенблатт в Cornell Aeronautical Laboratory разработал перцептрон — первую нейронную сеть, способную учиться на опыте. В январе 1957 года он опубликовал технический отчёт 'The Perceptron: A Perceiving and Recognizing Automaton' (Project PARA, Report 85-460-1). Формальная научная публикация вышла в ноябре 1958 года в журнале Psychological Review. Вдохновлённый биологическими нейронами, перцептрон объединял взвешенные входные данные через функцию Хевисайда, выдавая бинарные выходные значения. Новаторское правило обучения перцептрона корректировало веса каждый раз, когда пример классифицировался неверно, — ранний предшественник обучения в современных нейронных сетях (его не следует путать с более поздним дельта-правилом Уидроу и Хоффа, 1960 года). Сначала смоделированный на IBM 704 и публично анонсированный в 1958 году, аппаратный Mark I Perceptron был завершён лишь около 1960 года. Несмотря на ограниченность линейно разделимыми задачами, перцептрон заложил концептуальный фундамент для всех последующих нейронных архитектур.
LISP: язык ИИ
В 1958 году Джон Маккарти в Массачусетском технологическом институте разработал язык программирования, ставящий символьные вычисления в центр: LISP, сокращение от List Processing. Вместо того чтобы преимущественно обрабатывать числа, LISP манипулировал списками символов — именно то, что требовалось символическому ИИ. На протяжении десятилетий LISP оставался языком исследований в области ИИ: экспертные системы, обработка естественного языка и системы планирования создавались на нём. Язык Маккарти ввёл также идеи, которые сегодня стали само собой разумеющимися: рекурсию, автоматическую сборку мусора (garbage collection), функции как данные и интерактивное вычисление выражений. Стив Расселл реализовал теоретический механизм вычисления eval Маккарти в виде первого интерпретатора — и тем самым сделал LISP работающим. Если подходить честно: LISP не был первым языком высокого уровня (Fortran появился в 1957 году), но он второй по возрасту из тех, что используются до сих пор, — и самый значимый для ИИ.
Артур Самуэль: самообучающийся ИИ и термин 'машинное обучение'
За несколько лет до Дартмутской конференции Артур Самуэль в IBM научил машину играть в шашки — и заодно учиться. Его программа работала с 1952 года на IBM 701; главным, однако, стало то, что он изложил в своей статье 1959 года 'Some Studies in Machine Learning Using the Game of Checkers'. Программа совершенствовалась сама: она сыграла десятки тысяч партий против самой себя и корректировала веса своей оценочной функции по итогам игр. В названии этой статьи термин 'машинное обучение' (Machine Learning) зафиксирован в современном значении впервые — Самуэль считается его создателем. Ричард Саттон позднее оценил самоигру Самуэля как первое применение обучения с временными разностями (Temporal-Difference Learning), лежащего в основе современного обучения с подкреплением. Телевизионная демонстрация 1956 года и широко цитируемая победа над предполагаемым мастером попали в заголовки газет — однако оба события были значительно преувеличены: против действительно сильных игроков программа проигрывала, и шашки были полностью решены лишь несколько десятилетий спустя.
DENDRAL: пионер экспертных систем
В середине 1960-х годов ИИ сделал принципиальный поворот. В Стэнфордском университете Эдвард Фейгенбаум и генетик, лауреат Нобелевской премии Джошуа Ледерберг приступили к работе над DENDRAL — программой, которую часто называют первой экспертной системой и которая в любом случае стала первой, применившей ИИ к научному рассуждению. Вместо того чтобы действовать общим поиском, как прежние системы, DENDRAL использовала специализированные знания химиков: по данным масс-спектрометра она выводила структуру органических молекул. Вынесенный урок определил целое десятилетие развития ИИ: знание — это сила. Победит не самый умный общий алгоритм, а тот, кто располагает наибольшей экспертизой. Тем самым DENDRAL проложила путь к буму экспертных систем в 1980-х. Если подходить честно: DENDRAL сам по себе был успешным многолетним исследовательским проектом, а не отдельным продуктом. Однако его метод — утомительного ручного ввода всех знаний — впоследствии стал ахиллесовой пятой: он сделал коммерческие экспертные системы 1980-х годов ненадёжными и дорогостоящими, что способствовало наступлению зимы ИИ.
Нечёткая логика: логика неточности
Важный математический прорыв в работе с неопределённостью и приближёнными рассуждениями. В 1965 году Лотфи Заде из Калифорнийского университета в Беркли опубликовал основополагающую статью 'Fuzzy Sets' — ответ на неспособность классической логики справляться с расплывчатой и неполной информацией. Его открытие состояло в осознании того, что люди принимают решения на основе неточных, нечисловых данных. Нечёткая логика допускает степени принадлежности от 0 до 1, в отличие от бинарной логики 'да/нет'. Сегодня работа Заде насчитывает более 100 000 цитирований и стала основой для мягких вычислений (Soft Computing) и современных подходов к ИИ. 'Точная логика неточности' позволила математически моделировать неопределённость, неполноту и противоречивую информацию. Нечёткая логика нашла применение в экспертных системах, системах управления и впоследствии в современных архитектурах ИИ для нечётких процессов принятия решений.
ELIZA: первый чат-бот
Рождение разговора человека с машиной и непреднамеренный эксперимент в области человеческой психологии. Приблизительно с 1964 по 1966 год Джозеф Вейценбаум в MIT разработал ELIZA — первую программу, явно созданную для общения с людьми. С удивительно лаконичным кодом и простой технологией сопоставления шаблонов (Pattern Matching) ELIZA имитировала разговоры, особенно в варианте DOCTOR — в роли терапевта по методу Роджерса. Неожиданность крылась не в технологии, а в реакции людей: пользователи, включая собственную секретаршу Вейценбаума, формировали эмоциональные привязанности к программе и даже требовали конфиденциальности для своих 'сеансов терапии'. Вейценбаум рано описал и подверг критике это явление — тенденцию приписывать рудиментарным программам человеческие качества. Сам термин 'эффект ELIZA' был введён и популяризирован позже, в 1990-е годы. ELIZA доказала силу простой иллюзии и заложила основу для всех современных чат-ботов.
Perceptrons: книга, которая спровоцировала зиму ИИ
В 1969 году исследователи Массачусетского технологического института Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons. С математической строгостью они показали, что может, а чего не может однослойный перцептрон — простейшая форма нейронной сети. Их самый известный результат: такая сеть не способна выучить даже простую функцию XOR, потому что она не является линейно разделимой. Влияние оказалось огромным: доверие к нейронным сетям рухнуло, финансирование прекратилось более чем на десятилетие — книга стала важным фактором первой зимы ИИ. Важная оговорка: Минский и Пейперт отнюдь не опровергли нейронные сети. Они проанализировали лишь однослойный вариант; многослойные сети решают XOR без труда — что позднее, с 1986 года, стало практически применимым благодаря методу обратного распространения ошибки. Рассказ о том, что книга в одиночку уничтожила исследования, — отчасти миф. Однако резкое сокращение финансирования и внимания было вполне реальным.
Shakey: первый разумный мобильный робот
Рождение автономной робототехники через интеграцию логического мышления, планирования и физического действия. С 1966 по 1972 год команда Чарльза Розена в SRI International разрабатывала Shakey — первого мобильного робота, способного осмысливать собственные действия. Двухметровый робот объединял телекамеру, сонарный дальномер, процессоры и 'кошачьи усы' в качестве датчиков столкновения в единую автономную систему. Выдающиеся возможности Shakey включали восприятие окружающей среды, построение выводов из неявных фактов, составление планов и компенсацию ошибок — всё это управлялось с помощью естественного английского языка. Финансируемый ARPA (ныне DARPA) проект впервые объединил логическое мышление с физическим действием и заложил основы автономных систем. Разработки Shakey привели к созданию алгоритма поиска A*, методов графа видимости и влиятельного вычислительного варианта преобразования Хафа (Duda & Hart, SRI 1972). В 1970 году журнал Life Magazine назвал Shakey 'первой электронной личностью'.
SHRDLU: понимание языка в мире кубиков
Около 1970 года Терри Виноград в Массачусетском технологическом институте создал программу, удивившую специалистов: SHRDLU. Ей можно было отдавать команды на простом английском — например, поставить красный куб на зелёный блок — и она выполняла их в виртуальном мире из цветных кубиков. SHRDLU понимала не только команды: она разрешала двусмысленные предложения, помнила сказанное, отвечала на вопросы о своём мире и могла даже объяснить, почему выполнила то или иное действие. Для многих это стало выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык. Важная оговорка: понимание SHRDLU работало только в её крошечном замкнутом мире кубиков. На реальный, необозримый мир с его бесконечными обыденными знаниями оно не распространялось. Со временем SHRDLU стала поучительным примером ограничений подобных микромиров — сам Виноград впоследствии отказался от этого подхода.
Скрытые марковские модели получают признание
Математический фундамент для распознавания речи и моделирования последовательностей. С конца 1960-х до 1970 года Леонард Баум, Ллойд Уэлч и Тед Петри в Институте оборонных исследований (Institute for Defense Analyses) разработали скрытые марковские модели и создали алгоритм Баума-Уэлча. Эти статистические модели описывали скрытые состояния в последовательностях и предложили один из первых практически применимых подходов к выявлению латентных состояний в данных, зависящих от времени. С середины 1970-х HMM нашли первое практическое применение в распознавании речи — в работах Джеймса Бейкера в Университете Карнеги-Меллон и позднее в IBM. Метод коренным образом изменил автоматическое распознавание речи: от простых шаблонных методов (Template Matching) к статистическим подходам. HMM стали стандартом для моделирования последовательностей в многочисленных областях: от биоинформатики и финансового анализа до распознавания жестов. Алгоритм Баума-Уэлча, впоследствии признанный частным случаем алгоритма максимизации математического ожидания (Expectation-Maximization), сформулированного в общем виде в 1977 году, заложил фундамент для современных вероятностных методов машинного обучения.
Prolog: программирование с помощью логики
В 1972 году в Марсельском университете возник язык программирования, мысливший совершенно иначе, чем все остальные: Prolog, сокращение от Programmation en Logique. Его создатели Ален Кольмерауэр и Филипп Руссель — опираясь на теорию Роберта Ковальски — развивали захватывающую идею. Вместо того чтобы шаг за шагом указывать компьютеру, как что-то делать, в Prolog описывают лишь факты и правила некоторого мира. Логические выводы из них система делает сама. Prolog стал важнейшим языком символического ИИ: в экспертных системах, в обработке естественного языка и как основа амбициозного японского проекта пятого поколения (Fifth Generation). Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ. Масштабный японский проект, целиком построенный на Prolog, остался далеко позади своих обещаний. И прорыв обязан столько же теории Роберта Ковальски, сколько самому языку.
Первая зима ИИ
Период резких сокращений финансирования исследований и падения доверия к искусственному интеллекту. После чрезмерных обещаний 1960-х годов наступила горькая реальность: программы ИИ могли решать лишь тривиальные версии тех задач, с которыми им предстояло справляться. В Великобритании доклад Лайтхилла 1973 года стал уничижительной критикой, после чего Совет по научным исследованиям сократил финансирование нецелевых исследований в области ИИ. В США DARPA — под влиянием поправки Мэнсфилда — на несколько лет отказалась от нецелевых исследований; резкое сокращение финансирования понимания речи в 1974–1975 годах затронуло проект в Университете Карнеги — Меллона и привело к расторжению контракта на 3 миллиона долларов. Эта зима продолжалась примерно до 1980 года и преподала сообществу ИИ важный урок: реалистичные ожидания — ключ к устойчивому прогрессу.
Неокогнитрон: прародитель свёрточных нейронных сетей
В 1980 году японский исследователь Куниихико Фукусима представил нейронную сеть, намного опередившую своё время: неокогнитрон. Его образцом послужила природа — точнее, зрительная кора, которую изучали нобелевские лауреаты Хьюбел и Визел в опытах на кошках. В зрительной коре простые и сложные клетки поэтапно обрабатывают зрительные стимулы. Фукусима воспроизвёл этот принцип: многослойная сеть, распознающая признаки послойно — причём независимо от того, где именно в изображении они находятся. Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей (Convolutional Neural Networks), которые господствуют в распознавании изображений с 2012 года. Важная оговорка: неокогнитрон ещё не использовал метод обратного распространения ошибки и не мог обучаться так, как современные CNN. Лишь метод обратного распространения (1986) и LeNet Яна ЛеКуна (1989) превратили эту архитектуру в практически обучаемые сети. Первопроходческая роль Фукусимы до сих пор нередко недооценивается.
Эра экспертных систем 1980-х годов
1980-е годы стали расцветом экспертных систем — временем, когда ИИ впервые достиг коммерческого успеха. Компании по всему миру внедряли эти основанные на правилах программы ИИ, воспроизводящие знания экспертов-людей в специализированных областях. Индустрия ИИ выросла с нескольких миллионов долларов в 1980 году до миллиардов в 1988-м. Две трети компаний из списка Fortune 500 использовали эту технологию. Системы вроде MYCIN достигали в исследованиях около 65% принятия своих терапевтических рекомендаций — наравне с экспертами факультетов, хотя MYCIN так и не применялась клинически. Однако бум завершился по классической схеме экономического пузыря, когда десятки компаний потерпели крах и обнаружились пределы технологии.
Сети Хопфилда: Ассоциативная память
Возрождение нейронных сетей благодаря ассоциативным возможностям памяти. В 1982 году Джон Хопфилд опубликовал основополагающую статью «Neural networks and physical systems with emergent collective computational abilities» в PNAS. Его инновация заключалась в связи нейробиологии и статистической физики: сети Хопфилда работают как content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов. Рекуррентная архитектура с симметричными двунаправленными связями сходится к аттракторам фиксированной точки через энергетическую функцию Ляпунова. Система «скатывается вниз» к ближайшему сохранённому воспоминанию. Работа Хопфилда возродила интерес к нейронным сетям и заложила теоретический фундамент для современных RNN. Хеббовское правило обучения позволило ассоциативное хранение паттернов — прорыв для понимания биологических и искусственных систем памяти.
Алгоритм обратного распространения ошибки
Рождение современного машинного обучения благодаря элегантному алгоритму обучения. В октябре 1986 года Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали в журнале Nature статью 'Learning representations by back-propagating errors'. Этот алгоритм существенно изменил обучение нейронных сетей, предоставив эффективный метод корректировки весов в многослойных сетях. Метод итеративно корректирует веса связей, чтобы минимизировать разницу между фактическим и желаемым выходом. Ключевая инновация заключалась в способности обучать скрытые слои, которые автоматически распознают важные признаки задачи. Математические основы были заложены ранее — в частности, Полом Вербосом (1974) и Сеппо Линнайнмаа (1970), — однако именно эта статья сделала метод обратного распространения ошибки широко известным и убедительно продемонстрировала его эффективность. Метод обратного распространения стал рабочей лошадкой машинного обучения и сегодня лежит в основе всех современных приложений глубокого обучения.
Вторая зима ИИ
Крах рынка специализированного оборудования для ИИ и провал экспертных систем. В 1987 году рынок Lisp-машин рухнул, когда компьютеры Apple и IBM оказались дешевле и производительнее дорогостоящих ИИ-специфичных систем. Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании и негибкими для реального применения. Джек Шварц, новый руководитель IPTO, назвал экспертные системы 'умным программированием' и урезал финансирование ИИ 'глубоко и жестоко'. Упадок производителей Lisp-машин растянулся на несколько лет — лидер рынка Symbolics объявил о банкротстве лишь в 1993 году, — что привело к более длительной и глубокой зиме, чем первая в 1974 году. Эта зима продолжалась примерно до 1993 года и положила конец коммерческому ажиотажу вокруг экспертных систем и специализированного оборудования для ИИ — однако символический ИИ как направление исследований сохранился.
Репозиторий UCI ML: библиотека наборов данных
Демократизация исследований в области машинного обучения с помощью стандартизированных эталонных наборов данных. В 1987 году аспирант UCI Дэвид Аха совместно с однокурсниками основал Репозиторий машинного обучения UCI (UCI Machine Learning Repository) как FTP-архив — коллекцию баз данных, предметных теорий и генераторов данных для эмпирического анализа алгоритмов машинного обучения. Эта инициатива устраняла критический дефицит стандартизированных общедоступных наборов данных для растущего сообщества в области машинного обучения. Репозиторий стал основным источником наборов данных для машинного обучения по всему миру и открыл студентам, преподавателям и исследователям доступ к высококачественным эталонным данным. За прошедшие годы он был процитирован десятки тысяч раз и входит в число наиболее используемых ресурсов в информатике. Сегодня репозиторий, управляемый Центром машинного обучения и интеллектуальных систем, предлагает наборы данных из здравоохранения, финансов и множества других областей. Репозиторий кардинально демократизировал образование и исследования в области машинного обучения.
Байесовские сети: рассуждения в условиях неопределённости
Пока нейронные сети и экспертные системы соперничали за внимание, Джуда Перл в Калифорнийском университете в Лос-Анджелесе строил третий фундаментальный столп ИИ: рассуждения в условиях неопределённости. В своей книге 'Probabilistic Reasoning in Intelligent Systems' (1988) он популяризировал байесовские сети — графы, в которых узлы представляют переменные, а рёбра — их вероятностные зависимости. Вместо жёстких правил 'если — то' и произвольных весовых коэффициентов экспертных систем они позволяли аккуратно сочетать знания и неопределённость и эффективно делать выводы. Байесовские сети определили ИИ и машинное обучение в 1990-х и 2000-х годах; Перл получил премию Тьюринга в 2011 году и впоследствии обратился к каузальному выводу — вопросу о причинах, стоящих за данными. Если подходить честно: теорема Байеса сама по себе восходит к XVIII веку; вклад Перла состоял не в изобретении теории вероятностей, а в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым применительно к ИИ.
Теорема об универсальной аппроксимации
Математическое доказательство теоретической мощи нейронных сетей. В 1989 году Курт Хорник, Максвелл Стинчкомб и Халберт Уайт опубликовали основополагающую статью 'Multilayer feedforward networks are universal approximators' в журнале Neural Networks. Их строгое доказательство показало: уже одного скрытого слоя с достаточным количеством нейронов хватает для сколь угодно точной аппроксимации любой борелевски измеримой функции. Эта теоретическая основа математически обосновала применение нейронных сетей и убедила исследователей в том, что достаточно большие сети способны моделировать сложные нелинейные зависимости в реальных данных. Параллельно появились схожие работы Джорджа Сайбенко и Фунахаси, использовавших различные методы. Теорема установила универсальность за счёт расширения скрытого слоя и стала теоретическим столпом для всех последующих разработок в области глубокого обучения. Хорник и соавторы создали математическую основу доверия, которая обеспечила возрождение нейронных сетей в 1990-е годы.
Всемирная паутина: изобретение WWW
Изобретение, которое объединило мир и заложило основу для современных источников данных ИИ. 12 марта 1989 года Тим Бернерс-Ли подал в ЦЕРН предложение по 'системе управления информацией' — первоначально названной 'Mesh', а впоследствии 'World Wide Web'. Британский учёный осознал необходимость автоматизированного обмена информацией между исследователями по всему миру. К концу 1990 года он разработал три фундаментальные веб-технологии: HTML (HyperText Markup Language), HTTP (HyperText Transfer Protocol) и URI/URL. Первый веб-сервер info.cern.ch работал на компьютере NeXT вместе с первым браузером-редактором 'WorldWideWeb.app'. В 1991 году Сеть стала общедоступной. Экспоненциальный рост — примерно с 10 сайтов (1992) до нескольких сотен тысяч (1996) — создал информационную основу для последующих систем ИИ. Без Всемирной паутины не существовало бы наборов данных Common Crawl и больших языковых моделей.
LeNet и рождение свёрточных нейронных сетей
Первое успешное практическое применение свёрточных нейронных сетей (CNN). В 1989 году Янн ЛеКун в AT&T Bell Labs впервые объединил метод обратного распространения ошибки (Backpropagation) с архитектурой CNN для распознавания рукописных символов. Эта система — впоследствии известная как прародитель семейства LeNet — распознавала рукописные почтовые индексы для Почтовой службы США (US Postal Service) с примечательной точностью: около 1% ошибок на обучающих данных и около 5% — на ранее не виденных тестовых данных; если сети разрешалось отклонять неуверенные случаи, ошибка на оставшихся цифрах снижалась примерно до 1%. Эти результаты доказали практическое превосходство CNN над традиционными подходами и заложили основу современного компьютерного зрения. Они показали, что нейронные сети — не просто теоретические конструкты, а инструмент для решения реальных бизнес-задач. Архитектура прошла несколько итераций улучшений и в 1998 году воплотилась в LeNet-5, достигшей точности 99,05% на MNIST. Эта работа заложила фундамент всех современных архитектур CNN.
TD-Gammon: обучение через игру против самого себя
Задолго до AlphaGo одна программа IBM показала, на что способно обучение с подкреплением: в 1992 году Джеральд Тесауро представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды. Примечательным был метод обучения. TD-Gammon тренировался почти исключительно за счёт сотен тысяч партий против самого себя, обучаясь по итогам игр с помощью метода временных разностей (Temporal Difference), постепенно корректирующего прогнозы. Никто не показывал ему хороших ходов. Сеть достигла почти мирового уровня и даже открыла начальные ходы, которые профессиональные игроки-люди впоследствии переняли. Важная оговорка: каким бы впечатляющим ни был этот успех, он долгое время не поддавался переносу на другие игры. Одна из причин — в кубиках: нарды являются игрой с элементом случайности, и случай сам по себе обеспечивает разнообразие при тренировках — преимущество для самоигры, которого детерминированные игры вроде шахмат или го не дают.
Q-обучение: фундамент обучения с подкреплением
В 1992 году Крис Уоткинс и Питер Даян опубликовали математическое доказательство для Q-обучения (Q-learning) — алгоритма, которому предстояло существенно изменить мир ИИ. Основную идею Уоткинс разработал ещё в 1989 году в своей докторской диссертации 'Learning from Delayed Rewards' в King's College Cambridge. Q-обучение решало фундаментальную задачу: как агент может действовать оптимально, не нуждаясь в модели своей среды? Ответ был элегантным — через последовательную оптимизацию Q-функции, которая присваивает значение каждой паре состояние-действие. Доказательство сходимости 1992 года показало: при бесконечном исследовании Q-обучение гарантированно находит оптимальную стратегию для любой конечной задачи Маркова (Markov Decision Problem). Этот безмодельный метод стал краеугольным камнем современного обучения с подкреплением. От робототехники до финансовых рынков, от игр до автономных систем — Q-обучение применяется повсеместно. В конце 2013 года DeepMind представил глубокий вариант — Deep Q-Networks (DQN) (публикация в Nature в 2015 году), достигнув при этом на большинстве игр Atari уровня или превысив уровень человека. По сей день Q-обучение — прежде всего в форме Deep Q-Network — является одним из основных строительных блоков многочисленных систем ИИ.
Penn Treebank: синтаксическая разметка меняет NLP
Создание фундаментального корпуса для современных исследований в области синтаксического разбора. В 1993 году Митчелл Маркус, Беатрис Санторини и Мэри Энн Марцинкевич опубликовали основополагающую статью 'Building a Large Annotated Corpus of English: The Penn Treebank' в журнале Computational Linguistics. Более 4,5 миллиона слов американского английского, размеченных частями речи, и около 3 миллионов из них — с детальной синтаксической (скелетной) разметкой: Penn Treebank существенно изменил компьютерную лингвистику. Двухэтапный метод сочетал автоматическую POS-разметку с ручной корректурой, обеспечивая исключительное качество аннотации. За всё время проекта — около семи лет (1989–1996) — и в расширенном Penn Treebank II в общей сложности были созданы 7 миллионов слов с POS-разметкой, 3 миллиона текстов со скелетным разбором и 2 миллиона структур предикат-аргумент. Penn Treebank утвердил эмпирические методы в компьютерной лингвистике и стал основой современных алгоритмов синтаксического разбора. По сей день Penn Treebank служит современным NLP-системам важным эталоном для оценки синтаксического разбора и языкового моделирования.
AdaBoost: слабые обучающиеся становятся сильными
В 1995 году Йоав Фройнд и Роберт Шапир разработали AdaBoost (Adaptive Boosting) — алгоритм, существенно изменивший машинное обучение. Их ключевая идея: объединить множество 'слабых обучающихся' в высокоточную модель предсказания. Слабый обучающийся лишь немного лучше случайного угадывания — но сотни таких вместе способны достигать впечатляющих результатов. AdaBoost адаптируется: неверные предсказания на следующем шаге получают больший вес. Так система автоматически фокусируется на трудных случаях. Теоретическая элегантность подкупала — Фройнд и Шапир доказали, что ошибка на обучающей выборке убывает экспоненциально быстро, пока каждый слабый обучающийся лучше случайного. В 2003 году они получили за это обоснование теории бустинга Премию Гёделя — одну из самых престижных наград в теоретической информатике. AdaBoost нашёл практическое применение в биологии, компьютерном зрении и распознавании речи. Метод заложил фундамент для современных ансамблевых методов и вдохновил целое поколение алгоритмов бустинга вплоть до XGBoost.
Метод опорных векторов: классификация с максимальным зазором
Утверждение элегантного геометрического подхода к надёжной классификации. В 1995 году Коринна Кортес и Владимир Вапник опубликовали в AT&T Bell Labs основополагающую статью 'Support-Vector Networks' в журнале Machine Learning. Метод опорных векторов (SVM) расширил ранний подход Вапника и Червоненкиса к максимальному зазору 1964 года ('Обобщённый портрет') до практического решения для неразделимых обучающих данных благодаря нововведению 'мягкого зазора' (Soft Margin). Ключевой принцип состоит в построении линейных решающих поверхностей в многомерных пространствах признаков с помощью нелинейных преобразований входных данных. Ядерный трюк (Kernel Trick) 1992 года позволил эффективно выполнять вычисления без явного преобразования. Методы опорных векторов максимизируют зазор между классами и тем самым обеспечивают высокую способность к обобщению. Набрав десятки тысяч цитирований, статья стала одной из наиболее цитируемых в области машинного обучения и доминировала в задачах классификации вплоть до революции глубокого обучения. Методы опорных векторов по-прежнему остаются надёжными, интерпретируемыми и эффективными для высокоразмерных задач.
WordNet: семантическая сеть языка
Первый лексический словарь для вычислительной лингвистики, построенный как семантическая сеть. В ноябре 1995 года Джордж Миллер опубликовал основополагающую статью 'WordNet: A Lexical Database for English' в журнале Communications of the ACM, представив идею, которую разрабатывал с 1986 года. WordNet организует английские существительные, глаголы, прилагательные и наречия в синсеты (synsets) — когнитивные группы синонимов, связанные семантическими и лексическими отношениями. Эта структура отражает семантическую память человека и позволяет перемещаться по сети слов и понятий, связанных по смыслу. Машиночитаемые словари существовали и прежде, однако WordNet стал первым, где словарный запас последовательно моделировался как сеть синсетов и отношений значений, соединяя традиционную лексикографическую информацию с современной обработкой данных. Разработка началась в 1986 году под руководством Миллера и его команды в Принстонском университете; WordNet стал основой для иерархий ImageNet и современных систем обработки естественного языка. Структура семантической сети повлияла на все последующие графы знаний и техники встраивания.
PageRank: алгоритм Google ценой в миллиарды
В 1996 году двое аспирантов Стэнфорда разработали алгоритм, которому предстояло существенно изменить интернет. Ларри Пейдж и Сергей Брин запустили проект 'BackRub', основанный на оригинальной идее: важность веб-страницы определяется не только её содержанием, но и ссылками, которые на неё указывают. Как при научном цитировании: чем чаще на страницу ссылаются, тем она важнее. Алгоритм PageRank моделирует 'случайного сёрфера', который случайным образом переходит по ссылкам в интернете. Чем чаще случайный сёрфер попадает на страницу через структуру ссылок, тем выше её значимость. Веб-краулер Пейджа стартовал в марте 1996 года с его собственной стэнфордской домашней страницы. Формальная публикация статьи по PageRank состоялась в январе 1998 года в виде технического отчёта Стэнфорда. К августу 1996 года BackRub уже обнаружил около 75 миллионов URL — адресов, найденных по ссылкам, из которых лишь часть была реально обойдена краулером. Даже ранний стэнфордский прототип давал более релевантные результаты, чем современные поисковые сервисы — Excite или Yahoo!. Стэнфорд получил патент и продал свои 1,8 миллиона акций Google в 2005 году за 336 миллионов долларов. Из университетского проекта выросла одна из самых успешных поисковых систем — и основа современного веб-ИИ.
Deep Blue побеждает Каспарова
Первая победа машины над действующим чемпионом мира по шахматам в условиях турнира. 11 мая 1997 года Deep Blue вошёл в историю: суперкомпьютер IBM победил Гарри Каспарова в матче-реванше в Нью-Йорке со счётом 3,5:2,5. После поражения 1996 года IBM кардинально переработала систему: новые шахматные чипы удвоили скорость до 200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров повысили игровую силу. Решающая шестая партия длилась всего один час — после жертвы коня Каспаров быстро оказался в объективно проигранной позиции и сдался уже на 19-м ходу, что стало беспрецедентным моментом в его карьере. Победа впервые продемонстрировала превосходство компьютеров в сложном стратегическом мышлении и стала поворотным моментом в общественном восприятии ИИ. Призовой фонд в 700 000 долларов для Deep Blue подчеркнул историческое значение этого триумфа машинного интеллекта.
LSTM: Долгая краткосрочная память
Решение проблемы затухающего градиента и рождение эффективного моделирования последовательностей. 15 ноября 1997 года Сепп Хохрайтер и Юрген Шмидхубер опубликовали основополагающую статью «Long Short-Term Memory» в Neural Computation. Их инновация решила фундаментальную проблему рекуррентных сетей: исчезновение градиентов на длинных последовательностях. LSTM ввёл специальные ячейки памяти с механизмами гейтов, обеспечивающими константный поток ошибки через тысячи временных шагов. Мультипликативные гейты учатся открывать и закрывать доступ к константной карусели ошибок. С O(1)-сложностью на временной шаг и локальным обучением LSTM значительно превзошёл все существовавшие тогда RNN-методы. Система впервые решила сложные проблемы с долгими временными задержками, которые ранее были нерешаемы. LSTM стал основой для современного распознавания речи, перевода и анализа временных рядов.
MNIST: стандарт машинного обучения
Создание одного из важнейших эталонных наборов данных для начинающих в области компьютерного зрения. В 1998 году Янн ЛеКун, Коринна Кортес и Кристофер Бёрджес представили набор данных MNIST — курированную коллекцию рукописных цифр, ставшую 'Hello World' машинного обучения. Основанный на Special Database 3 и Special Database 1 от NIST, MNIST содержит 70 000 нормализованных изображений размером 28x28 пикселей в оттенках серого: 60 000 для обучения и 10 000 для тестирования. Тщательная предобработка и сглаживание сделали MNIST идеальным для учебных целей без трудоёмкой подготовки данных. MNIST появился в статье 'Gradient-based learning applied to document recognition' (Proceedings of the IEEE, ноябрь 1998). Набор данных стал стандартным эталоном для бесчисленных алгоритмов машинного обучения и позволил целым поколениям студентов получить первые результаты в области компьютерного зрения. MNIST демократизировал образование в сфере машинного обучения по всему миру.
Случайный лес: прорыв в ансамблевых методах
В 2001 году Лео Брейман из Калифорнийского университета в Беркли опубликовал одну из наиболее цитируемых статей по машинному обучению за всё время — 'Random Forests'. Его алгоритм существенно изменил концепцию ансамблевых методов и стал одним из важнейших инструментов современной статистики. Базовая идея была гениально проста: вместо одного дерева решений обучают сотни случайных деревьев и дают им проголосовать. Каждое дерево видит лишь случайное подмножество данных и признаков — 'бэггинг' (bagging) в сочетании с рандомизацией признаков. Результат: резкое снижение проблем переобучения (overfitting) и исключительная точность предсказаний. Брейман также предоставил теоретическую основу — границы ошибки обобщения, основанные на силе дерева и корреляции. Случайный лес стал одним из самых не требующих обслуживания алгоритмов машинного обучения типа 'подключи и работай': минимальная настройка, максимальная производительность. От биоинформатики до анализа финансовых рынков случайный лес по сей день доминирует в бесчисленных приложениях и сделал ансамблевые методы стандартным инструментом — параллельно с направлением бустинга (boosting), из которого впоследствии вырос XGBoost.
Основание Future of Humanity Institute
Институционализация исследований безопасности ИИ и оценки экзистенциальных рисков. В 2005 году Ник Бостром основал Future of Humanity Institute в Оксфордском университете как мультидисциплинарную исследовательскую группу. Начав всего с трёх исследователей, FHI превратился в интеллектуальный центр притяжения для блестящих, нередко эксцентричных мыслителей и вырос примерно до 40 сотрудников. Институт создал новые исследовательские области: экзистенциальные риски, выравнивание ИИ (AI Alignment), управление ИИ (AI Governance) и долгосрочное мышление (Longtermism). Ранние публикации Бострома, такие как 'The fable of the dragon tyrant' (2005) и 'What is a singleton?' (2006), сформировали подходы к безопасности ИИ. Несмотря на относительно короткие 19 лет существования вплоть до закрытия в 2024 году, FHI внёс значительный вклад и создал новый способ мышления о ключевых вопросах человечества. Академическая легитимизация исследований безопасности ИИ через Оксфорд придала этой области научный авторитет.
DARPA Grand Challenge: рождение автономного вождения
8 октября 2005 года синий Volkswagen Touareg по имени 'Stanley' вошёл в историю. Под руководством Себастьяна Труна команда Stanford Racing Team выиграла DARPA Grand Challenge — первое в мире успешное соревнование автономных транспортных средств. После того как в 2004 году все участники потерпели неудачу (лучший результат: 7,4 мили, то есть 11,9 км), Stanley прошёл весь маршрут длиной 212 км по пустыне за 6 часов 53 минуты. Финишную черту пересекли пять машин, четыре из них — в рамках временного лимита; это был разительный прогресс по сравнению с нулём в предыдущем году. Stanley преодолел три узких тоннеля, более 100 крутых поворотов и опасный Beer Bottle Pass с его обрывами. Новаторство состояло в программном обеспечении, а не в аппаратной части: сенсоры LiDAR, машинное обучение и журнал решений человека-водителя дали Stanley возможности, которых прежде не было ни у одного робота. Призовые 2 миллиона долларов стали лишь началом — Stanley заложил основу для Tesla Autopilot, Google Waymo и всей индустрии автономных транспортных средств. Сегодня Stanley хранится в Смитсоновском музее.
Сети глубокого доверия: ренессанс глубокого обучения
В 2006 году Джеффри Хинтон изменил мир ИИ своей важной статьёй о сетях глубокого доверия (Deep Belief Networks). После многолетнего затишья в области нейронных сетей он показал, как можно эффективно обучать глубокие нейронные сети. Его инновация: послойное предобучение (Pre-Training) с помощью ограниченных машин Больцмана (Restricted Boltzmann Machines, RBM). Эта 'жадная' стратегия обучения решила проблему инициализации весов и сделала глубокое обучение (Deep Learning) практически применимым. Метод складывает RBM поверх друг друга и обучает каждый слой отдельно, после чего вся сеть дорабатывается в целом. Работа Хинтона положила конец многолетнему забвению нейронных сетей и открыла эпоху их возрождения. Уже в 2009 году DBN значительно снизили частоту ошибок в распознавании речи. В 2012 году команда Хинтона победила на соревновании ImageNet Challenge (ILSVRC) с AlexNet — глубокой свёрточной нейронной сетью, обученной с использованием GPU, ReLU и Dropout, которая уже не зависела от RBM-предобучения DBN. AlexNet достигла частоты ошибок top-5 на уровне 15,3% против 26,2% у второй команды — значительное улучшение. Этот момент знаменует возрождение нейронных сетей и начало нынешнего подъёма ИИ.
Приз Netflix: алгоритм за миллион долларов
Демократизация машинного обучения посредством краудсорсингового конкурса беспрецедентного масштаба — с открытым набором данных и призовым фондом в один миллион долларов. 2 октября 2006 года Netflix запустил этот конкурс с призом в миллион долларов: кто улучшит алгоритм рекомендаций Cinematch на 10 %? Предоставив более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов, Netflix создал один из крупнейших общедоступных наборов данных для машинного обучения. Зарегистрировалось более 40 000 команд из 186 стран, из которых более 5 000 попали в квалификационную таблицу лидеров и в совокупности подали около 44 000 допустимых решений. Когда 26 июня 2009 года команда 'BellKors Pragmatic Chaos' первой преодолела отметку в 10 %, это запустило 30-дневный финальный этап, завершившийся 26 июля 2009 года; официально победитель с улучшением на 10,06 % был объявлен на церемонии награждения 21 сентября 2009 года. Рецепт успеха: ансамблевое сочетание матричной факторизации и ограниченных машин Больцмана. Конкурс существенно изменил коллаборативную фильтрацию и продемонстрировал мощь краудсорсинга для решения сложных задач машинного обучения. Несмотря на то что Netflix так и не внедрил алгоритмы победителей в производство (слишком высокие затраты на реализацию), конкурс оказал долгосрочное влияние на современную индустрию рекомендательных систем.
Основан фонд Common Crawl
Демократизация интернета как обучающих данных для искусственного интеллекта. В 2007 году Гил Эльбаз основал фонд Common Crawl с миссией: архивировать весь публичный интернет и делать его свободно доступным. С 2008 года начался систематический сбор данных (краулинг), и с тех пор корпус растёт на миллиарды страниц ежемесячно, достигнув к 2024 году порядка более 100 миллиардов веб-страниц и нескольких петабайт данных. Эта коллекция стала важнейшим источником обучающих данных для больших языковых моделей (Large Language Models) и обеспечила разработку GPT-3, ChatGPT, LLaMA и других современных систем ИИ. Common Crawl отличается от коммерческих подходов своей некоммерческой природой и открытой доступностью. Необработанные исходные данные требуют последующей обработки, однако фонд демократизировал доступ к обширным языковым данным и сделал ИИ-исследования менее зависимыми от проприетарных наборов данных.
CUDA: видеокарта становится двигателем ИИ
Революция ИИ 2012 года работала не только на алгоритмах — она работала на видеокартах. Почву для этого подготовила NVIDIA в 2007 году с CUDA: платформой, позволявшей запускать обычные программы на языке, подобном C, прямо на GPU — а не только графику. Анонсированная с чипом G80 в конце 2006 года, в феврале 2007 вышедшая в публичную бету и выпущенная в виде версии 1.0 в июне 2007 года, CUDA впервые открыла широкий доступ к огромному параллелизму графических процессоров. Это прекрасно сочетается с нейронными сетями, вычисления в которых сводятся к матричным умножениям — тысячи мелких операций одновременно. Пять лет спустя Крижевский, Суцкевер и Хинтон обучили AlexNet на двух картах NVIDIA GTX 580 с CUDA — прорыв, зажёгший глубокое обучение. С 2014 года cuDNN от NVIDIA поставлял оптимизированные строительные блоки, на которых сегодня работают TensorFlow, PyTorch и другие фреймворки. Если подходить честно: CUDA не изобрела GPGPU (программируемые шейдеры появились в 2001 году, BrookGPU — в 2004-м) и не стала единственной причиной глубокого обучения — но она сделала необходимые вычислительные мощности доступными, а без них ничего остального просто не было бы.
Обучение с нулевым числом примеров: обучение без данных
Формализация обучения на невиданных ранее классах посредством семантических описаний. В июле 2008 года Хьюго Ларошель, Думитру Эрхан и Йошуа Бенжио представили на конференции AAAI работу 'Zero-data Learning of New Tasks', заложив теоретическую предварительную формализацию. Само название 'Zero-Shot Learning' закрепили в 2009 году две другие группы исследователей: Палатуччи с коллегами в статье 'Zero-Shot Learning with Semantic Output Codes' на конференции NIPS 2009 и Лямперт с коллегами, предложивший основанный на атрибутах подход на конференции CVPR 2009. Фундаментальная проблема: как модель может классифицировать классы, для которых отсутствуют обучающие данные, а есть только описания? Решение состояло в семантических векторных представлениях (embedding) и переносе обучения — повторном использовании обученных моделей для новых задач. Формализация Ларошеля была направлена на очень большие наборы классов, которые не могут быть полностью охвачены обучающими данными. Экспериментальный анализ подтвердил значительные способности к обобщению в этом контексте. Эта работа заложила концептуальный фундамент для современных возможностей Few-Shot и Zero-Shot в GPT-3, GPT-4 и других больших языковых моделях. Обучение с нулевым числом примеров стало ключевой технологией для масштабируемых систем ИИ.
Создание датасетов CIFAR
Создание фундаментального бенчмарка для компьютерного зрения. В 2009 году Алекс Крижевский, Винод Наир и Джеффри Хинтон в Университете Торонто разработали датасеты CIFAR-10 и CIFAR-100. Они были созданы как размеченные подмножества из 80-миллионного датасета изображений «Tiny Images». CIFAR-10 содержит 60 000 цветных изображений 32x32 пикселя в десяти категориях: самолёты, автомобили, животные и другие, а CIFAR-100 распределяет то же количество изображений по ста более детальным классам. Датасеты стали одним из важнейших бенчмарков в исследованиях компьютерного зрения и позволили стандартизировать сравнение различных алгоритмов. Примечательна связь с AlexNet: Крижевский использовал CIFAR-10 ещё до 2011 года для обучения небольших CNN на одиночных GPU — предшественник его позднейшего успеха ImageNet в 2012 году.
ImageNet: набор данных, изменивший всё
Создание набора данных, который открыл путь к развитию глубокого обучения. В 2009 году Фэй-Фэй Ли вместе со своей командой представила статью по ImageNet и продемонстрировала визуальную базу данных, призванную преобразовать компьютерное зрение. На момент запуска она насчитывала около 3,2 миллиона изображений с ручной разметкой примерно в 5 200 категориях. В полном объёме ImageNet впоследствии охватил более 14 миллионов изображений с ручными аннотациями и около 22 000 категорий, основанных на иерархиях WordNet, — тем самым устраняя критическое узкое место: нехватку больших, высококачественных обучающих данных. Разметку выполняли около 49 000 работников из 167 стран через Amazon Mechanical Turk — проект беспрецедентного масштаба. То, что начиналось как постер в углу конференц-зала в Майами-Бич, переросло в ежегодный ImageNet Challenge (ILSVRC) и стало одним из трёх движущих факторов развития современного ИИ. ImageNet открыл путь к прорыву AlexNet в 2012 году и заложил фундамент для автономных транспортных средств, распознавания лиц и медицинской визуализации.
Основание DeepMind
Рождение лаборатории ИИ, которой предстояло делать заголовки новостей. В сентябре 2010 года Демис Хассабис, Шейн Легг и Мустафа Сулейман основали в Лондоне DeepMind Technologies. Их цель: разработать общий искусственный интеллект, объединив знания из нейронауки и машинного обучения. Хассабис, бывший вундеркинд в шахматах и разработчик игр, принёс уникальное видение: ИИ должен учиться подобно человеческому мозгу. В 2014 году Google приобрела стартап примерно за 500 миллионов долларов — одно из крупнейших приобретений в области ИИ в истории. Впоследствии DeepMind поразит мир прорывами AlphaGo, AlphaFold и другими достижениями.
ImageNet Challenge: начало соревнования
Учреждение важнейшего эталона компьютерного зрения в истории ИИ. В 2010 году стартовал первый ImageNet Large Scale Visual Recognition Challenge (ILSVRC) — стандартизированное соревнование, которое определило направление исследований компьютерного зрения на следующее десятилетие. С 1 000 категориями объектов и 1,2 миллиона обучающих изображений этот конкурс значительно превзошёл доступные на тот момент эталоны, например PASCAL VOC, располагавший лишь 20 классами. Оценка проводилась по метрикам Top-1 и Top-5 ошибок — стандартам, актуальным и по сей день. С 2010 по 2017 год точность Top-5 у победителей существенно выросла: с 71,8 % до 97,3 %, в конечном счёте превысив уровень человека. Ежегодный конкурс привлёк более 50 организаций со всего мира и катализировал достижения, кульминацией которых в 2012 году стал значительный прорыв AlexNet — уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности).
Watson побеждает чемпионов Jeopardy
Триумф IBM в обработке естественного языка и доказательство машинного понимания речи. 16 февраля 2011 года система IBM Watson в телевизионном шоу Jeopardy! победила двух самых успешных чемпионов за всю историю: Кена Дженнингса (74 победы подряд) и Брэда Раттера (3,25 миллиона долларов выигрышей до 2005 года). Watson, разработанный командой DeepQA под руководством Дэвида Феруччи, состоял из 90 серверов IBM Power 750 (в 10 стойках) с 16 терабайтами оперативной памяти и 2 880 процессорными ядрами POWER7. Новаторство заключалось в обработке естественного языка: Watson понимал вопросы на обычном языке и отвечал точнее любой стандартной поисковой технологии — без подключения к интернету. Выиграв 77 147 долларов (пожертвованных на благотворительность), Watson обошёл своих соперников-людей более чем на 50 000 долларов. Знаменитая заключительная реплика Кена Дженнингса — 'I for one welcome our new computer overlords' — подчеркнула историческое значение этого рубежа в области обработки естественного языка.
Запуск Siri: голосовой ассистент становится массовым явлением
4 октября 2011 года Apple существенно изменила взаимодействие человека с компьютером, представив Siri на iPhone 4S. Как первый голосовой ассистент, глубоко интегрированный в смартфон для широкой аудитории, Siri принесла ИИ в карманы миллионов людей. 'Какая сегодня погода?' или 'Найди мне хороший греческий ресторан' — внезапно пользователи смогли говорить со своим телефоном естественным образом. Siri не была совершенно новым изобретением: с 2010 года она существовала как отдельное iOS-приложение компании Siri Inc. (приобретённой Apple), а Google уже предлагал голосовой поиск Voice Actions. Но именно бесшовная интеграция Apple в операционную систему превратила голосового ассистента в массовое явление. Siri опиралась на десятилетия исследований в SRI International и проекте CALO от DARPA. Сьюзан Беннетт ещё в 2005 году неосознанно записала оригинальный голос. Стив Джобс, тяжело больной в последние дни жизни, сам не выступил на презентации — iPhone 4S представлял Тим Кук. На следующий день после представления Siri Джобс скончался. Siri не была идеальной — критики указывали на жёсткие команды и недостаточную гибкость. Но цель была достигнута: ИИ стал массовым явлением. Siri вдохновила Amazon Alexa, Google Assistant и Microsoft Cortana. Эпоха голосовых ассистентов началась.
Dropout-регуляризация
В июле 2012 года Джеффри Хинтон, Нитиш Шривастава, Алекс Крижевский, Илья Суцкевер и Руслан Салахутдинов значительно изменили обучение нейронных сетей, изобретя Dropout-регуляризацию. Эта элегантная техника предотвращает переобучение (Overfitting) путём случайного отключения примерно половины всех нейронов во время обучения, что устраняет сложные совместные адаптации. Вместо того чтобы запоминать специфические комбинации признаков, каждый нейрон учится распознавать устойчивые, универсально полезные паттерны. Метод, опубликованный на arXiv 3 июля 2012 года, несколько месяцев спустя стал одним из ключевых элементов победы AlexNet на ImageNet в рамках ILSVRC 2012, результаты которого были представлены в октябре 2012 года, — наряду с GPU-обучением, ReLU-активацией и глубиной сети, — и превратился в стандарт большинства современных архитектур глубокого обучения. Dropout устанавливает новые рекорды в распознавании речи и объектов и решает центральную проблему переобучения глубоких сетей.
Успех AlexNet
Переломный момент для глубокого обучения и современного ИИ. 30 сентября 2012 года были опубликованы результаты конкурса ImageNet Challenge, который AlexNet выиграл с таким отрывом, что это навсегда изменило компьютерное зрение. Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон из Университета Торонто разработали CNN-архитектуру, которая превзошла конкурентов на впечатляющие 10,9 процентных пункта — улучшение, признанное в научном сообществе исключительным. Имея 60 миллионов параметров и используя инновационные методы, такие как активации ReLU и слои Dropout, AlexNet наглядно продемонстрировал практическое превосходство глубокого обучения. Это был момент, когда интересная теория стала доминирующей технологией. Янн ЛеКун назвал это 'несомненным переломным моментом в истории компьютерного зрения'. Реализация на основе GPU открыла путь к современному развитию ИИ.
Революция глубокого обучения
Год, ознаменовавший начало современной эпохи ИИ благодаря сочетанию наборов данных, вычислительной мощи GPU и нейронных архитектур. 2012 год отметил подъём глубокого обучения (Deep Learning) как доминирующей технологии ИИ — катализатором стала впечатляющая победа AlexNet на ImageNet. Это стало возможным благодаря конвергенции трёх факторов: набор данных ImageNet, созданный Фэй-Фэй Ли, предоставил огромное количество размеченных обучающих данных; вычисления на GPU обеспечили необходимую мощность для обучения глубоких сетей; улучшенные методы обучения — ReLU-активации и Dropout-регуляризация — преодолели прежние ограничения. Команда Джеффри Хинтона — Алекс Крижевский, Илья Суцкевер и сам Хинтон — доказала в доме родителей Крижевского на двух картах Nvidia, что глубокие нейронные сети практически применимы. AlexNet стал поворотным моментом для компьютерного зрения. Этот успех значительно усилил интерес к глубокому обучению и открыл путь к VGG, ResNet и, наконец, к сегодняшнему развитию генеративного ИИ.
Word2Vec: слова как векторы
Преобразование представления слов через семантические векторные пространства. 16 января 2013 года Томас Миколов вместе со своей командой в Google опубликовал основополагающую статью 'Efficient Estimation of Word Representations in Vector Space'. Word2Vec изменил обработку естественного языка, представив слова в виде плотных, низкоразмерных векторов (как правило, от 100 до 300 измерений), отражающих семантические и синтаксические связи, — в противовес огромным, разреженным one-hot-векторам прежних методов. Две архитектурных варианта — CBOW (Continuous Bag of Words) и Skip-Gram — обучались на больших текстовых корпусах на основе наблюдения, что схожие слова встречаются в схожих контекстах. Знаменитый пример продемонстрировал векторную арифметику: король - мужчина + женщина = королева. С более чем 49 000 цитирований работа Миколова стала одной из самых влиятельных в области обработки естественного языка. Word2Vec заложил фундамент для всех современных техник встраивания (embedding) и открыл возможность семантических рассуждений в векторных пространствах. Это новшество проложило путь к архитектурам Transformer и современным большим языковым моделям.
VAE: вариационные автокодировщики
Разработка вероятностных генеративных моделей посредством моделирования скрытого пространства. 20 декабря 2013 года Дидерик Кингма и Макс Веллинг опубликовали статью 'Auto-Encoding Variational Bayes'. Вариационные автокодировщики (VAE) соединяют сети кодировщика и декодировщика через вероятностное скрытое пространство — как правило, многомерное гауссово распределение. В отличие от детерминированных автокодировщиков, кодировщик представляет данные как распределения, а не отдельные точки, что позволяет осуществлять непрерывную интерполяцию и генерацию данных. Трюк репараметризации (Reparameterization Trick) делает случайность дифференцируемым элементом входных данных модели и обеспечивает стандартную оптимизацию по градиенту. В своих экспериментах VAE генерировали рукописные цифры (MNIST) и небольшие изображения лиц (Frey Faces) — пусть и размытые, но служащие доказательством применимости вариационного вывода. Эта работа заложила фундамент современного генеративного ИИ и оказала влияние на последующие вероятностные подходы вплоть до диффузионных моделей.
Adam: стандартный оптимизатор глубокого обучения
Чтобы нейронная сеть обучалась, оптимизатор должен шаг за шагом поворачивать миллионы настроечных параметров в нужную сторону. В 2014 году Дидерик Кингма и Джимми Ба представили метод, который быстро стал самым востребованным в отрасли: Adam — название происходит от английского Adaptive Moment Estimation и не является аббревиатурой. Хитрость Adam в том, что для каждого отдельного параметра ведётся собственная, автоматически адаптируемая скорость обучения. Метод объединяет две проверенные идеи — импульс (momentum), сохраняющий предыдущее направление, и адаптивный размер шага в духе RMSProp. Результат: сети обучаются надёжно, без мучительного подбора скорости обучения. Статья стала одной из наиболее цитируемых в исследованиях ИИ. Если подходить честно: Adam — не панацея. В ряде случаев более простой SGD лучше обобщает данные на новые ситуации. Кроме того, Adam опирается на предшественников — AdaGrad и RMSProp, — а более поздние варианты, такие как AdamW (2017), пришлось доработать, чтобы исправить слабые места оригинала.
MS COCO: золотой стандарт компьютерного зрения
В 2014 году исследовательская группа под руководством Microsoft Research, Корнеллского университета и Калифорнийского университета в Беркли существенно изменила исследования в области компьютерного зрения с помощью набора данных COCO (Common Objects in Context). В отличие от ImageNet с изолированными объектами, COCO показывал предметы в их естественном контексте — так, как они встречаются в реальном мире. 2,5 миллиона аннотаций в 328 000 изображениях, разделённых на 91 категорию в исходной статье, из которых 80 образуют актуальный по сей день эталон для задач обнаружения объектов, — всё это предметы повседневной жизни, которые узнал бы четырёхлетний ребёнок. Инновация заключалась в деталях: маски сегментации с точностью до пикселя вместо обычных ограничивающих рамок. COCO впервые обеспечил возможность точной локализации объектов и понимания сложных сцен. Набор данных стал золотым стандартом для обнаружения объектов, сегментации экземпляров и создания описаний изображений. От YOLO до Mask R-CNN — все ведущие модели компьютерного зрения оцениваются по COCO. Стандартизированные метрики, такие как средняя точность (mAP), сделали сравнение моделей объективно возможным. Спустя более десяти лет COCO по-прежнему остаётся важнейшим эталоном в сообществе компьютерного зрения. Без COCO не было бы современных систем обнаружения объектов в автономных транспортных средствах, системах видеонаблюдения и дополненной реальности.
GAN — генеративно-состязательные сети
Иэн Гудфеллоу изобрёл генеративно-состязательные сети (GAN) в 2014 году за одну ночь в Монреале после посещения паба. Его новаторский подход заставляет две нейронные сети соревноваться в игре с минимакс-стратегией: генератор создаёт искусственные данные, дискриминатор пытается отличить настоящие данные от поддельных. Это состязательное обучение кардинально изменило генеративный ИИ. Оригинальная GAN 2014 года генерировала лишь небольшие размытые изображения (например, цифры и лица), однако проложила путь к последующей фотореалистичной генерации изображений. Работа, опубликованная в 2014 году на arXiv, стала одной из наиболее влиятельных статей в области ИИ и принесла Гудфеллоу широкую известность. За ней последовали сотни вариантов GAN.
Механизм внимания: ключ к современным большим языковым моделям
Сентябрь 2014 года: Дзмитры Бахданау, Кюнхён Чо и Йошуа Бенжио опубликовали статью, которой предстояло навсегда изменить мир обработки естественного языка (NLP). 'Neural Machine Translation by Jointly Learning to Align and Translate' решила фундаментальную проблему моделей Sequence-to-Sequence. Прежние архитектуры кодировщик-декодировщик сжимали каждое входное предложение в единственный вектор фиксированной длины — информационное узкое место при длинных предложениях. Attention Бахданау стала значительным шагом вперёд: вместо фиксированного вектора модель использовала динамическое внимание к различным частям входного предложения. Подобно тому как человеческий глаз перемещается при чтении, внимание ИИ перескакивает между релевантными словами. Эта 'Additive Attention' стала концептуальным предшественником современных NLP-систем. Трансформер (2017), появившийся позже, опирался на идею внимания, но заменил аддитивный вариант более эффективным Scaled-Dot-Product Attention. Без концепции Attention Бахданау не было бы трансформеров, без трансформеров — ни семейства GPT, ни BERT. Этот прорыв произошёл за три года до выхода статьи 'Attention Is All You Need'.
Запуск Amazon Alexa и Echo
6 ноября 2014 года Amazon представил Alexa и умную колонку Echo, существенно изменив взаимодействие человека с технологиями. Поначалу Echo продавался только по приглашениям и исключительно для участников Prime; лишь с началом открытых продаж в 2015 году голосовой ИИ стал доступен широкому кругу потребителей и превратил дом в управляемую голосом среду. Опираясь на польскую технологию синтеза речи Ivona, приобретённую 24 января 2013 года, Amazon создал принципиально новый пользовательский опыт. Echo стартовал как устройство для управления музыкой, однако быстро превратился в универсальный центр умного дома. Это новшество породило массовую категорию продуктов и ознаменовало начало масштабного развития рынка умных колонок, вдохновив многочисленных конкурентов.
Deep Q-Networks: ИИ учится играть в Atari по пикселям
Задолго до того как AlphaGo попал в заголовки газет, DeepMind в 2015 году научила ИИ играть в видеоигры Atari, опираясь исключительно на сырые пиксели изображения, — и тем самым заложила фундамент глубокого обучения с подкреплением. В феврале 2015 года команда под руководством Владимира Мних опубликовала в Nature статью 'Human-level control through deep reinforcement learning' (предварительная версия вышла в 2013 году). Нейронная сеть, которая видела лишь экран и счёт, обучилась играть в 49 различных игр Atari — с одной и той же архитектурой, без дополнительной настройки под каждую игру. Технически DeepMind объединила свёрточную сеть с Q-обучением, буфером опыта (Experience Replay, введённым Лином в начале 1990-х) и стабилизирующей целевой сетью. При оценке важна точность: система достигала человеческого уровня примерно в половине игр и превзошла все прежние методы в 43 из 49 — однако в играх с редкими наградами, таких как Montezuma's Revenge, её результат был почти нулевым. Тем не менее это стало доказательством того, что глубокие сети и обучение с подкреплением совместимы в большом масштабе — мостом от Q-обучения 1990-х к AlphaGo и AlphaZero.
Batch Normalization: важный прогресс в обучении нейронных сетей
11 февраля 2015 года Сергей Иоффе и Кристиан Сегеди из Google опубликовали статью, которая существенно изменила обучение глубоких нейронных сетей. Их диагноз: 'Internal Covariate Shift' — распределение входных данных каждого слоя смещается в процессе обучения, что делает его нестабильным. Их элегантное решение: Batch Normalization (пакетная нормализация) нормализует активации каждого слоя для каждого мини-пакета. Эффект оказался значительным: примерно в 14 раз меньше шагов обучения до достижения той же точности. Стали возможны более высокие скорости обучения, Dropout нередко оказывался лишним, а инициализация — менее критичной. Метод выступал одновременно и как регуляризатор, и как ускоритель. Ансамбль на ImageNet достиг 4,8% ошибок в топ-5, превзойдя тем самым людей-оценщиков (около 5,1%). Примечательно: последующие исследования (Santurkar и др., 2018) показали, что истинный механизм действия связан не столько с подавлением Covariate Shift, сколько со сглаживанием ландшафта функции потерь — то есть исходное объяснение сегодня считается относительным. Статья, набравшая уже более 60 000 цитирований, вдохновила множество методов нормализации: GroupNorm, LayerNorm, InstanceNorm. Сегодня Batch Normalization является стандартом во многих современных архитектурах — от ResNet до актуальных CNN. Трансформеры, напротив, как правило используют вдохновлённую этой работой Layer Normalization.
YOLO: You Only Look Once
Трансформация детекции объектов в реальном времени через унифицированную однопроходную архитектуру. 8 июня 2015 года Джозеф Редмон, Сантош Диввала, Росс Гиршик и Али Фархади представили прорывную статью 'You Only Look Once: Unified, Real-Time Object Detection'. YOLO преодолел традиционную двухэтапную парадигму детекции объектов и сформулировал детекцию как задачу регрессии для пространственно разделённых bounding boxes. Одна нейронная сеть предсказывает bounding boxes и вероятности классов непосредственно из полных изображений за одну оценку. С базовой производительностью 45 fps и Fast YOLO на поразительных 155 fps система была в сотни-тысячи раз быстрее существующих детекторов. Архитектура на основе сетки разделяла изображения на ячейки, где каждая ячейка предсказывает объекты в своём центре.
Разработка DeepMind AlphaGo
В октябре 2015 года DeepMind достиг исторического прорыва: AlphaGo стал первой системой ИИ, победившей профессионального игрока в го на полной доске без форы. AlphaGo обыграл европейского чемпиона по го Фань Хуэя со счётом 5:0, завоевав тем самым самую сложную классическую настольную игру в мире — на десятилетие раньше, чем прогнозировали эксперты. Поначалу матч оставался в тайне; публично об успехе объявили лишь 27 января 2016 года — одновременно с публикацией в научном журнале Nature. Го несравнимо сложнее шахмат — примерно в гугол (10^100) раз больше допустимых позиций, а число возможных конфигураций доски превышает количество атомов в наблюдаемой вселенной. Этот замечательный успех демонстрирует мощь нейронных сетей и поиска Монте-Карло по дереву.
Автопилот Tesla: системы помощи водителю для массового рынка
14 октября 2015 года Tesla выпустила программную версию 7.0 и тем самым впервые активировала автопилот для автомобилей Model S. Аппаратное обеспечение было установлено в автомобилях ещё в сентябре 2014 года — за год до программной активации. Система использовала технологию Mobileye с фронтальной камерой, радаром и 12 ультразвуковыми датчиками. Водители получили возможность пользоваться адаптивным круиз-контролем, системой удержания полосы движения и автоматической парковкой — функциями, прежде доступными только в автомобилях премиум-класса. Tesla охарактеризовала это как автономность 2-го уровня: система помогает водителю, но не заменяет его. При выпуске Маск подчеркнул: 'Мы рекомендуем водителям держать руки на руле.' Уже в первый год автопарк Tesla собрал сотни миллионов километров с активным автопилотом — к концу 2016 года Tesla сообщила о примерно 222 миллионах пройденных миль. Концепция — предустановить аппаратное обеспечение, а функции открывать через обновления программного обеспечения — показала автомобильной промышленности новый путь. От Mercedes до чисто технологических поставщиков, таких как Mobileye, многочисленные игроки продвигали собственные системы помощи водителю.
TensorFlow: ML-фреймворк Google становится открытым
Демократизация машинного обучения благодаря мощному внутреннему инструменту Google. 9 ноября 2015 года Google открыл исходный код TensorFlow под лицензией Apache 2.0 и сделал свою вторую ML-систему доступной для всех. TensorFlow заменил внутреннюю систему DistBelief и предложил двукратную скорость с улучшенной масштабируемостью и готовностью к производству. Как универсальный процессор графов вычислений TensorFlow позволял не только глубокое обучение, но и любые дифференцируемые вычисления. Гибкий интерфейс Python, автоматическое дифференцирование и первоклассные оптимизаторы революционизировали ML-разработку. Стратегия Google: разработка на основе сообщества ускоряет прогресс ИИ для всех. Разработанный более чем 30 авторами из команды Google Brain, TensorFlow стал одной из ведущих ML-платформ и позволил миллионам разработчиков создавать продвинутые ИИ-приложения.
ResNet: остаточные сети меняют глубокое обучение
Решение проблемы деградации очень глубоких сетей и рождение ультраглубоких нейронных архитектур. 10 декабря 2015 года команда Кайминга Хэ в Microsoft Research опубликовала статью 'Deep Residual Learning for Image Recognition' и существенно изменила глубокое обучение. До этого точность обучения ухудшалась при увеличении глубины сетей — не столько из-за затухающих градиентов, сколько потому, что глубокие сети было просто сложнее оптимизировать. ResNet ввёл остаточные соединения (residual connections) — пропускные связи, которые напрямую передают входные данные более поздним слоям и позволяют обучать ультраглубокие нейронные сети. При 152 слоях ResNet был в восемь раз глубже VGG, но менее сложным. Замечательный результат: 3,57 % ошибок Top-5 (ансамбль моделей) на ImageNet — триумф, который обеспечил первое место во всех категориях. ResNet выиграл ImageNet Classification, Detection, Localization, а также COCO Detection и Segmentation в 2015 году. Фреймворк остаточного обучения переосмыслил слои как обучение остаточным функциям (residual functions) вместо безреференсных функций. Это новшество открыло возможность обучать сети с сотнями слоёв.
Основание OpenAI
Организация, стремившаяся сделать ИИ доступным для всех, — и изменившая мир. 11 декабря 2015 года Сэм Альтман, Илон Маск и другие известные технологические деятели объявили об основании OpenAI. Заявив о намерении привлечь миллиард долларов — финансовом обещании инвесторов, распределённом на несколько лет, из которого поначалу реально поступила лишь небольшая часть, — и поставив целью разработку безопасного общего ИИ на благо всего человечества, OpenAI вышла на арену как некоммерческая исследовательская организация. То, что начиналось как идеалистическое начинание, превратилось в наиболее влиятельную лабораторию ИИ в мире. В 2019 году была учреждена дочерняя коммерческая компания. С GPT-3 и ChatGPT OpenAI заново определила, на что способен ИИ.
AlphaGo побеждает Ли Седоля
Исторический момент, когда ИИ впервые победил чемпиона мира в сложнейшей настольной игре. С 9 по 15 марта 2016 года в Сеуле прошёл матч DeepMind Challenge Match — пять партий между Ли Седолем, одним из лучших игроков в го в мире, и AlphaGo. Результат поразил мир: 4:1 в пользу машины. Особенно знаменитый «ход 37» во второй партии продемонстрировал машинную креативность — ход с вероятностью 1:10000, перевернувший вековые истины го. AlphaGo сочетал глубокое обучение с поиском по дереву Монте-Карло и обучался как на человеческих партиях, так и на самоигре. Однако ответ Ли Седоля в четвёртой партии с его «божественным ходом 78» показал, что человеческая интуиция всё ещё может удивлять. Более 200 миллионов человек по всему миру следили за этими партиями.
XGBoost: Extreme Gradient Boosting доминирует в ML
Совершенствование градиентного бустинга и завоевание задач на структурированных данных. 9 марта 2016 года Тяньци Чен и Карлос Гестрин опубликовали на arXiv статью 'XGBoost: A Scalable Tree Boosting System', представленную в августе 2016 на конференции KDD. Разработанный из PhD-проекта Чена в University of Washington, XGBoost значительно улучшил традиционный градиентный бустинг через экстремальные оптимизации: L1- и L2-регуляризация предотвращала переобучение, градиенты второго порядка давали более точную информацию о направлении, а параллелизация значительно ускорила построение деревьев. XGBoost доминировал в соревнованиях машинного обучения 2010-х и стал стандартным выбором для команд-победителей на Kaggle. На Higgs Boson ML Challenge Тяньци Чен получил специальный приз, и XGBoost использовался многими топ-участниками.
Google Assistant: стратегия 'ИИ прежде всего' становится реальностью
18 мая 2016 года Сундар Пичаи на конференции Google I/O представил Google Assistant — ответ Google на Siri и Alexa. После многих лет отставания в области голосовых помощников Google догонял конкурентов в полную силу. Assistant был чем-то большим, чем просто обновление Google Now, — он стал фундаментом стратегии Пичаи 'ИИ прежде всего' (AI-First). 'Мы хотим, чтобы пользователи вели непрерывный диалог с Google', — объяснил Пичаи. 'Мы создаём индивидуальный Google для каждого пользователя.' Планировалось, что Assistant станет 'ambient experience', охватывающим все устройства — от смартфонов до Google Home и автомобилей. В отличие от конкурентов, работавших на основе команд, Google делал ставку на естественный диалог и понимание контекста. Поначалу Assistant был лишь анонсирован; первым его домом стало приложение для обмена сообщениями Allo, а затем, в конце 2016 года, умная колонка Google Home. Запуск ознаменовал серьёзный выход Google в разработку голосового ИИ и заложил основу для нынешнего доминирования компании в области ИИ.
Partnership on AI: технологические гиганты объединяются
Значимый альянс ведущих технологических компаний ради ответственного развития ИИ. 28 сентября 2016 года Amazon, Facebook, Google, DeepMind, IBM и Microsoft основали 'Partnership on Artificial Intelligence to Benefit People and Society' — необычную коалицию бывших конкурентов. С Эриком Хорвицем (Microsoft Research) и Мустафой Сулейманом (DeepMind) в роли временных сопредседателей Partnership поначалу имела совет директоров, состоявший исключительно из корпоративных представителей, объявив о планах преобразовать его в паритетный орган с равным числом некорпоративных членов. Миссия охватывает исследования и лучшие практики в области этики, справедливости, прозрачности, защиты данных и взаимодействия человека и ИИ. Примечательно: Apple поначалу отсутствовала, но присоединилась в 2017 году. Partnership сознательно отказывается от лоббирования и сосредоточивается на научном сотрудничестве. Эта инициатива ознаменовала начало структурированного отраслевого саморегулирования в развитии ИИ.
Распознавание речи достигает уровня человека
18 октября 2016 года Microsoft добился исторического успеха: впервые компания достигла производительности уровня человека в системе распознавания речи на эталонном тесте Switchboard для разговорной речи. После 25 лет исследований цель была достигнута — уровень ошибок слов 5,9 %, что соответствует точности профессиональных транскрибистов на этой задаче. (В 2017 году Microsoft скорректировал человеческий показатель до 5,1 % и был вынужден снова догонять.) Сюэдун Хуан, главный учёный Microsoft по речевым технологиям, объявил: 'Мы достигли паритета с человеком. Это историческое достижение.' Система использовала новейшие технологии глубокого обучения: свёрточные нейронные сети, архитектуры LSTM и нейронные языковые модели с непрерывными векторами слов. Сила заключалась в систематическом сочетании проверенных компонентов — ансамбль акустических моделей CNN и BLSTM, адаптация к диктору с помощью i-vector и переоценка с помощью языковой модели. Это стало возможным благодаря конвергенции трёх факторов: больших наборов данных (Switchboard Corpus), вычислений на GPU и улучшенных методов обучения. Это достижение открыло путь для современных голосовых ассистентов — однако оно подтверждает паритет лишь в узко определённой задаче транскрипции, а не общие когнитивные способности человека.
Принципы Асиломара: экспертное сообщество устанавливает ориентиры
В начале 2017 года, задолго до ChatGPT, ведущие исследователи ИИ собрались в Асиломаре на побережье Калифорнии — там же, где биологи в 1975 году обсуждали риски генной инженерии. Конференцию по полезному ИИ организовал Future of Life Institute. Итогом стали 23 Асиломарских принципа ИИ: руководящие принципы в области исследований, таких ценностей, как безопасность и прозрачность, а также долгосрочных рисков. Под ними подписались более тысячи специалистов по ИИ, в том числе такие известные фигуры, как Стивен Хокинг и Илон Маск. Это была одна из первых масштабных попыток экспертного сообщества установить для себя ориентиры — за многие годы до того, как к теме обратились правительства. Если подходить честно: принципы носили добровольный и необязательный характер. Они повлияли на дискуссию, однако не имели юридической силы.
MobileNet — ИИ для смартфонов
В апреле 2017 года Google Research существенно изменил мобильный ИИ с помощью MobileNet — одной из первых моделей глубокого обучения, специально разработанной для смартфонов, интернета вещей и встраиваемых систем (предшественники, такие как SqueezeNet, уже существовали). Благодаря инновационной архитектуре Depthwise Separable Convolution MobileNet снижает вычислительные затраты при сохранении той же эффективности примерно до одной восьмой по сравнению с обычными свёртками. Эта примечательная эффективность — около девяти раз меньше вычислительных операций при ядрах 3x3 — открывает путь к обработке изображений в реальном времени на мобильных устройствах. MobileNet демократизировал компьютерное зрение для миллиардов смартфонов и утвердил граничные вычисления (edge computing) как новую ИИ-парадигму за пределами облачных решений.
Публикация исследовательской статьи о RLHF
Техника, которая сделала ChatGPT возможным — за годы до прорыва. В июне 2017 года исследователи из OpenAI и DeepMind опубликовали статью «Deep Reinforcement Learning from Human Preferences». Идея: вместо обучения ИИ-систем с идеально определёнными функциями вознаграждения, они учатся напрямую из человеческой обратной связи. Люди оценивают различные выводы ИИ, и система учится, какое поведение предпочтительно. Этот метод, позже известный как RLHF (обучение с подкреплением на основе человеческой обратной связи), стал ключевой технологией за ChatGPT и другими современными языковыми моделями. RLHF позволил сделать ИИ-системы более полезными, честными и безопасными.
Трансформер: 'Attention Is All You Need'
12 июня 2017 года восемь исследователей — преимущественно из Google, среди которых был и стажёр Университета Торонто — опубликовали на arXiv статью 'Attention Is All You Need' — основу современных больших языковых моделей. Эшиш Васвани, Ноам Шазир и их коллеги предложили новую архитектуру: трансформер (Transformer). В отличие от прежних моделей последовательностей, трансформер отказывается от рекуррентных и свёрточных слоёв. Вместо них используются чистые механизмы внимания. Механизм самовнимания (Self-Attention) улавливает связи между всеми позициями последовательности параллельно — последовательная обработка больше не нужна. Многоголовое внимание (Multi-Head Attention) использует несколько параллельных голов внимания, обучающихся различным аспектам отношений между словами. На наборе WMT 2014 модель достигла показателя 28,4 BLEU для пары английский — немецкий и 41,8 BLEU для пары английский — французский — новые рекорды. Архитектура оказалась широко применимой: GPT, BERT, ChatGPT и многие другие модели основаны на вариантах трансформера. Статья набрала значительно более 100 000 цитирований — и эта цифра неуклонно растёт — и входит в число наиболее цитируемых научных работ XXI века.
Генеральный план Китая по ИИ: борьба за мировое лидерство
20 июля 2017 года Государственный совет Китая объявил 'План развития искусственного интеллекта нового поколения' — первую комплексную национальную стратегию в области ИИ такого масштаба. Цель: к 2030 году стать мировой державой-лидером в области ИИ. Трёхэтапный план был чётко сформулирован: к 2020 году — конкурентоспособность на глобальном уровне; к 2025 году — мировое лидерство в отдельных областях и крупные прорывы в фундаментальной теории ИИ; к 2030 году — ведущая ИИ-сверхдержава с объёмом индустрии в 1 триллион юаней. Китай прямо обозначил ИИ как 'фокус международной конкуренции' и 'стратегическую технологию для национальной безопасности'. Инвестиции значительны: десятки миллиардов долларов направляются в исследования, инфраструктуру и развитие кадров. План охватывает военные и гражданские применения: от автономного оружия до умных городов. Принципы открытого исходного кода призваны содействовать международному сотрудничеству, тогда как Китай одновременно добивается технологической независимости. Эта стратегия существенно изменила глобальный ИИ-ландшафт и спровоцировала волну национальных ИИ-инициатив в США и Европе.
Монреальская декларация об ответственном ИИ
Первая международная инициатива, разработавшая этические принципы ИИ посредством демократического участия граждан. 3 ноября 2017 года Университет Монреаля запустил процесс совместного создания Монреальской декларации об ответственном развитии ИИ. Форум по общественно ответственному развитию ИИ собрал более 400 участников из различных секторов и дисциплин. В ходе 15 дискуссионных семинаров на протяжении трёх месяцев более 500 граждан, экспертов и заинтересованных сторон обсуждали общественные вызовы, связанные с ИИ. Опубликованная 4 декабря 2018 года декларация представляет 10 принципов и 59 рекомендаций, основанных на таких ценностях, как благополучие, автономия, справедливость, конфиденциальность и демократия. Набрав более 500 подписантов, Монреальская декларация утвердила партисипативный подход к управлению ИИ и оказала влияние на последующие международные усилия по ответственному развитию ИИ.
AlphaZero осваивает три игры
Рождение универсального игрового ИИ посредством чистого самообучения. В декабре 2017 года DeepMind представил AlphaZero — систему, освоившую три совершенно разные стратегические игры без каких-либо предварительных знаний: шахматы, сёги и го. Подход tabula rasa означал: никаких дебютных баз, никаких человеческих стратегий — только правила игры в качестве отправной точки. За 24 часа AlphaZero достиг сверхчеловеческого уровня — в шахматах уже через 4 часа, в сёги через 2 часа. В матче из 100 партий против Stockfish он выиграл 28 партий, не проиграл ни одной и свёл 72 к ничьей. Особенность заключалась в эффективном поиске: пока Stockfish оценивает 60 миллионов позиций в секунду, AlphaZero анализирует лишь 60 000 — но значительно целенаправленнее благодаря своей глубокой нейронной сети. Это достижение убедительно продемонстрировало универсальность и доменную независимость чистого обучения с подкреплением.
Премия Тьюринга за глубокое обучение
В 2019 году ИИ получил высшую награду информатики: премия А.М. Тьюринга 2018 года — нередко именуемая Нобелевской премией по информатике — была присуждена Йошуа Бенжио, Джеффри Хинтону и Яну ЛеКуну, трём крёстным отцам глубокого обучения. Ассоциация вычислительной техники (ACM) отметила их концептуальные и технические прорывы, сделавшие глубокие нейронные сети центральным элементом информатики — от метода обратного распространения ошибки и свёрточных сетей до идей, обеспечивших прорыв 2012 года. Награда стала запоздалым официальным признанием революции, над которой десятилетиями насмехались. Важная оговорка: у глубокого обучения много авторов — такие исследователи, как Юрген Шмидхубер, публично критиковали недостаточную оценку важных вкладов. Премия отмечает центральную роль трио, но не единоличное авторство.
GDPR: переломный момент в защите данных с влиянием на ИИ
25 мая 2018 года вступил в силу Общий регламент по защите данных ЕС (GDPR/DSGVO) — переломный момент для ИИ и защиты данных во всём мире. Как 'мать всех законов о защите данных' он заменил устаревшую директиву 95/46/ЕС 1995 года, принятую в эпоху зарождения интернета. GDPR ввёл принцип 'Privacy by Design' как обязательное требование: защита данных должна быть встроена в системы ИИ с самого начала. Глобальный охват регламента оказался весьма широким — даже технологические гиганты США обязаны соблюдать стандарты ЕС при обработке европейских данных. Для ИИ это стало принципиальным вызовом: как объяснить работу алгоритмов-'чёрных ящиков', когда GDPR требует прозрачности? Наблюдатели усмотрели в этом стимул к разработке более экономных с точки зрения данных систем ИИ, а методы вроде Transfer Learning приобрели большее значение. GDPR вдохновил законы о защите данных по всему миру — от Калифорнии до Сингапура. Регламент подготовил почву для Закона об ИИ ЕС 2024 года: от защиты данных к регулированию ИИ был всего один логичный шаг.
GPT-1: рождение генеративного предобучения
Основа всех современных больших языковых моделей — через обучение без учителя. 11 июня 2018 года Алек Рэдфорд с командой OpenAI опубликовал основополагающую статью 'Improving Language Understanding by Generative Pre-Training'. Эта работа впервые объединила архитектуру Transformer с предобучением без учителя и заложила двухэтапную парадигму: сначала генеративное обучение на больших текстовых корпусах, затем дообучение (Fine-Tuning) под конкретные задачи. Располагая 117 миллионами параметров и обучаясь на наборе данных BooksCorpus, включавшем более 7 000 неопубликованных книг различных жанров, GPT-1 доказал, что Transfer Learning работает для понимания языка. Двенадцатислойная архитектура Transformer на основе декодера с маскированным самовниманием (masked self-attention) задала шаблон для всей серии GPT. Это открытие превратило архитектуру Transformer 2017 года в практический инструмент для широкого круга задач обработки естественного языка (NLP) и положило начало эпохе больших языковых моделей.
BERT существенно улучшил понимание языка
Важный прогресс двунаправленных языковых моделей и рождение современной обработки естественного языка (NLP). В октябре 2018 года Джейкоб Девлин и его команда в Google Research опубликовали статью о BERT — Bidirectional Encoder Representations from Transformers (двунаправленные представления кодировщика на основе трансформеров). Эта новаторская разработка существенно изменила обработку языка: впервые были обучены глубокие двунаправленные представления на неразмеченных текстах. В отличие от предыдущих моделей, BERT одновременно учитывает как левый, так и правый контекст во всех слоях. Результат оказался примечательным: BERT достиг новых лучших показателей в одиннадцати задачах NLP и улучшил показатель GLUE на 7,7 процентных пункта — до 80,5%. Само предварительное обучение (Pre-Training) заняло несколько дней на множестве TPU, однако открытая публикация демократизировала передовые технологии: готовую предобученную модель можно было тонко настроить (Fine-Tuning) под собственную задачу примерно за 30 минут на одном облачном TPU. BERT установил парадигму Pre-Training — Fine-Tuning, которая сегодня лежит в основе всех крупных языковых моделей.
GPT-2 - "Слишком опасно для публикации"
В феврале 2019 года OpenAI выпустила GPT-2, но неожиданно решила придержать полную модель с 1,5 миллиарда параметров — якобы «слишком опасную» для полного релиза. Это беспрецедентное решение разделило ИИ-сообщество: сторонники хвалили ответственную позицию перед лицом рисков злоупотребления, таких как фейковые новости и автоматический спам. Критики обвинили OpenAI в «закрытии» исследований и раздувании необоснованных страхов. Через девять месяцев без серьёзных свидетельств злоупотреблений OpenAI выпустила полную модель, отметив поворотный момент в дебатах об ответственной разработке ИИ.
AlphaStar достигает уровня гроссмейстера
Завоевание самой сложной стратегии в реальном времени искусственным интеллектом. В июле и августе 2019 года AlphaStar компании DeepMind анонимно участвовал в рейтинговых матчах на Battle.net; 30 октября 2019 года DeepMind сообщил в журнале Nature, что система стала первым ИИ, достигшим уровня гроссмейстера в StarCraft II — игре, которая считалась слишком сложной для машин. AlphaStar превзошёл более 99,8% всех активных игроков Battle.net и освоил все три расы: Протоссов, Терранов и Зергов. Ранее AlphaStar уже победил профессиональных игроков Гжегожа 'MaNa' Кэминча и Дарио 'TLO' Вюнша со счётом 5:0 каждого. Особенностью стала архитектура многоагентного обучения с подкреплением (Multi-Agent Reinforcement Learning), обучавшая различные стратегии и контрстратегии в рамках лиги. Совершая в среднем 280 действий в минуту, AlphaStar оставался даже ниже показателей профессиональных игроков-людей, однако демонстрировал более точное исполнение. Это достижение стало важной вехой для ИИ в видеоиграх и принятии решений в реальном времени.
T5 — Text-to-Text Transfer Transformer
В октябре 2019 года Google AI существенно изменил NLP с помощью T5, Text-to-Text Transfer Transformer, который преобразует все задачи обработки языка в единый формат «текст-в-текст». С инновационным подходом «Everything is Text» перевод, резюмирование, ответы на вопросы и классификацию можно выполнять одной моделью, одной функцией потерь и одними гиперпараметрами. T5 вводит обширный датасет C4 и достигает почти человеческой производительности на бенчмарках SuperGLUE. Как базовая модель с до 11 миллиардами параметров, T5 прокладывает путь для современных больших языковых моделей и утверждает единую парадигму текст-в-текст как стандарт.
RAG: языковые модели с внешней памятью
Языковая модель знает лишь то, что содержалось в её обучающих данных, — и при неопределённости уверенно что-то придумывает. В 2020 году Патрик Льюис и его коллеги из Facebook AI предложили выход: Retrieval-Augmented Generation, сокращённо RAG (генерация с поиском и дополнением). Идея подкупает своей простотой. Прежде чем модель ответит, она ищет в внешнем источнике знаний — например, в Википедии — подходящие фрагменты текста и опирает ответ на найденное. Это позволяет обновлять знания без переобучения модели, а ответ становится проверяемым. После успеха ChatGPT RAG превратился в стандартный метод привязки языковых моделей к актуальным, проверяемым источникам — основу почти всех приложений, позволяющих общаться с собственными документами. Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их. Если найденное содержит ошибки или модель неверно его интерпретирует, ошибки сохраняются. Метод даёт ссылки, но не настоящее понимание — и опирается на более ранние исследования в области поиска информации.
Законы масштабирования нейросетей
Джаред Каплан, Сэм МакКандлиш, Том Браун и Дарио Амодеи в январе 2020 года открыли фундаментальные математические законы масштабирования нейросетей и тем самым существенно изменили разработку больших языковых моделей. Основополагающая работа OpenAI и Университета Джонса Хопкинса показала, что производительность подчиняется степенным законам в зависимости от размера модели, объёма набора данных и вычислительной мощности — с трендами, охватывающими семь порядков величины. Элегантные уравнения впервые позволили систематически прогнозировать распределение ресурсов и утвердили парадигму 'чем больше — тем лучше'. Эти математические основы непосредственно привели к успеху GPT-3 и преобразовали разработку ИИ: от экспериментального метода проб и ошибок к научно обоснованному, предсказуемому масштабированию. Конкретное правило распределения ресурсов по Каплану — активно масштабировать размер модели при слабом увеличении объёма данных — было скорректировано в 2022 году статьёй Chinchilla от DeepMind: оптимальное по вычислениям обучение требует значительно большего объёма обучающих данных, чем рекомендовалось изначально.
GPT-3: модель с 175 миллиардами параметров
Прорыв к обучению с несколькими примерами (Few-Shot Learning) и проявляющимся способностям ИИ. 28 мая 2020 года команда OpenAI под руководством Тома Брауна представила значимую статью 'Language Models are Few-Shot Learners' — GPT-3 со 175 миллиардами параметров, более чем в 100 раз превышающей GPT-2. Масштабирование выявило проявляющиеся способности: модель могла решать новые задачи лишь с несколькими примерами, без дообучения. От переводов до словесных головоломок и трёхзначной арифметики GPT-3 демонстрировал впечатляющую универсальность. Оценщики-люди едва могли отличить написанные GPT-3 новостные статьи от настоящих. Только за счёт обучения в контексте (In-Context Learning) GPT-3 приближался к передовому уровню на отдельных подзадачах SuperGLUE — однако на общем тесте набирал около 71,8 балла, заметно уступая дообученным лидирующим моделям (около 89). 31 исследователь OpenAI (Том Браун и 30 соавторов) доказали: масштабное увеличение числа параметров способно порождать качественно новые возможности. GPT-3 заложил фундамент для ChatGPT и современной эпохи больших языковых моделей.
DDPM: Диффузионные модели утверждены
Математическая основа современной генерации изображений через процессы шумоподавления. В июне 2020 года Джонатан Хо, Аджай Джейн и Питер Эббил опубликовали влиятельную статью «Denoising Diffusion Probabilistic Models» — класс латентных переменных моделей, вдохновлённый неравновесной термодинамикой. Их инновация заключалась во взвешенной вариационной границе и связи между диффузионными моделями и Denoising Score Matching с динамикой Ланжевена. Результаты были впечатляющими: показатель FID 3,17 на CIFAR-10 и показатель Inception 9,46. DDPM установили прогрессивный подход с потерями при декомпрессии, который можно интерпретировать как обобщение авторегрессивного декодирования. Эта работа заложила математический фундамент для Stable Diffusion и всей современной генерации изображений из текста.
Vision Transformer: 'An Image is Worth 16x16 Words'
Архитектура Transformer в компьютерном зрении. 22 октября 2020 года команда Алексея Досовицкого в Google Research опубликовала статью 'An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale'. Vision Transformer (ViT) показал, что свёрточные нейронные сети (CNN) не обязательны — чистые Transformer могут напрямую применяться к последовательностям фрагментов изображения. Ключевой вывод ('at Scale'): лишь после масштабного предварительного обучения на огромных наборах данных (ImageNet-21k или JFT-300M) ViT достигает сравнимых или лучших результатов, чем современные CNN; на наборах среднего размера без такого предобучения ViT показывает более слабые результаты. Система разбивает изображения на фрагменты — как правило, 16x16 пикселей, хотя в зависимости от варианта размер может меняться — обрабатывает их как последовательности токенов и применяет стандартную архитектуру Transformer. Универсальность архитектуры Transformer стала очевидна: та же технология, которая изменила обработку естественного языка, работает и в компьютерном зрении. ViT вдохновил новое поколение моделей компьютерного зрения на основе механизма внимания и продемонстрировал мощь унифицированных архитектур.
Успех AlphaFold
Решение 50-летней биологической загадки с помощью искусственного интеллекта. В ноябре 2020 года AlphaFold 2 от DeepMind доминировал на соревновании CASP14 с точностью, которую учёные назвали «поразительной» и «трансформационной». Система достигла показателя GDT 92,4 из 100 баллов в предсказании структуры белков — точность, сравнимая с экспериментальными методами вроде рентгеновской кристаллографии. При этом AlphaFold значительно превзошёл 145 других команд, решив проблему, над которой биология билась с 1970-х годов. Архитектура нейронной сети на основе механизма внимания может за несколько дней предсказать, как сворачиваются белки — процесс, фундаментальный для понимания жизни. За это достижение Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года.
CLIP: мост между изображением и языком
В тот же день, когда OpenAI представила DALL-E — 5 января 2021 года, — вышла, пожалуй, более значимая модель: CLIP. Она не генерировала изображения, а обучалась понимать картинку и текст в едином пространстве. Команда Алека Радфорда обучила два энкодера контрастным методом на примерно 400 миллионах пар изображение — текст из интернета, пока связанные изображения и подписи к ним не оказались в одной точке общего векторного пространства. Эффект оказался поразительным: CLIP мог классифицировать изображения в режиме zero-shot — категории просто описывались словами, без какого-либо обучения на конкретной задаче. Так модель достигла 76,2 % на ImageNet — наравне с ResNet-50, обученной на 1,28 миллиона размеченных примеров, — хотя CLIP не видел ни одного из них. Для общей картины это принципиально: CLIP стал фундаментом волны генерации изображений по тексту — DALL-E 2 опирается на эмбеддинги CLIP, а Stable Diffusion напрямую использует его текстовый энкодер. Если быть точным: контрастивные модели 'изображение — текст' уже существовали (ConVIRT вышел месяцами раньше) — вклад CLIP заключался в масштабе, ширине zero-shot и открытых весах, которые запустили целую экосистему.
DALL-E создаёт изображения из текста
Важный прорыв в генерации изображений по тексту и значительный прогресс в области творческих возможностей ИИ. 5 января 2021 года OpenAI представила DALL-E — систему, которая создаёт связные и нередко поразительно креативные изображения на основе текстовых описаний. Модели преобразования текста в изображение существовали и прежде (например, alignDRAW в 2015 году или подходы на основе GAN — StackGAN и AttnGAN), однако DALL-E подняла связность и универсальность на принципиально новый уровень. Основанная на версии GPT-3 с 12 миллиардами параметров, DALL-E доказала, что границу между пониманием языка и восприятием изображений можно преодолеть. Система обучалась на 250 миллионах пар 'изображение — текст' из интернета и в результате приобрела примечательные способности: очеловечивать животных, правдоподобно объединять несвязанные концепции и даже воспроизводить текст в изображениях. Марк Ридль из Технологического института Джорджии отметил, что результаты 'поразительно более связны', чем у всех прежних систем преобразования текста в изображение. DALL-E успешно расширила языковое понимание GPT на область зрительного восприятия и открыла принципиально новое измерение творческих возможностей ИИ.
Основание Anthropic
Бывшие руководители OpenAI решили воплотить собственное видение безопасного ИИ. В январе 2021 года Дарио и Даниэла Амодеи вместе с пятью другими бывшими исследователями OpenAI — в том числе Томом Брауном, Джаредом Капланом и Крисом Ола — основали Anthropic; всего семь сооснователей. Брат и сестра ранее занимали ключевые должности в OpenAI — Дарио в должности вице-президента по исследованиям. Их новая компания должна была сосредоточиться на безопасности ИИ и разработке надёжных, интерпретируемых систем. С помощью Constitutional AI компания Anthropic разработала инновационный подход к обучению ИИ-систем на основе принципов, а не только человеческой обратной связи. Claude, их ИИ-ассистент, стал одним из ведущих конкурентов ChatGPT.
GitHub Copilot: ИИ-парный программист
Демократизация ИИ-разработки программного обеспечения для миллионов разработчиков. 29 июня 2021 года GitHub анонсировал Technical Preview Copilot — первого ИИ-парного программиста на базе OpenAI Codex. Основанный на варианте GPT-3, обученном на миллиардах строк публичного кода из репозиториев GitHub, Copilot мог генерировать автодополнения кода и целые функции из комментариев. Базовая модель Codex достигла 28,8% успеха с первой попытки в бенчмарке HumanEval — значительно лучше GPT-3 с 0%. Особенно впечатляюще: со 100 попытками семплирования успешность выросла до 70,2%. Copilot особенно хорошо работал с Python, JavaScript, TypeScript, Ruby и Go. Ограниченный Technical Preview вызвал огромный интерес и утвердил ИИ-программирование как практичный инструмент. Copilot фундаментально изменил опыт разработчиков и проложил путь новому поколению ИИ-инструментов для программирования.
OpenAI Codex: ИИ программирует для людей
10 августа 2021 года OpenAI опубликовала Codex через API и существенно изменила разработку программного обеспечения — масштабная система ИИ для генерации кода. Основанный на GPT-3, но обученный на 159 гигабайтах кода Python из 54 миллионов репозиториев GitHub, Codex преобразовывал естественный язык в работоспособный код. 'Создай функцию для простых чисел' превращалось в реальный код Python за считанные секунды. Ещё раньше, 29 июня 2021 года, из партнёрства с GitHub появился Technical Preview Copilot — ИИ-ассистент программирования, уже работавший на ранней версии Codex. Codex владел более чем дюжиной языков программирования: Python, JavaScript, Go, Ruby, Swift и другими. В бенчмарке HumanEval точно настроенная модель Codex-S решала около 37 % задач с первой попытки (pass@1) — базовая модель справлялась примерно с 29 %; впечатляет, но не является меркой для произвольных запросов. GitHub Copilot оказался значительным инструментом повышения производительности для разработчиков. Codex доказал: ИИ способен поддерживать творческую, когнитивно сложную работу. От генерации кода к его пониманию — Codex открыл дверь в разработку программного обеспечения с поддержкой ИИ.
InstructGPT: мост к ChatGPT
Между методом и мировым успехом пролегал решающий промежуточный шаг — и он назывался InstructGPT. В начале 2022 года OpenAI показала в статье 'Training language models to follow instructions with human feedback', как заставить GPT-3 действительно делать то, чего хотят пользователи: с помощью обучения с подкреплением на основе обратной связи от людей (RLHF). Поразительный результат: InstructGPT с 1,3 миллиарда параметров люди предпочитали ответам GPT-3 в сто раз большего размера (175 миллиардов параметров). Разницу определяла не грубая величина, а согласованность с намерением. InstructGPT стал прямым техническим мостом между идеей RLHF (2017) и ChatGPT, который в конце 2022 года сделал этот метод широко известным. Если подходить честно: InstructGPT не изобрёл RLHF — это сделала статья 2017 года, — но именно InstructGPT впервые показал в большом масштабе, насколько согласованность делает языковую модель полезнее.
Chinchilla: масштабирование осмыслено заново
В 2022 году DeepMind задала неудобный вопрос: а не строим ли мы свои ИИ-модели неправильно? В статье 'Training Compute-Optimal Large Language Models' команда под руководством Джордана Хоффмана показала, что крупнейшие языковые модели того времени — GPT-3, Gopher — имели множество параметров, но слишком мало обучающих данных. Предложенная ими корректировка, сегодня известная как законы масштабирования Chinchilla: при заданном вычислительном бюджете размер модели и объём данных должны расти примерно в одном темпе. В качестве доказательства они обучили Chinchilla с 70 миллиардами параметров на 1,4 триллиона токенов — и превзошли вчетверо большую модель Gopher (280 миллиардов). Это изменило подход к обучению практически каждой последующей ведущей модели. Если подходить честно: Chinchilla не изобрела законы масштабирования, а скорректировала более ранние законы Каплана (2020); более поздние модели вроде Llama намеренно выходили за пределы оптимального по вычислениям соотношения ради повышения эффективности при использовании.
PaLM: гигантская языковая модель Google на 540 миллиардов параметров
В 2022 году Google продемонстрировал, насколько высоко можно масштабировать языковые модели: PaLM (Pathways Language Model) насчитывал 540 миллиардов параметров и обучался с помощью системы Pathways на тысячах TPU-чипов. Впечатляло не столько огромное число параметров, сколько то, на что PaLM оказался способен. С так называемыми подсказками цепочки мыслей (Chain-of-Thought Prompts), при которых модель записывает своё рассуждение шаг за шагом, PaLM решал многоэтапные текстовые задачи и даже объяснял суть анекдотов. PaLM стал символом идеи эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели. Это был апогей эпохи масштабирования Google и предтеча PaLM 2 и Gemini. Важная оговорка: 540 миллиардов параметров были чрезвычайно дорогостоящими, и PaLM так и не был опубликован как открытая модель. Тезис об эмерджентных способностях также вызывает споры — некоторые подобные скачки отчасти являются артефактом выбранной метрики измерения.
Stable Diffusion: генерация изображений с открытым кодом
Демократизация ИИ-генерации изображений благодаря первой мощной модели с открытым исходным кодом. 22 августа 2022 года Stability AI выпустила Stable Diffusion и существенно изменила доступ к продвинутой технологии преобразования текста в изображение. Как первая модель своего класса с открытым кодом, Stable Diffusion могла генерировать фотореалистичные изображения 512x512 пикселей на потребительских GPU — важный прогресс для скорости и доступности. Основанная на латентных диффузионных моделях (LDM), система итеративно «удаляет шум» в латентных пространствах вместо прямой манипуляции пикселями. С 860 миллионами параметров в U-Net и 123 миллионами в текстовом энкодере она оставалась относительно лёгкой несмотря на высокую производительность. Исходный код на GitHub позволил взрывообразно растущему сообществу разрабатывать бесчисленные варианты и инструменты. Stable Diffusion разрушила монополию проприетарных систем и сделала высококачественную ИИ-генерацию изображений доступной для каждого.
OpenAI выпускает Whisper
Когда распознавание речи наконец стало надёжным — и доступным для всех. 21 сентября 2022 года OpenAI выпустила Whisper — систему распознавания речи, обученную работать устойчиво с различными языками, акцентами и фоновыми шумами. В отличие от ранних систем, обучавшихся на чистых аудиоданных, Whisper использовал 680 000 часов многоязычных данных из интернета. Результат — система, способная транскрибировать речь на 99 языках и конкурирующая с коммерческими решениями. OpenAI сделала Whisper общедоступным в виде открытого исходного кода — подарок разработчикам по всему миру, открывший возможности для бесчисленных приложений.
ChatGPT обозначил поворотный момент в использовании ИИ
Момент, когда ИИ стал доступен всем и началась новая эра. 30 ноября 2022 года OpenAI выпустила ChatGPT как бесплатный Research Preview — без масштабного маркетинга и с минимальными ожиданиями. То, что последовало, превзошло все прогнозы: через 5 дней ChatGPT достиг 1 миллиона пользователей, а через два месяца — 100 миллионов. Это был тогда самый быстрый рост аудитории, который когда-либо демонстрировало потребительское приложение (в июле 2023 года этот рекорд побил Threads от Meta). Основанный на GPT-3.5, ChatGPT впервые открыл широкой аудитории прямой доступ к мощной системе ИИ без технических барьеров. Кевин Рус из New York Times назвал его 'лучшим ИИ-чат-ботом, когда-либо выпущенным для широкой публики'. ChatGPT демократизировал искусственный интеллект и превратил исследовательскую область в инструмент повседневного использования. Этот выпуск ознаменовал начало нынешней волны генеративного ИИ.
Constitutional AI — безопасность ИИ через принципы
В декабре 2022 года компания Anthropic представила Constitutional AI (CAI) — новый метод разработки безвредных, полезных и честных систем ИИ. 'Конституция' из этических принципов позволяет ИИ самостоятельно критиковать и улучшать собственные ответы на вредоносный контент — без необходимости использовать человеческую разметку именно для оценки вреда. (Явную привязку этих принципов к Всеобщей декларации прав человека ООН и другим основополагающим документам Anthropic описала лишь в мае 2023 года в 'Claude's Constitution'; в исходной статье применялся прагматично составленный набор принципов.) Новаторский метод RLAIF (Reinforcement Learning from AI Feedback — обучение с подкреплением на основе обратной связи от ИИ) заменяет человеческую обратную связь лишь применительно к безвредности — посредством самокритики ИИ; полезность же по-прежнему обучается на основе человеческих предпочтений (RLHF). Таким образом, CAI устанавливает подход 'безопасность прежде всего' как альтернативу чисто производительностному подходу ChatGPT и прокладывает путь к ответственной разработке ИИ.
Система NIST AI: США определяют стандарты надёжного ИИ
26 января 2023 года Национальный институт стандартов и технологий США (NIST) опубликовал первую комплексную систему управления рисками ИИ (AI RMF 1.0) — ответ Америки на глобальное регулирование искусственного интеллекта. После 18 месяцев разработки при участии более 240 организаций из промышленности, науки и гражданского общества NIST впервые определил федеральные стандарты надёжного ИИ. Система устанавливает четыре основные функции: Govern, Map, Measure, Manage — и семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный. Как добровольный стандарт, он призван минимизировать риски ИИ для отдельных людей, организаций и общества. Публикация последовала за Сводом прав ИИ Байдена (2022) и была дополнена его указом об ИИ (октябрь 2023 года). AI RMF был создан по поручению Национального закона об инициативе в области ИИ 2020 года — NIST продолжил свою устоявшуюся роль федерального органа по стандартизации. Система стала основой для отраслевых стандартов и международной координации — противовесом государственному контролю над ИИ в Китае и регуляторному подходу Европы.
LLaMA: открытая базовая языковая модель
Демократизация больших языковых моделей через открытые исследовательские модели. 24 февраля 2023 года Meta AI опубликовала LLaMA (Large Language Model Meta AI) — набор базовых моделей от 7B до 65B параметров, обученных исключительно на общедоступных данных. Основополагающая статья 'LLaMA: Open and Efficient Foundation Language Models' доказала, что результаты уровня state-of-the-art достижимы без проприетарных наборов данных. LLaMA открыла исследователям без доступа к крупной инфраструктуре возможность изучать передовые языковые модели. Код вывода был опубликован под лицензией GPLv3, тогда как доступ к весам модели предоставлялся в отдельных случаях исключительно для академических исследований. Благодаря обучению на триллионах токенов и различным размерам моделей LLaMA отвечала разным аппаратным требованиям. Эта работа катализировала волну открытых исследований в области больших языковых моделей и вдохновила многочисленные производные модели в сообществе открытого программного обеспечения.
Claude и Constitutional AI
Представление ИИ со встроенной системой ценностей и этическими принципами. В марте 2023 года Anthropic представила Claude — ИИ-ассистента на базе Constitutional AI, который установил новый подход к безопасности ИИ. В отличие от традиционных систем, Claude обучается двухфазным методом: сначала модель критикует и улучшает свои собственные ответы на основе конституции из этических принципов, затем улучшается через обратную связь, генерируемую ИИ — без человеческих оценок для предотвращения вреда. Результат — система, которая действует одновременно полезно и безвредно. Anthropic одновременно выпустила Claude и Claude Instant, причём последний представляет более быструю и экономичную версию. Метод Constitutional AI оказался улучшением по Парето по сравнению с человеческой обратной связью и открыл новые пути для масштабируемого контроля ИИ.
GPT-4: мультимодальная модель ИИ
Прорыв к человеческому уровню в профессиональных и академических тестах. 14 марта 2023 года OpenAI представил GPT-4 — большую мультимодальную модель (Large Multimodal Model), обрабатывающую текстовые и графические данные и достигающую человеческого уровня в различных дисциплинах. Улучшения были существенными: если GPT-3.5 сдавал экзамен на право занятия адвокатской практикой (Bar Exam) в нижних 10 %, то GPT-4 достиг верхних 10 %. На тесте SAT по математике результат вырос с 70-го до 89-го перцентиля. После шести месяцев итеративного выравнивания с учётом результатов программы тестирования на устойчивость к атакам (adversarial testing) и обратной связи от ChatGPT весь стек глубокого обучения был выстроен заново. Мультимодальные возможности позволяют обрабатывать документы, диаграммы и скриншоты с тем же качеством, что и чисто текстовые запросы. GPT-4 установил новые стандарты безопасности и производительности ИИ.
Midjourney V5: фотореалистичное ИИ-искусство
Фотореалистичная генерация изображений с помощью ИИ достигает нового уровня качества и существенно меняет творческую индустрию. 15 марта 2023 года Midjourney выпустила версию 5, сделав качественный скачок, который пользователи описывали как 'пугающий' и 'слишком совершенный'. Альфа-версия впервые позволила создавать фотореалистичные изображения, практически неотличимые от настоящих фотографий. Особенно примечательно: хроническая проблема с некорректным изображением рук была существенно улучшена — в большинстве случаев V5 правильно отображала пять пальцев. Графический дизайнер Джули Виланд сравнила этот опыт с 'тем, как наконец надеть очки после того, как слишком долго мирился с плохим зрением' — вдруг всё видишь в качестве 4K [источник: Ars Technica, март 2023]. Улучшенная чувствительность к запросам (промптам) обеспечила более точный творческий контроль, а автоматическое масштабирование позволяло увеличивать базовые изображения размером 1024x1024 пикселей без дополнительных затрат на GPU. V5 вызвала интенсивные дискуссии о будущем человеческого творчества.
Указ Байдена об ИИ — первое комплексное регулирование США
30 октября 2023 года президент Байден подписал Executive Order 14110 о 'безопасной, защищённой и заслуживающей доверия разработке и использовании искусственного интеллекта' — первый комплексный нормативный акт США в области ИИ и, со своими 110 страницами, самый длинный президентский указ в истории. Этот масштабный документ обязывал разработчиков мощных систем ИИ раскрывать результаты тестирований безопасности и устанавливал строгие стандарты Red Team через NIST. Указ предусматривал защиту от мошенничества с применением ИИ посредством аутентификации контента и водяных знаков, а также затрагивал риски для критической инфраструктуры и биологические угрозы. На момент подписания этот указ задавал глобальные стандарты ответственной разработки ИИ и позиционировал США как лидера в области управления ИИ (AI Governance). Однако его действие оказалось недолгим: 20 января 2025 года президент Трамп отменил EO 14110 своим указом EO 14148 — таким образом, этот документ отражает регуляторное положение дел по состоянию на 2023 год.
Письмо о паузе и Блетчли: безопасность ИИ становится глобальной темой
В 2023 году, в первое потрясение после ChatGPT, мир искал правила для внезапно обретшей мощь технологии. В марте тысячи подписантов — среди них Ёшуа Бенджио и Илон Маск — потребовали в открытом письме Future of Life Institute шестимесячной паузы в обучении ИИ-систем мощнее GPT-4. Паузы не последовало, однако письмо поставило тему на мировую повестку дня. В ноябре прошёл первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — намеренно в том самом месте, где Тьюринг некогда взламывал шифры. 28 государств и ЕС, в том числе США и Китай, подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ. Это был первый случай, когда соперничающие державы заговорили вместе о безопасности ИИ, — старт серии саммитов (Сеул 2024, Париж 2025). Если подходить честно: пауза так и не наступила, а Блетчлийская декларация носила необязательный характер — оба события поставили темы на повестку дня, но не создали механизмов принуждения.
Mistral и Mixtral: открытые европейские модели
Пока в 2023 году заголовки новостей в основном определяли американские компании, из Парижа выступил конкурент: Mistral AI, основанный весной 2023 года Артуром Меншем (ранее работавшим в Google DeepMind), а также Гийомом Лямплем и Тимоте Лакруа (ранее работавшими в Meta). Уже в сентябре небольшая модель Mistral 7B удивила профессиональное сообщество — она распространялась свободно под лицензией Apache 2.0 и превосходила значительно более крупную Llama 2 13B. В декабре последовала Mixtral 8x7B: открытая модель типа Mixture-of-Experts, достигшая на многих задачах уровня GPT-3.5, однако активировавшая лишь малую часть своих параметров на каждый запрос (около 13 из 47 миллиардов). Mistral стала европейским символом открытых моделей и привлекла миллиарды инвестиций. Важная оговорка: открытые веса — это не то же самое, что открытый исходный код; данные и код обучения остаются закрытыми. И Mixtral достигла уровня GPT-3.5, но не тогдашней флагманской модели GPT-4; при этом сама архитектура Mixture-of-Experts значительно старше.
Google Gemini: мультимодальное семейство ИИ
Ответ Google на ChatGPT и прорыв к нативной мультимодальности. 6 декабря 2023 года Google представил Gemini 1.0 — семейство ИИ-моделей, разработанных с нуля для мультимодальности. Совместная работа DeepMind и Google Brain воплотилась в три размера моделей: Gemini Ultra для высококомплексных задач, Gemini Pro как сбалансированное решение и Gemini Nano для использования непосредственно на устройствах. В отличие от систем, расширенных мультимодальностью постфактум, Gemini изначально создавался с нативным пониманием текста, аудио, кода и видео. В шести из восьми тестов Gemini Pro превзошёл стандарт GPT-3.5, включая тесты MMLU. В день анонса обычный Bard получил новые возможности на базе Gemini Pro; более мощный Bard Advanced с Gemini Ultra Google объявил на начало 2024 года. Gemini стал стратегическим ответом Google на доминирование OpenAI и закрепил мультимодальный ИИ как новый стандарт для больших языковых моделей.
Воплощённый ИИ: модели обретают тело
Долгие годы крупные ИИ-модели существовали только на экранах — они писали тексты, создавали изображения, вели беседы. В 2024 году это начало меняться: год стал годом воплощённого ИИ (embodied AI). Идея состоит в том, чтобы помещать те же базовые модели, которые понимают язык и изображения, в настоящие тела — прежде всего в человекоподобных роботов. Компания Figure объединилась с OpenAI и показала робота, который говорит, видит и манипулирует предметами. NVIDIA представила Project GR00T — базовую модель специально для гуманоидов, а молодые компании, такие как Physical Intelligence, оценивались в миллиарды долларов. Многие уже говорили о своём 'ChatGPT-моменте' для робототехники. Если подходить честно: большинство из этого пока оставалось демонстрациями и анонсами, а не надёжно работающими в повседневной жизни машинами. Физический мир несравнимо сложнее для робота, чем экран, — ловкость, безопасность и надёжность по-прежнему остаются нерешёнными проблемами.
Waymo: беспилотное такси становится реальностью
Более десяти лет автономное вождение служило показательным примером обещаний ИИ, которые постоянно откладывались. В 2024 году оно стало реальностью: Waymo, дочерняя компания Google по разработке роботизированных автомобилей, впервые в широком масштабе открыла беспилотные такси для широкой публики — в Сан-Франциско, Лос-Анджелесе и Финиксе. Летом 2024 года компания сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём. После многих лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный, повседневный сервис. Важная оговорка: Waymo работает только в строго ограниченных, тщательно картированных городских районах — не везде и не в любую погоду. Поломки и заблокированные автомобили по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей; уход конкурента Cruise после серьёзного происшествия в 2023 году показал, насколько технология ещё хрупка.
Sora: видео из текста, созданное ИИ
Прогресс в создании фотореалистичных видео с помощью ИИ и его влияние на киноиндустрию. 15 февраля 2024 года OpenAI представила Sora — модель преобразования текста в видео, которая по кратким описаниям генерирует детализированные HD-видео продолжительностью до одной минуты. Названная в честь японского слова, означающего 'небо', Sora символизирует 'безграничный творческий потенциал'. Как диффузный трансформер (Diffusion Transformer), Sora адаптирует технологию DALL-E 3 для временной согласованности и нередко — хотя и не всегда надёжно — симулирует физически правдоподобное движение. Демонстрационные видео превзошли все существующие системы преобразования текста в видео и установили новые стандарты для ИИ-творчества. Режиссёр Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов из-за опасений по поводу влияния Sora на индустрию. OpenAI придерживалась осторожного подхода, проводя тестирование в Red Team на предмет дезинформации и предвзятости перед более широким выпуском.
Семейство Claude 3 с мультимодальными возможностями
Представление семейства ИИ с поддержкой зрения и тремя специализированными моделями. 4 марта 2024 года Anthropic представила семейство Claude 3: Opus, Sonnet и Haiku — три модели с различными сильными сторонами для разных сценариев использования. Ключевой функцией стала продвинутая обработка изображений, способная анализировать фотографии, графики, диаграммы и технические чертежи. Claude 3 Opus установил новые рекорды в когнитивных задачах, превзойдя конкурентов в бенчмарках MMLU и GPQA. Sonnet предложил идеальный баланс между интеллектом и скоростью для бизнеса, а Haiku отличался почти мгновенным временем отклика. С контекстным окном в 200 000 токенов (расширяемым до 1 миллиона) и доступностью в 159 странах Claude 3 установил новые стандарты для мультимодальных ИИ-систем.
Devin: первый автономный ИИ-инженер по программному обеспечению
Рождение полностью автономной разработки программного обеспечения с помощью искусственного интеллекта. 12 марта 2024 года компания Cognition Labs представила Devin — позиционируемый фирмой как первый в мире полностью автономный ИИ-инженер по программному обеспечению. Система способна самостоятельно планировать, клонировать репозитории, писать код, отлаживать, тестировать и даже развёртывать его. На сложном тесте SWE-Bench Devin достиг 13,86% успешных решений реальных задач из GitHub — огромный скачок по сравнению с предыдущим лучшим результатом в 1,96%. Стартап получил оценку около 350 миллионов долларов на раннем раунде финансирования; вскоре после запуска появились сообщения об оценке около 2 миллиардов долларов. Несмотря на впечатляющие результаты, тесты выявили и ограничения: только 3 из 20 задач были решены успешно, нередко с непредсказуемыми сбоями.
AlphaFold 3: ИИ предсказывает взаимодействие молекул
Спустя четыре года после прорыва AlphaFold 2 в мае 2024 года Google DeepMind сделала следующий шаг — совместно с дочерней компанией Isomorphic Labs. AlphaFold 2 предсказывал, как отдельный белок сворачивается в трёхмерную структуру. AlphaFold 3 идёт принципиально дальше: он моделирует, как белки взаимодействуют с другими молекулами — с ДНК, РНК, ионами и небольшими молекулами лекарственных веществ. Именно это взаимодействие имеет ключевое значение для фармацевтических исследований: так можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью. Если подходить честно: предсказания впечатляют, но не безупречны — их точность варьируется в зависимости от типа молекулы, и в лаборатории их по-прежнему необходимо проверять. Кроме того, AlphaFold 3 изначально вышел без открытого исходного кода, только в виде ограниченного веб-сервиса, что вызвало в научном сообществе критику относительно воспроизводимости результатов.
AlphaProof: ИИ завоёвывает серебро на математической олимпиаде
Математика долгое время считалась королевской дисциплиной, недоступной для ИИ: слишком творческой, слишком требовательной к подлинному пониманию. В июле 2024 года Google DeepMind поставила восклицательный знак: система AlphaProof совместно с AlphaGeometry 2 решила четыре из шести задач Международной математической олимпиады. Это соответствовало уровню серебряной медали — всего на одно очко ниже золота. Принципиально важна методика работы: AlphaProof формулирует доказательства на формальном языке Lean, в котором каждый шаг поддаётся машинной проверке — значит, ИИ не может 'схитрить'. Обучение проходило с применением метода обучения с подкреплением. Впервые ИИ достиг медального уровня на этом престижном соревновании. Если подходить честно: это были не настоящие условия соревнования. Там, где участники располагают четырьмя с половиной часами, ИИ иногда работал несколько дней, и специалистам пришлось вручную переводить задачи на формальный язык. Две комбинаторные задачи так и остались нерешёнными.
Закон ЕС об ИИ: первый комплексный закон об искусственном интеллекте
Первое в мире комплексное регулирование искусственного интеллекта вступает в силу. 1 августа 2024 года Закон ЕС об ИИ приобрёл юридическую силу — основанный на оценке рисков свод правил, включающий 180 преамбульных пунктов и 113 статей для всего жизненного цикла систем ИИ. Закон классифицирует системы ИИ по четырём уровням риска: недопустимые приложения запрещены, системы высокого риска в образовании, занятости и правосудии подлежат детальным требованиям по соблюдению нормативов, системы ограниченного риска обязаны выполнять требования о прозрачности, а подавляющее большинство систем с минимальным риском остаются в значительной мере нерегулируемыми. Параллельно действуют отдельные правила для базовых моделей общего назначения (GPAI), таких как GPT, лежащих в основе ChatGPT. Экстерриториальное действие закона распространяется также на поставщиков за пределами ЕС, обслуживающих европейских пользователей. За нарушения грозят штрафы до 35 миллионов евро или 7% мирового годового оборота. Подобно GDPR 2018 года, Закон об ИИ может установить глобальные стандарты и определить, как ИИ влияет на нашу жизнь. Поэтапное введение в действие начинается в 2025 году и завершается к 2027 году.
OpenAI O1 — прогресс в рассуждении
12 сентября 2024 года OpenAI выпустила сначала o1-preview (и o1-mini), существенно расширив возможности ИИ в области рассуждения (reasoning) благодаря цепочке размышлений (chain-of-thought), обученной методом обучения с подкреплением (reinforcement learning). O1 — первая широко доступная языковая модель, которая систематически 'думает' перед ответом: используя закрытую цепочку размышлений, она анализирует проблемы шаг за шагом. Этот новый подход открывает дополнительное измерение масштабирования — масштабирование на этапе вывода (test-time scaling), при котором более длительное 'обдумывание' даёт лучшие результаты. Полная модель o1 в бенчмарк-тестах достигает уровня, сопоставимого с кандидатами PhD в физике, химии и биологии, и решает 83 % задач American Invitational Mathematics Examination (GPT-4o: 13 %). Технология показывает, что ИИ способен значительно улучшить навыки решения задач за счёт структурированного рассуждения.
Нобелевские премии по ИИ 2024 года
В октябре 2024 года произошло нечто беспрецедентное: сразу две Нобелевские премии по естественным наукам отметили основы современного ИИ. 8 октября Нобелевская премия по физике была присуждена Джону Хопфилду и Джеффри Хинтону — за фундаментальные открытия, открывшие путь к машинному обучению с искусственными нейронными сетями. То, что именно физика отметила нейронные сети, вызвало дискуссии — однако вдохновлённые физикой сети Хопфилда (1982) и методы обучения Хинтона действительно заложили фундамент. Днём позже Нобелевскую премию по химии разделили Дэвид Бейкер (за компьютерное проектирование белков), а также Демис Хассабис и Джон Джампер из DeepMind — за AlphaFold, решивший 50-летнюю проблему предсказания структуры белков. Впервые фундаментальные исследования в области ИИ были признаны на высшем уровне мировой науки. Примечательно: Хинтон, только что удостоенный премии, воспользовался трибуной, чтобы одновременно предупредить об опасностях технологии, у истоков которой стоял.
OpenAI o3: прорыв на тесте ARC-AGI
Незадолго до конца 2024 года, 20 декабря, OpenAI анонсировала o3 — преемника o1 и доказательство того, что масштабирование рассуждений во время работы модели (Test-Time Scaling) можно продолжать. Особое внимание привлёк один результат: o3 набрала 87,5 % на ARC-AGI — тесте, намеренно построенном так, чтобы его нельзя было пройти простым запоминанием; предыдущие модели оставались здесь почти на нуле. Тем самым o3 впервые приблизилась к человеческому уровню на этом тесте и одновременно продемонстрировала высокие результаты в математике и программировании. Вместе с o1 и DeepSeek-R1, o3 ознаменовала эру моделей-рассуждателей (Reasoning Models) (o3-mini последовала в конце января 2025 года, полная o3 — в апреле). Важная оговорка: 87,5 % были получены в режиме максимальной производительности с огромными — и очень дорогостоящими — вычислительными затратами на каждую задачу; организаторы ARC Prize особо подчеркнули, что o3 не является AGI и показывает значительно худшие результаты на более сложном тесте ARC-AGI-2.
Агентный ИИ выходит в массы
В 2024–2025 годах изменилось само предназначение ИИ: от ответов — к действиям. Первой ласточкой стала Anthropic: в октябре 2024 года она первой из крупных ИИ-лабораторий представила модель, которая умеет самостоятельно управлять компьютером — видеть экран, двигать мышью, кликать, печатать. В январе 2025 года OpenAI выпустила Operator — агента, который самостоятельно выходит в интернет и выполняет задачи, а вскоре после этого — Deep Research, способный проводить многоэтапные исследования и составлять подкреплённые ссылками отчёты. Чат-бот, выдающий текст, превратился в систему, действующую от имени пользователя, — качественный сдвиг, намеченный ещё Devin в 2024 году. Если подходить честно: первые версии работали медленно, часто давали сбои и справлялись лишь с узко очерченными задачами; системы, выпущенные в 2025 году под маркой агентов, продвигались активнее, чем позволяла реальная надёжность.
DeepSeek-R1: ИИ-шок из Китая
В конце января 2025 года ИИ-модель впервые ощутимо пошатнула мировые фондовые рынки. 20 января 2025 года китайская лаборатория DeepSeek опубликовала R1 — модель рассуждения (reasoning model) на уровне o1 от OpenAI, но с открытыми весами (лицензия MIT) и стоимостью обучения, оказавшейся значительно ниже ожидаемой. Это стало возможным благодаря масштабному обучению с подкреплением на базовой модели DeepSeek-V3. Когда неделю спустя приложение DeepSeek возглавило американские чарты, настроение переломилось: 27 января акции Nvidia упали примерно на 17 % — около 600 миллиардов долларов за один день, крупнейшие однодневные потери в истории американской биржи, — поскольку инвесторы усомнились в том, что передовому ИИ непременно нужны бесконечно дорогие чипы. R1 одновременно поколебал несколько убеждений: что только американские гиперскейлеры могут конкурировать на вершине, что модели рассуждения остаются закрытыми и что наращивание вычислительных мощностей — единственный путь вперёд. Если подходить честно: расхожая цифра в несколько миллионов долларов относится только к финальному обучающему прогону базовой модели V3 (не к R1 как таковой, не к исследованиям и оборудованию в целом) — и R1 превосходила o1 далеко не по всем показателям.
Stargate: ИИ как инфраструктура национального масштаба
21 января 2025 года искусственный интеллект оказался в Белом доме на сцене — как инфраструктурный проект национального масштаба. OpenAI, SoftBank, Oracle и инвестиционная компания MGX объявили о проекте Stargate: до 500 миллиардов долларов за четыре года на центры обработки данных для ИИ в США, причём вложение 100 миллиардов долларов должно было начаться немедленно. Тем самым стало очевидно, что следующая фаза ИИ — это меньше вопрос алгоритмов и больше вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций и промышленных парков. Для области, красной нитью которой со времён AlexNet является вычислительная мощь (см. CUDA 2007), это была логичная, но грандиозная следующая ступень — и сигнал того, что ИИ стал национальным геополитическим приоритетом. Важная оговорка: объявление — это не готовый центр обработки данных. Полнота финансирования в размере 500 миллиардов долларов вызывала сомнения с самого начала — в том числе у участников и наблюдателей, публично высказывавших скептицизм.
Парижский саммит по ИИ (AI Action Summit)
10 и 11 февраля 2025 года в парижском Гран-Пале встретились главы государств и правительств, технологические компании и исследователи на саммите AI Action Summit — третьем крупном международном форуме по ИИ после Блетчли (2023) и Сеула (2024), который совместно возглавляли президент Франции Макрон и премьер-министр Индии Моди. Примечательным стал сдвиг в тоне: если первый саммит уделял главное внимание безопасности ИИ, то в Париже речь шла прежде всего о возможностях, инвестициях и конкурентоспособности — вице-президент США открыто выступал против избыточного регулирования. В итоге 58 государств, а также ЕС и Африканский союз подписали декларацию об инклюзивном и устойчивом ИИ — однако США и Великобритания от подписи отказались. Тем самым саммит обнажил трансатлантический раскол в сфере управления ИИ. Важная оговорка: декларация носила необязательный характер, а критики назвали саммит упущенной возможностью для решения вопросов безопасности.
Frontier-модели 2025 года
В 2025 году способность к рассуждению, которую запустили o1 и R1, превратилась в стандарт ведущих моделей — в темпе, за которым было трудно успевать. В марте Google представила Gemini 2.5 Pro, в мае Anthropic выпустила Claude 4 (Opus 4 и Sonnet 4), в августе OpenAI — GPT-5; между ними вышли Claude 3.7 (первая гибридная модель, по выбору отвечающая быстро или рассуждающая дольше), GPT-4.5, Llama 4 от Meta и Grok от xAI. Новое поколение объединило две линии: пошаговое рассуждение reasoning-моделей и способность действовать самостоятельно (агентность). Особое место заняло автономное программирование на длинных дистанциях. Если подходить честно: лаборатории каждую неделю перебивали друг друга в рекордах по бенчмаркам, и каждая заявляла о своём первенстве — реальный прогресс есть, но часто употребляемое слово AGI оставалось скорее маркетингом, чем реальностью.
Аналитическая машина Бэббиджа: идея компьютера
История ИИ начинается не с компьютеров, а с идеи компьютера. В 1830-х годах британский математик Чарльз Бэббидж разработал Аналитическую машину и впервые подробно описал её в 1837 году — на бумаге это был первый универсальный программируемый вычислительный прибор в мире. Его проект на целый век опережал своё время: в нём уже были арифметическое устройство, которое Бэббидж называл 'мельницей' (mill), память (store), программирование с помощью перфокарт и даже условные переходы — основные строительные блоки любого современного компьютера. При жизни изобретателя машина так и не была построена: она оказалась слишком сложной для механики XIX века. Тем не менее она является далёкой прародительницей каждого вычислительного устройства — а значит, и того оборудования, на котором вообще может работать искусственный интеллект. Если подходить честно: Аналитическая машина осталась незавершённым проектом, и она была вычислительным, а не мыслящим устройством. Она заложила фундамент — способность вычислять, но не мыслить.
Ада Лавлейс: первая программа — и смелое видение
Чарльз Бэббидж спроектировал машину — но именно Ада Лавлейс поняла, на что та способна. В 1843 году британская математик перевела статью об Аналитической машине Бэббиджа и добавила собственные примечания, которые значительно превзошли оригинал по объёму и глубине. В своей заметке G она описала процедуру вычисления чисел Бернулли — её часто называют первой опубликованной компьютерной программой. Ещё дальновиднее оказалось второе открытие: машина не обязана работать только с числами — она может обрабатывать символы любого рода и даже сочинять музыку. Тем самым Лавлейс на целый век опередила идею универсальной обработки данных. Если подходить честно: была ли она первым программистом — спорный вопрос: сам Бэббидж набрасывал программы раньше, а процедура вычисления чисел Бернулли создавалась в диалоге с ним. При этом Лавлейс полагала, что машина не способна создать ничего подлинно нового — возражение, которому Алан Тьюринг открыто противопоставил своё мнение в 1950 году.
Машина Тьюринга: что такое вычисление
Прежде чем задаться вопросом, могут ли машины думать, нужно было выяснить, что вообще способна вычислить машина. На этот вопрос ответил британский математик Алан Тьюринг в 1936 году в своей статье 'On Computable Numbers'. В ней он описал удивительно простую мысленную модель — лента, читающая-записывающая головка, несколько правил, — получившую позднее название машины Тьюринга. С её помощью Тьюринг точно установил, что является вычислимым, а что нет. Его важнейшее открытие: одна универсальная машина Тьюринга способна имитировать любую другую. Это теоретический прообраз универсального компьютера — машины, которая при наличии нужной программы может выполнить любое вычислимое действие. Тем самым Тьюринг стал основоположником информатики и создал фундамент, на котором только и стала возможной идея мыслящих машин. Важная оговорка: машина Тьюринга — математическая идея, а не построенное устройство, и речь шла о вычислимости, а не об интеллекте. Вопрос о том, могут ли машины думать, Тьюринг поставил лишь в 1950 году. Само же название 'машина Тьюринга' ввели другие.
Маккалок и Питтс: первый искусственный нейрон
За тринадцать лет до Дартмутской конференции, в разгар войны, вышло истинное свидетельство о рождении искусственных нейронных сетей. Нейрофизиолог Уоррен Маккалок и самоучка-логик Уолтер Питтс — которому едва исполнилось двадцать лет и у которого не было никакой учёной степени — опубликовали в 1943 году в Bulletin of Mathematical Biophysics статью 'A Logical Calculus of the Ideas Immanent in Nervous Activity'. Их идея была радикально простой: нейрон можно описать как бинарный переключатель, который срабатывает по принципу 'всё или ничего', когда сумма его входных сигналов превышает порог. На основе чистой пропозициональной логики они доказали, что сети из таких элементов способны вычислять любую логическую функцию, а сети с петлями обратной связи обладают даже своеобразной памятью. В заключительной части авторы указали, что их сети способны вычислить то же, что и машина Тьюринга. Тем самым они создали первую математическую модель нейрона как логического вычислительного элемента. Главный изъян, определивший следующее десятилетие: их нейрон не умел учиться.
Теория информации Шеннона: рождение бита
В 1948 году в Bell Labs вышла статья, заложившая основы цифрового мира: 'A Mathematical Theory of Communication' Клода Шеннона. Шеннон показал, как можно измерить информацию математически — безотносительно её смысла. Он ввёл бит как наименьшую единицу информации и ввёл понятие энтропии: меру того, сколько неопределённости в среднем снимает сообщение. Тем самым он заложил фундамент для сжатия данных, безошибочной передачи информации и в конечном счёте для каждого компьютера. Для ИИ это нечто большее, чем просто предыстория: такие понятия, как перекрёстная энтропия и дивергенция Кульбака — Лейблера, которые сегодня служат целевыми функциями при обучении нейронных сетей, уходят корнями прямо в теорию Шеннона. Важная оговорка: Шеннон описывал передачу сообщений, а не мышление. Теория информации — математический инструмент, на котором строится ИИ, но сама она не является искусственным интеллектом.
Правило Хебба: как рождается обучение в мозге
В 1949 году канадский психолог Дональд Хебб опубликовал книгу 'The Organization of Behavior' и выдвинул простую, но важную идею: если два связанных нейрона неоднократно возбуждаются вместе, их связь укрепляется. Тем самым Хебб впервые предложил конкретный механизм того, как обучение может работать на уровне отдельных синапсов. Для ИИ это стало основополагающим принципом: обучение означает изменение силы связей — именно это делают искусственные нейронные сети, в том числе более поздние сети Хопфилда. Если подходить честно: знаменитый афоризм о том, что нейроны, возбуждающиеся вместе, соединяются вместе, принадлежит вовсе не Хеббу — его приписывают нейробиологу Карле Шатц (1992). И правило Хебба само по себе ещё не объясняет современное глубокое обучение, поскольку в нём отсутствует целенаправленная коррекция ошибок.
Тест Тьюринга: игра в имитацию
Философская основа машинного интеллекта и первый эталонный тест ИИ. В 1950 году Алан Тьюринг опубликовал в журнале Mind статью 'Computing Machinery and Intelligence' и по-новому сформулировал вопрос 'Могут ли машины мыслить?'. Вместо философских определений Тьюринг предложил практическую 'Игру в имитацию': человек-оценщик анализирует текстовые расшифровки диалогов между человеком и машиной. Оценщик пытается определить, кто из собеседников является машиной; машина считается выдержавшей тест, если оценщик не может надёжно это определить. Решающим является не правильность ответов, а то, насколько они похожи на ответы человека. Этот тест на неотличимость можно распространить на все виды человеческой деятельности — как вербальные, так и невербальные (робототехника). Поведенческий подход Тьюринга заложил концептуальный фундамент для всей науки об ИИ и повлиял на ELIZA, ChatGPT и все современные системы разговорного ИИ.
Logic Theorist: первая программа для логического вывода
В то же лето, когда в Дартмуте был введён термин 'искусственный интеллект', Аллен Ньюэлл, Херберт Саймон и нередко забытый программист Клифф Шоу представили то, что принято называть 'первой программой ИИ' — с одной оговоркой. Их Logic Theorist доказывал математические теоремы: программа взялась за пропозициональную логику из 'Principia Mathematica' Уайтхеда и Рассела и самостоятельно нашла доказательства для 38 из первых 52 теорем. Примечательным был сам подход: вместо того чтобы перебирать все варианты подряд, программа использовала эвристический поиск — она оценивала, какие шаги перспективны, и работала от цели назад. Для одной теоремы она даже нашла более короткое доказательство, чем в оригинале; по имеющимся сведениям, Рассел был доволен, тогда как научный журнал отклонил представленное доказательство. Всё было написано на IPL — языке списков, предвосхитившем LISP Маккарти. Ограничение: игровые программы вроде дамок Самуэля работали раньше — Logic Theorist стал первой программой, целенаправленно воспроизводившей человеческое рассуждение на открытой интеллектуальной задаче.
Дартмутская конференция: рождение ИИ
Исторический момент, когда искусственный интеллект родился как научная область. С 18 июня по 17 августа 1956 года в Дартмутском колледже прошла первая летняя исследовательская конференция по ИИ. Джон Маккарти, Марвин Минский, Натаниэль Рочестер и Клод Шеннон разделяли смелое видение: 'Каждый аспект обучения или любую другую характеристику интеллекта можно описать достаточно точно, чтобы машина могла её смоделировать.' На этом восьминедельном семинаре Маккарти ввёл термин 'Artificial Intelligence' и тем самым заложил основу новой научной дисциплины. Некоторые участники приезжали лишь на несколько недель, другие присутствовали постоянно: Херберт Саймон и Аллен Ньюэлл в первые недели демонстрировали свой Logic Theorist, тогда как Рэй Соломонофф провёл все восемь недель на месте — обсуждения велись на верхнем этаже математического факультета. Из этой конференции выросли три исторических центра ИИ: Университет Карнеги — Меллон с Ньюэллом и Саймоном, MIT с Минским и Стэнфорд с Маккарти.
Перцептрон: первая обучающаяся нейронная сеть
Рождение машинного обучения — первый обучаемый искусственный нейрон. В 1957 году Фрэнк Розенблатт в Cornell Aeronautical Laboratory разработал перцептрон — первую нейронную сеть, способную учиться на опыте. В январе 1957 года он опубликовал технический отчёт 'The Perceptron: A Perceiving and Recognizing Automaton' (Project PARA, Report 85-460-1). Формальная научная публикация вышла в ноябре 1958 года в журнале Psychological Review. Вдохновлённый биологическими нейронами, перцептрон объединял взвешенные входные данные через функцию Хевисайда, выдавая бинарные выходные значения. Новаторское правило обучения перцептрона корректировало веса каждый раз, когда пример классифицировался неверно, — ранний предшественник обучения в современных нейронных сетях (его не следует путать с более поздним дельта-правилом Уидроу и Хоффа, 1960 года). Сначала смоделированный на IBM 704 и публично анонсированный в 1958 году, аппаратный Mark I Perceptron был завершён лишь около 1960 года. Несмотря на ограниченность линейно разделимыми задачами, перцептрон заложил концептуальный фундамент для всех последующих нейронных архитектур.
LISP: язык ИИ
В 1958 году Джон Маккарти в Массачусетском технологическом институте разработал язык программирования, ставящий символьные вычисления в центр: LISP, сокращение от List Processing. Вместо того чтобы преимущественно обрабатывать числа, LISP манипулировал списками символов — именно то, что требовалось символическому ИИ. На протяжении десятилетий LISP оставался языком исследований в области ИИ: экспертные системы, обработка естественного языка и системы планирования создавались на нём. Язык Маккарти ввёл также идеи, которые сегодня стали само собой разумеющимися: рекурсию, автоматическую сборку мусора (garbage collection), функции как данные и интерактивное вычисление выражений. Стив Расселл реализовал теоретический механизм вычисления eval Маккарти в виде первого интерпретатора — и тем самым сделал LISP работающим. Если подходить честно: LISP не был первым языком высокого уровня (Fortran появился в 1957 году), но он второй по возрасту из тех, что используются до сих пор, — и самый значимый для ИИ.
Артур Самуэль: самообучающийся ИИ и термин 'машинное обучение'
За несколько лет до Дартмутской конференции Артур Самуэль в IBM научил машину играть в шашки — и заодно учиться. Его программа работала с 1952 года на IBM 701; главным, однако, стало то, что он изложил в своей статье 1959 года 'Some Studies in Machine Learning Using the Game of Checkers'. Программа совершенствовалась сама: она сыграла десятки тысяч партий против самой себя и корректировала веса своей оценочной функции по итогам игр. В названии этой статьи термин 'машинное обучение' (Machine Learning) зафиксирован в современном значении впервые — Самуэль считается его создателем. Ричард Саттон позднее оценил самоигру Самуэля как первое применение обучения с временными разностями (Temporal-Difference Learning), лежащего в основе современного обучения с подкреплением. Телевизионная демонстрация 1956 года и широко цитируемая победа над предполагаемым мастером попали в заголовки газет — однако оба события были значительно преувеличены: против действительно сильных игроков программа проигрывала, и шашки были полностью решены лишь несколько десятилетий спустя.
DENDRAL: пионер экспертных систем
В середине 1960-х годов ИИ сделал принципиальный поворот. В Стэнфордском университете Эдвард Фейгенбаум и генетик, лауреат Нобелевской премии Джошуа Ледерберг приступили к работе над DENDRAL — программой, которую часто называют первой экспертной системой и которая в любом случае стала первой, применившей ИИ к научному рассуждению. Вместо того чтобы действовать общим поиском, как прежние системы, DENDRAL использовала специализированные знания химиков: по данным масс-спектрометра она выводила структуру органических молекул. Вынесенный урок определил целое десятилетие развития ИИ: знание — это сила. Победит не самый умный общий алгоритм, а тот, кто располагает наибольшей экспертизой. Тем самым DENDRAL проложила путь к буму экспертных систем в 1980-х. Если подходить честно: DENDRAL сам по себе был успешным многолетним исследовательским проектом, а не отдельным продуктом. Однако его метод — утомительного ручного ввода всех знаний — впоследствии стал ахиллесовой пятой: он сделал коммерческие экспертные системы 1980-х годов ненадёжными и дорогостоящими, что способствовало наступлению зимы ИИ.
Нечёткая логика: логика неточности
Важный математический прорыв в работе с неопределённостью и приближёнными рассуждениями. В 1965 году Лотфи Заде из Калифорнийского университета в Беркли опубликовал основополагающую статью 'Fuzzy Sets' — ответ на неспособность классической логики справляться с расплывчатой и неполной информацией. Его открытие состояло в осознании того, что люди принимают решения на основе неточных, нечисловых данных. Нечёткая логика допускает степени принадлежности от 0 до 1, в отличие от бинарной логики 'да/нет'. Сегодня работа Заде насчитывает более 100 000 цитирований и стала основой для мягких вычислений (Soft Computing) и современных подходов к ИИ. 'Точная логика неточности' позволила математически моделировать неопределённость, неполноту и противоречивую информацию. Нечёткая логика нашла применение в экспертных системах, системах управления и впоследствии в современных архитектурах ИИ для нечётких процессов принятия решений.
ELIZA: первый чат-бот
Рождение разговора человека с машиной и непреднамеренный эксперимент в области человеческой психологии. Приблизительно с 1964 по 1966 год Джозеф Вейценбаум в MIT разработал ELIZA — первую программу, явно созданную для общения с людьми. С удивительно лаконичным кодом и простой технологией сопоставления шаблонов (Pattern Matching) ELIZA имитировала разговоры, особенно в варианте DOCTOR — в роли терапевта по методу Роджерса. Неожиданность крылась не в технологии, а в реакции людей: пользователи, включая собственную секретаршу Вейценбаума, формировали эмоциональные привязанности к программе и даже требовали конфиденциальности для своих 'сеансов терапии'. Вейценбаум рано описал и подверг критике это явление — тенденцию приписывать рудиментарным программам человеческие качества. Сам термин 'эффект ELIZA' был введён и популяризирован позже, в 1990-е годы. ELIZA доказала силу простой иллюзии и заложила основу для всех современных чат-ботов.
Perceptrons: книга, которая спровоцировала зиму ИИ
В 1969 году исследователи Массачусетского технологического института Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons. С математической строгостью они показали, что может, а чего не может однослойный перцептрон — простейшая форма нейронной сети. Их самый известный результат: такая сеть не способна выучить даже простую функцию XOR, потому что она не является линейно разделимой. Влияние оказалось огромным: доверие к нейронным сетям рухнуло, финансирование прекратилось более чем на десятилетие — книга стала важным фактором первой зимы ИИ. Важная оговорка: Минский и Пейперт отнюдь не опровергли нейронные сети. Они проанализировали лишь однослойный вариант; многослойные сети решают XOR без труда — что позднее, с 1986 года, стало практически применимым благодаря методу обратного распространения ошибки. Рассказ о том, что книга в одиночку уничтожила исследования, — отчасти миф. Однако резкое сокращение финансирования и внимания было вполне реальным.
Shakey: первый разумный мобильный робот
Рождение автономной робототехники через интеграцию логического мышления, планирования и физического действия. С 1966 по 1972 год команда Чарльза Розена в SRI International разрабатывала Shakey — первого мобильного робота, способного осмысливать собственные действия. Двухметровый робот объединял телекамеру, сонарный дальномер, процессоры и 'кошачьи усы' в качестве датчиков столкновения в единую автономную систему. Выдающиеся возможности Shakey включали восприятие окружающей среды, построение выводов из неявных фактов, составление планов и компенсацию ошибок — всё это управлялось с помощью естественного английского языка. Финансируемый ARPA (ныне DARPA) проект впервые объединил логическое мышление с физическим действием и заложил основы автономных систем. Разработки Shakey привели к созданию алгоритма поиска A*, методов графа видимости и влиятельного вычислительного варианта преобразования Хафа (Duda & Hart, SRI 1972). В 1970 году журнал Life Magazine назвал Shakey 'первой электронной личностью'.
SHRDLU: понимание языка в мире кубиков
Около 1970 года Терри Виноград в Массачусетском технологическом институте создал программу, удивившую специалистов: SHRDLU. Ей можно было отдавать команды на простом английском — например, поставить красный куб на зелёный блок — и она выполняла их в виртуальном мире из цветных кубиков. SHRDLU понимала не только команды: она разрешала двусмысленные предложения, помнила сказанное, отвечала на вопросы о своём мире и могла даже объяснить, почему выполнила то или иное действие. Для многих это стало выдающимся достижением символического ИИ — доказательством того, что машины способны удивительно хорошо понимать язык. Важная оговорка: понимание SHRDLU работало только в её крошечном замкнутом мире кубиков. На реальный, необозримый мир с его бесконечными обыденными знаниями оно не распространялось. Со временем SHRDLU стала поучительным примером ограничений подобных микромиров — сам Виноград впоследствии отказался от этого подхода.
Скрытые марковские модели получают признание
Математический фундамент для распознавания речи и моделирования последовательностей. С конца 1960-х до 1970 года Леонард Баум, Ллойд Уэлч и Тед Петри в Институте оборонных исследований (Institute for Defense Analyses) разработали скрытые марковские модели и создали алгоритм Баума-Уэлча. Эти статистические модели описывали скрытые состояния в последовательностях и предложили один из первых практически применимых подходов к выявлению латентных состояний в данных, зависящих от времени. С середины 1970-х HMM нашли первое практическое применение в распознавании речи — в работах Джеймса Бейкера в Университете Карнеги-Меллон и позднее в IBM. Метод коренным образом изменил автоматическое распознавание речи: от простых шаблонных методов (Template Matching) к статистическим подходам. HMM стали стандартом для моделирования последовательностей в многочисленных областях: от биоинформатики и финансового анализа до распознавания жестов. Алгоритм Баума-Уэлча, впоследствии признанный частным случаем алгоритма максимизации математического ожидания (Expectation-Maximization), сформулированного в общем виде в 1977 году, заложил фундамент для современных вероятностных методов машинного обучения.
Prolog: программирование с помощью логики
В 1972 году в Марсельском университете возник язык программирования, мысливший совершенно иначе, чем все остальные: Prolog, сокращение от Programmation en Logique. Его создатели Ален Кольмерауэр и Филипп Руссель — опираясь на теорию Роберта Ковальски — развивали захватывающую идею. Вместо того чтобы шаг за шагом указывать компьютеру, как что-то делать, в Prolog описывают лишь факты и правила некоторого мира. Логические выводы из них система делает сама. Prolog стал важнейшим языком символического ИИ: в экспертных системах, в обработке естественного языка и как основа амбициозного японского проекта пятого поколения (Fifth Generation). Важная оговорка: логическое программирование так и не стало господствующей парадигмой ИИ. Масштабный японский проект, целиком построенный на Prolog, остался далеко позади своих обещаний. И прорыв обязан столько же теории Роберта Ковальски, сколько самому языку.
Первая зима ИИ
Период резких сокращений финансирования исследований и падения доверия к искусственному интеллекту. После чрезмерных обещаний 1960-х годов наступила горькая реальность: программы ИИ могли решать лишь тривиальные версии тех задач, с которыми им предстояло справляться. В Великобритании доклад Лайтхилла 1973 года стал уничижительной критикой, после чего Совет по научным исследованиям сократил финансирование нецелевых исследований в области ИИ. В США DARPA — под влиянием поправки Мэнсфилда — на несколько лет отказалась от нецелевых исследований; резкое сокращение финансирования понимания речи в 1974–1975 годах затронуло проект в Университете Карнеги — Меллона и привело к расторжению контракта на 3 миллиона долларов. Эта зима продолжалась примерно до 1980 года и преподала сообществу ИИ важный урок: реалистичные ожидания — ключ к устойчивому прогрессу.
Неокогнитрон: прародитель свёрточных нейронных сетей
В 1980 году японский исследователь Куниихико Фукусима представил нейронную сеть, намного опередившую своё время: неокогнитрон. Его образцом послужила природа — точнее, зрительная кора, которую изучали нобелевские лауреаты Хьюбел и Визел в опытах на кошках. В зрительной коре простые и сложные клетки поэтапно обрабатывают зрительные стимулы. Фукусима воспроизвёл этот принцип: многослойная сеть, распознающая признаки послойно — причём независимо от того, где именно в изображении они находятся. Тем самым неокогнитрон предвосхитил ключевые идеи современных свёрточных нейронных сетей (Convolutional Neural Networks), которые господствуют в распознавании изображений с 2012 года. Важная оговорка: неокогнитрон ещё не использовал метод обратного распространения ошибки и не мог обучаться так, как современные CNN. Лишь метод обратного распространения (1986) и LeNet Яна ЛеКуна (1989) превратили эту архитектуру в практически обучаемые сети. Первопроходческая роль Фукусимы до сих пор нередко недооценивается.
Эра экспертных систем 1980-х годов
1980-е годы стали расцветом экспертных систем — временем, когда ИИ впервые достиг коммерческого успеха. Компании по всему миру внедряли эти основанные на правилах программы ИИ, воспроизводящие знания экспертов-людей в специализированных областях. Индустрия ИИ выросла с нескольких миллионов долларов в 1980 году до миллиардов в 1988-м. Две трети компаний из списка Fortune 500 использовали эту технологию. Системы вроде MYCIN достигали в исследованиях около 65% принятия своих терапевтических рекомендаций — наравне с экспертами факультетов, хотя MYCIN так и не применялась клинически. Однако бум завершился по классической схеме экономического пузыря, когда десятки компаний потерпели крах и обнаружились пределы технологии.
Сети Хопфилда: Ассоциативная память
Возрождение нейронных сетей благодаря ассоциативным возможностям памяти. В 1982 году Джон Хопфилд опубликовал основополагающую статью «Neural networks and physical systems with emergent collective computational abilities» в PNAS. Его инновация заключалась в связи нейробиологии и статистической физики: сети Хопфилда работают как content-addressable memory, реконструирующая полные паттерны из неполных или зашумлённых входов. Рекуррентная архитектура с симметричными двунаправленными связями сходится к аттракторам фиксированной точки через энергетическую функцию Ляпунова. Система «скатывается вниз» к ближайшему сохранённому воспоминанию. Работа Хопфилда возродила интерес к нейронным сетям и заложила теоретический фундамент для современных RNN. Хеббовское правило обучения позволило ассоциативное хранение паттернов — прорыв для понимания биологических и искусственных систем памяти.
Алгоритм обратного распространения ошибки
Рождение современного машинного обучения благодаря элегантному алгоритму обучения. В октябре 1986 года Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали в журнале Nature статью 'Learning representations by back-propagating errors'. Этот алгоритм существенно изменил обучение нейронных сетей, предоставив эффективный метод корректировки весов в многослойных сетях. Метод итеративно корректирует веса связей, чтобы минимизировать разницу между фактическим и желаемым выходом. Ключевая инновация заключалась в способности обучать скрытые слои, которые автоматически распознают важные признаки задачи. Математические основы были заложены ранее — в частности, Полом Вербосом (1974) и Сеппо Линнайнмаа (1970), — однако именно эта статья сделала метод обратного распространения ошибки широко известным и убедительно продемонстрировала его эффективность. Метод обратного распространения стал рабочей лошадкой машинного обучения и сегодня лежит в основе всех современных приложений глубокого обучения.
Вторая зима ИИ
Крах рынка специализированного оборудования для ИИ и провал экспертных систем. В 1987 году рынок Lisp-машин рухнул, когда компьютеры Apple и IBM оказались дешевле и производительнее дорогостоящих ИИ-специфичных систем. Экспертные системы вроде XCON оказались слишком трудоёмкими в обслуживании и негибкими для реального применения. Джек Шварц, новый руководитель IPTO, назвал экспертные системы 'умным программированием' и урезал финансирование ИИ 'глубоко и жестоко'. Упадок производителей Lisp-машин растянулся на несколько лет — лидер рынка Symbolics объявил о банкротстве лишь в 1993 году, — что привело к более длительной и глубокой зиме, чем первая в 1974 году. Эта зима продолжалась примерно до 1993 года и положила конец коммерческому ажиотажу вокруг экспертных систем и специализированного оборудования для ИИ — однако символический ИИ как направление исследований сохранился.
Репозиторий UCI ML: библиотека наборов данных
Демократизация исследований в области машинного обучения с помощью стандартизированных эталонных наборов данных. В 1987 году аспирант UCI Дэвид Аха совместно с однокурсниками основал Репозиторий машинного обучения UCI (UCI Machine Learning Repository) как FTP-архив — коллекцию баз данных, предметных теорий и генераторов данных для эмпирического анализа алгоритмов машинного обучения. Эта инициатива устраняла критический дефицит стандартизированных общедоступных наборов данных для растущего сообщества в области машинного обучения. Репозиторий стал основным источником наборов данных для машинного обучения по всему миру и открыл студентам, преподавателям и исследователям доступ к высококачественным эталонным данным. За прошедшие годы он был процитирован десятки тысяч раз и входит в число наиболее используемых ресурсов в информатике. Сегодня репозиторий, управляемый Центром машинного обучения и интеллектуальных систем, предлагает наборы данных из здравоохранения, финансов и множества других областей. Репозиторий кардинально демократизировал образование и исследования в области машинного обучения.
Байесовские сети: рассуждения в условиях неопределённости
Пока нейронные сети и экспертные системы соперничали за внимание, Джуда Перл в Калифорнийском университете в Лос-Анджелесе строил третий фундаментальный столп ИИ: рассуждения в условиях неопределённости. В своей книге 'Probabilistic Reasoning in Intelligent Systems' (1988) он популяризировал байесовские сети — графы, в которых узлы представляют переменные, а рёбра — их вероятностные зависимости. Вместо жёстких правил 'если — то' и произвольных весовых коэффициентов экспертных систем они позволяли аккуратно сочетать знания и неопределённость и эффективно делать выводы. Байесовские сети определили ИИ и машинное обучение в 1990-х и 2000-х годах; Перл получил премию Тьюринга в 2011 году и впоследствии обратился к каузальному выводу — вопросу о причинах, стоящих за данными. Если подходить честно: теорема Байеса сама по себе восходит к XVIII веку; вклад Перла состоял не в изобретении теории вероятностей, а в том, чтобы сделать вероятностное рассуждение структурируемым и вычислимым применительно к ИИ.
Теорема об универсальной аппроксимации
Математическое доказательство теоретической мощи нейронных сетей. В 1989 году Курт Хорник, Максвелл Стинчкомб и Халберт Уайт опубликовали основополагающую статью 'Multilayer feedforward networks are universal approximators' в журнале Neural Networks. Их строгое доказательство показало: уже одного скрытого слоя с достаточным количеством нейронов хватает для сколь угодно точной аппроксимации любой борелевски измеримой функции. Эта теоретическая основа математически обосновала применение нейронных сетей и убедила исследователей в том, что достаточно большие сети способны моделировать сложные нелинейные зависимости в реальных данных. Параллельно появились схожие работы Джорджа Сайбенко и Фунахаси, использовавших различные методы. Теорема установила универсальность за счёт расширения скрытого слоя и стала теоретическим столпом для всех последующих разработок в области глубокого обучения. Хорник и соавторы создали математическую основу доверия, которая обеспечила возрождение нейронных сетей в 1990-е годы.
Всемирная паутина: изобретение WWW
Изобретение, которое объединило мир и заложило основу для современных источников данных ИИ. 12 марта 1989 года Тим Бернерс-Ли подал в ЦЕРН предложение по 'системе управления информацией' — первоначально названной 'Mesh', а впоследствии 'World Wide Web'. Британский учёный осознал необходимость автоматизированного обмена информацией между исследователями по всему миру. К концу 1990 года он разработал три фундаментальные веб-технологии: HTML (HyperText Markup Language), HTTP (HyperText Transfer Protocol) и URI/URL. Первый веб-сервер info.cern.ch работал на компьютере NeXT вместе с первым браузером-редактором 'WorldWideWeb.app'. В 1991 году Сеть стала общедоступной. Экспоненциальный рост — примерно с 10 сайтов (1992) до нескольких сотен тысяч (1996) — создал информационную основу для последующих систем ИИ. Без Всемирной паутины не существовало бы наборов данных Common Crawl и больших языковых моделей.
LeNet и рождение свёрточных нейронных сетей
Первое успешное практическое применение свёрточных нейронных сетей (CNN). В 1989 году Янн ЛеКун в AT&T Bell Labs впервые объединил метод обратного распространения ошибки (Backpropagation) с архитектурой CNN для распознавания рукописных символов. Эта система — впоследствии известная как прародитель семейства LeNet — распознавала рукописные почтовые индексы для Почтовой службы США (US Postal Service) с примечательной точностью: около 1% ошибок на обучающих данных и около 5% — на ранее не виденных тестовых данных; если сети разрешалось отклонять неуверенные случаи, ошибка на оставшихся цифрах снижалась примерно до 1%. Эти результаты доказали практическое превосходство CNN над традиционными подходами и заложили основу современного компьютерного зрения. Они показали, что нейронные сети — не просто теоретические конструкты, а инструмент для решения реальных бизнес-задач. Архитектура прошла несколько итераций улучшений и в 1998 году воплотилась в LeNet-5, достигшей точности 99,05% на MNIST. Эта работа заложила фундамент всех современных архитектур CNN.
TD-Gammon: обучение через игру против самого себя
Задолго до AlphaGo одна программа IBM показала, на что способно обучение с подкреплением: в 1992 году Джеральд Тесауро представил TD-Gammon — нейронную сеть, обучившуюся играть в нарды. Примечательным был метод обучения. TD-Gammon тренировался почти исключительно за счёт сотен тысяч партий против самого себя, обучаясь по итогам игр с помощью метода временных разностей (Temporal Difference), постепенно корректирующего прогнозы. Никто не показывал ему хороших ходов. Сеть достигла почти мирового уровня и даже открыла начальные ходы, которые профессиональные игроки-люди впоследствии переняли. Важная оговорка: каким бы впечатляющим ни был этот успех, он долгое время не поддавался переносу на другие игры. Одна из причин — в кубиках: нарды являются игрой с элементом случайности, и случай сам по себе обеспечивает разнообразие при тренировках — преимущество для самоигры, которого детерминированные игры вроде шахмат или го не дают.
Q-обучение: фундамент обучения с подкреплением
В 1992 году Крис Уоткинс и Питер Даян опубликовали математическое доказательство для Q-обучения (Q-learning) — алгоритма, которому предстояло существенно изменить мир ИИ. Основную идею Уоткинс разработал ещё в 1989 году в своей докторской диссертации 'Learning from Delayed Rewards' в King's College Cambridge. Q-обучение решало фундаментальную задачу: как агент может действовать оптимально, не нуждаясь в модели своей среды? Ответ был элегантным — через последовательную оптимизацию Q-функции, которая присваивает значение каждой паре состояние-действие. Доказательство сходимости 1992 года показало: при бесконечном исследовании Q-обучение гарантированно находит оптимальную стратегию для любой конечной задачи Маркова (Markov Decision Problem). Этот безмодельный метод стал краеугольным камнем современного обучения с подкреплением. От робототехники до финансовых рынков, от игр до автономных систем — Q-обучение применяется повсеместно. В конце 2013 года DeepMind представил глубокий вариант — Deep Q-Networks (DQN) (публикация в Nature в 2015 году), достигнув при этом на большинстве игр Atari уровня или превысив уровень человека. По сей день Q-обучение — прежде всего в форме Deep Q-Network — является одним из основных строительных блоков многочисленных систем ИИ.
Penn Treebank: синтаксическая разметка меняет NLP
Создание фундаментального корпуса для современных исследований в области синтаксического разбора. В 1993 году Митчелл Маркус, Беатрис Санторини и Мэри Энн Марцинкевич опубликовали основополагающую статью 'Building a Large Annotated Corpus of English: The Penn Treebank' в журнале Computational Linguistics. Более 4,5 миллиона слов американского английского, размеченных частями речи, и около 3 миллионов из них — с детальной синтаксической (скелетной) разметкой: Penn Treebank существенно изменил компьютерную лингвистику. Двухэтапный метод сочетал автоматическую POS-разметку с ручной корректурой, обеспечивая исключительное качество аннотации. За всё время проекта — около семи лет (1989–1996) — и в расширенном Penn Treebank II в общей сложности были созданы 7 миллионов слов с POS-разметкой, 3 миллиона текстов со скелетным разбором и 2 миллиона структур предикат-аргумент. Penn Treebank утвердил эмпирические методы в компьютерной лингвистике и стал основой современных алгоритмов синтаксического разбора. По сей день Penn Treebank служит современным NLP-системам важным эталоном для оценки синтаксического разбора и языкового моделирования.
AdaBoost: слабые обучающиеся становятся сильными
В 1995 году Йоав Фройнд и Роберт Шапир разработали AdaBoost (Adaptive Boosting) — алгоритм, существенно изменивший машинное обучение. Их ключевая идея: объединить множество 'слабых обучающихся' в высокоточную модель предсказания. Слабый обучающийся лишь немного лучше случайного угадывания — но сотни таких вместе способны достигать впечатляющих результатов. AdaBoost адаптируется: неверные предсказания на следующем шаге получают больший вес. Так система автоматически фокусируется на трудных случаях. Теоретическая элегантность подкупала — Фройнд и Шапир доказали, что ошибка на обучающей выборке убывает экспоненциально быстро, пока каждый слабый обучающийся лучше случайного. В 2003 году они получили за это обоснование теории бустинга Премию Гёделя — одну из самых престижных наград в теоретической информатике. AdaBoost нашёл практическое применение в биологии, компьютерном зрении и распознавании речи. Метод заложил фундамент для современных ансамблевых методов и вдохновил целое поколение алгоритмов бустинга вплоть до XGBoost.
Метод опорных векторов: классификация с максимальным зазором
Утверждение элегантного геометрического подхода к надёжной классификации. В 1995 году Коринна Кортес и Владимир Вапник опубликовали в AT&T Bell Labs основополагающую статью 'Support-Vector Networks' в журнале Machine Learning. Метод опорных векторов (SVM) расширил ранний подход Вапника и Червоненкиса к максимальному зазору 1964 года ('Обобщённый портрет') до практического решения для неразделимых обучающих данных благодаря нововведению 'мягкого зазора' (Soft Margin). Ключевой принцип состоит в построении линейных решающих поверхностей в многомерных пространствах признаков с помощью нелинейных преобразований входных данных. Ядерный трюк (Kernel Trick) 1992 года позволил эффективно выполнять вычисления без явного преобразования. Методы опорных векторов максимизируют зазор между классами и тем самым обеспечивают высокую способность к обобщению. Набрав десятки тысяч цитирований, статья стала одной из наиболее цитируемых в области машинного обучения и доминировала в задачах классификации вплоть до революции глубокого обучения. Методы опорных векторов по-прежнему остаются надёжными, интерпретируемыми и эффективными для высокоразмерных задач.
WordNet: семантическая сеть языка
Первый лексический словарь для вычислительной лингвистики, построенный как семантическая сеть. В ноябре 1995 года Джордж Миллер опубликовал основополагающую статью 'WordNet: A Lexical Database for English' в журнале Communications of the ACM, представив идею, которую разрабатывал с 1986 года. WordNet организует английские существительные, глаголы, прилагательные и наречия в синсеты (synsets) — когнитивные группы синонимов, связанные семантическими и лексическими отношениями. Эта структура отражает семантическую память человека и позволяет перемещаться по сети слов и понятий, связанных по смыслу. Машиночитаемые словари существовали и прежде, однако WordNet стал первым, где словарный запас последовательно моделировался как сеть синсетов и отношений значений, соединяя традиционную лексикографическую информацию с современной обработкой данных. Разработка началась в 1986 году под руководством Миллера и его команды в Принстонском университете; WordNet стал основой для иерархий ImageNet и современных систем обработки естественного языка. Структура семантической сети повлияла на все последующие графы знаний и техники встраивания.
PageRank: алгоритм Google ценой в миллиарды
В 1996 году двое аспирантов Стэнфорда разработали алгоритм, которому предстояло существенно изменить интернет. Ларри Пейдж и Сергей Брин запустили проект 'BackRub', основанный на оригинальной идее: важность веб-страницы определяется не только её содержанием, но и ссылками, которые на неё указывают. Как при научном цитировании: чем чаще на страницу ссылаются, тем она важнее. Алгоритм PageRank моделирует 'случайного сёрфера', который случайным образом переходит по ссылкам в интернете. Чем чаще случайный сёрфер попадает на страницу через структуру ссылок, тем выше её значимость. Веб-краулер Пейджа стартовал в марте 1996 года с его собственной стэнфордской домашней страницы. Формальная публикация статьи по PageRank состоялась в январе 1998 года в виде технического отчёта Стэнфорда. К августу 1996 года BackRub уже обнаружил около 75 миллионов URL — адресов, найденных по ссылкам, из которых лишь часть была реально обойдена краулером. Даже ранний стэнфордский прототип давал более релевантные результаты, чем современные поисковые сервисы — Excite или Yahoo!. Стэнфорд получил патент и продал свои 1,8 миллиона акций Google в 2005 году за 336 миллионов долларов. Из университетского проекта выросла одна из самых успешных поисковых систем — и основа современного веб-ИИ.
Deep Blue побеждает Каспарова
Первая победа машины над действующим чемпионом мира по шахматам в условиях турнира. 11 мая 1997 года Deep Blue вошёл в историю: суперкомпьютер IBM победил Гарри Каспарова в матче-реванше в Нью-Йорке со счётом 3,5:2,5. После поражения 1996 года IBM кардинально переработала систему: новые шахматные чипы удвоили скорость до 200 миллионов позиций в секунду, улучшенные базы данных эндшпиля и советы гроссмейстеров повысили игровую силу. Решающая шестая партия длилась всего один час — после жертвы коня Каспаров быстро оказался в объективно проигранной позиции и сдался уже на 19-м ходу, что стало беспрецедентным моментом в его карьере. Победа впервые продемонстрировала превосходство компьютеров в сложном стратегическом мышлении и стала поворотным моментом в общественном восприятии ИИ. Призовой фонд в 700 000 долларов для Deep Blue подчеркнул историческое значение этого триумфа машинного интеллекта.
LSTM: Долгая краткосрочная память
Решение проблемы затухающего градиента и рождение эффективного моделирования последовательностей. 15 ноября 1997 года Сепп Хохрайтер и Юрген Шмидхубер опубликовали основополагающую статью «Long Short-Term Memory» в Neural Computation. Их инновация решила фундаментальную проблему рекуррентных сетей: исчезновение градиентов на длинных последовательностях. LSTM ввёл специальные ячейки памяти с механизмами гейтов, обеспечивающими константный поток ошибки через тысячи временных шагов. Мультипликативные гейты учатся открывать и закрывать доступ к константной карусели ошибок. С O(1)-сложностью на временной шаг и локальным обучением LSTM значительно превзошёл все существовавшие тогда RNN-методы. Система впервые решила сложные проблемы с долгими временными задержками, которые ранее были нерешаемы. LSTM стал основой для современного распознавания речи, перевода и анализа временных рядов.
MNIST: стандарт машинного обучения
Создание одного из важнейших эталонных наборов данных для начинающих в области компьютерного зрения. В 1998 году Янн ЛеКун, Коринна Кортес и Кристофер Бёрджес представили набор данных MNIST — курированную коллекцию рукописных цифр, ставшую 'Hello World' машинного обучения. Основанный на Special Database 3 и Special Database 1 от NIST, MNIST содержит 70 000 нормализованных изображений размером 28x28 пикселей в оттенках серого: 60 000 для обучения и 10 000 для тестирования. Тщательная предобработка и сглаживание сделали MNIST идеальным для учебных целей без трудоёмкой подготовки данных. MNIST появился в статье 'Gradient-based learning applied to document recognition' (Proceedings of the IEEE, ноябрь 1998). Набор данных стал стандартным эталоном для бесчисленных алгоритмов машинного обучения и позволил целым поколениям студентов получить первые результаты в области компьютерного зрения. MNIST демократизировал образование в сфере машинного обучения по всему миру.
Случайный лес: прорыв в ансамблевых методах
В 2001 году Лео Брейман из Калифорнийского университета в Беркли опубликовал одну из наиболее цитируемых статей по машинному обучению за всё время — 'Random Forests'. Его алгоритм существенно изменил концепцию ансамблевых методов и стал одним из важнейших инструментов современной статистики. Базовая идея была гениально проста: вместо одного дерева решений обучают сотни случайных деревьев и дают им проголосовать. Каждое дерево видит лишь случайное подмножество данных и признаков — 'бэггинг' (bagging) в сочетании с рандомизацией признаков. Результат: резкое снижение проблем переобучения (overfitting) и исключительная точность предсказаний. Брейман также предоставил теоретическую основу — границы ошибки обобщения, основанные на силе дерева и корреляции. Случайный лес стал одним из самых не требующих обслуживания алгоритмов машинного обучения типа 'подключи и работай': минимальная настройка, максимальная производительность. От биоинформатики до анализа финансовых рынков случайный лес по сей день доминирует в бесчисленных приложениях и сделал ансамблевые методы стандартным инструментом — параллельно с направлением бустинга (boosting), из которого впоследствии вырос XGBoost.
Основание Future of Humanity Institute
Институционализация исследований безопасности ИИ и оценки экзистенциальных рисков. В 2005 году Ник Бостром основал Future of Humanity Institute в Оксфордском университете как мультидисциплинарную исследовательскую группу. Начав всего с трёх исследователей, FHI превратился в интеллектуальный центр притяжения для блестящих, нередко эксцентричных мыслителей и вырос примерно до 40 сотрудников. Институт создал новые исследовательские области: экзистенциальные риски, выравнивание ИИ (AI Alignment), управление ИИ (AI Governance) и долгосрочное мышление (Longtermism). Ранние публикации Бострома, такие как 'The fable of the dragon tyrant' (2005) и 'What is a singleton?' (2006), сформировали подходы к безопасности ИИ. Несмотря на относительно короткие 19 лет существования вплоть до закрытия в 2024 году, FHI внёс значительный вклад и создал новый способ мышления о ключевых вопросах человечества. Академическая легитимизация исследований безопасности ИИ через Оксфорд придала этой области научный авторитет.
DARPA Grand Challenge: рождение автономного вождения
8 октября 2005 года синий Volkswagen Touareg по имени 'Stanley' вошёл в историю. Под руководством Себастьяна Труна команда Stanford Racing Team выиграла DARPA Grand Challenge — первое в мире успешное соревнование автономных транспортных средств. После того как в 2004 году все участники потерпели неудачу (лучший результат: 7,4 мили, то есть 11,9 км), Stanley прошёл весь маршрут длиной 212 км по пустыне за 6 часов 53 минуты. Финишную черту пересекли пять машин, четыре из них — в рамках временного лимита; это был разительный прогресс по сравнению с нулём в предыдущем году. Stanley преодолел три узких тоннеля, более 100 крутых поворотов и опасный Beer Bottle Pass с его обрывами. Новаторство состояло в программном обеспечении, а не в аппаратной части: сенсоры LiDAR, машинное обучение и журнал решений человека-водителя дали Stanley возможности, которых прежде не было ни у одного робота. Призовые 2 миллиона долларов стали лишь началом — Stanley заложил основу для Tesla Autopilot, Google Waymo и всей индустрии автономных транспортных средств. Сегодня Stanley хранится в Смитсоновском музее.
Сети глубокого доверия: ренессанс глубокого обучения
В 2006 году Джеффри Хинтон изменил мир ИИ своей важной статьёй о сетях глубокого доверия (Deep Belief Networks). После многолетнего затишья в области нейронных сетей он показал, как можно эффективно обучать глубокие нейронные сети. Его инновация: послойное предобучение (Pre-Training) с помощью ограниченных машин Больцмана (Restricted Boltzmann Machines, RBM). Эта 'жадная' стратегия обучения решила проблему инициализации весов и сделала глубокое обучение (Deep Learning) практически применимым. Метод складывает RBM поверх друг друга и обучает каждый слой отдельно, после чего вся сеть дорабатывается в целом. Работа Хинтона положила конец многолетнему забвению нейронных сетей и открыла эпоху их возрождения. Уже в 2009 году DBN значительно снизили частоту ошибок в распознавании речи. В 2012 году команда Хинтона победила на соревновании ImageNet Challenge (ILSVRC) с AlexNet — глубокой свёрточной нейронной сетью, обученной с использованием GPU, ReLU и Dropout, которая уже не зависела от RBM-предобучения DBN. AlexNet достигла частоты ошибок top-5 на уровне 15,3% против 26,2% у второй команды — значительное улучшение. Этот момент знаменует возрождение нейронных сетей и начало нынешнего подъёма ИИ.
Приз Netflix: алгоритм за миллион долларов
Демократизация машинного обучения посредством краудсорсингового конкурса беспрецедентного масштаба — с открытым набором данных и призовым фондом в один миллион долларов. 2 октября 2006 года Netflix запустил этот конкурс с призом в миллион долларов: кто улучшит алгоритм рекомендаций Cinematch на 10 %? Предоставив более 100 миллионов оценок от 480 000 пользователей для 17 770 фильмов, Netflix создал один из крупнейших общедоступных наборов данных для машинного обучения. Зарегистрировалось более 40 000 команд из 186 стран, из которых более 5 000 попали в квалификационную таблицу лидеров и в совокупности подали около 44 000 допустимых решений. Когда 26 июня 2009 года команда 'BellKors Pragmatic Chaos' первой преодолела отметку в 10 %, это запустило 30-дневный финальный этап, завершившийся 26 июля 2009 года; официально победитель с улучшением на 10,06 % был объявлен на церемонии награждения 21 сентября 2009 года. Рецепт успеха: ансамблевое сочетание матричной факторизации и ограниченных машин Больцмана. Конкурс существенно изменил коллаборативную фильтрацию и продемонстрировал мощь краудсорсинга для решения сложных задач машинного обучения. Несмотря на то что Netflix так и не внедрил алгоритмы победителей в производство (слишком высокие затраты на реализацию), конкурс оказал долгосрочное влияние на современную индустрию рекомендательных систем.
Основан фонд Common Crawl
Демократизация интернета как обучающих данных для искусственного интеллекта. В 2007 году Гил Эльбаз основал фонд Common Crawl с миссией: архивировать весь публичный интернет и делать его свободно доступным. С 2008 года начался систематический сбор данных (краулинг), и с тех пор корпус растёт на миллиарды страниц ежемесячно, достигнув к 2024 году порядка более 100 миллиардов веб-страниц и нескольких петабайт данных. Эта коллекция стала важнейшим источником обучающих данных для больших языковых моделей (Large Language Models) и обеспечила разработку GPT-3, ChatGPT, LLaMA и других современных систем ИИ. Common Crawl отличается от коммерческих подходов своей некоммерческой природой и открытой доступностью. Необработанные исходные данные требуют последующей обработки, однако фонд демократизировал доступ к обширным языковым данным и сделал ИИ-исследования менее зависимыми от проприетарных наборов данных.
CUDA: видеокарта становится двигателем ИИ
Революция ИИ 2012 года работала не только на алгоритмах — она работала на видеокартах. Почву для этого подготовила NVIDIA в 2007 году с CUDA: платформой, позволявшей запускать обычные программы на языке, подобном C, прямо на GPU — а не только графику. Анонсированная с чипом G80 в конце 2006 года, в феврале 2007 вышедшая в публичную бету и выпущенная в виде версии 1.0 в июне 2007 года, CUDA впервые открыла широкий доступ к огромному параллелизму графических процессоров. Это прекрасно сочетается с нейронными сетями, вычисления в которых сводятся к матричным умножениям — тысячи мелких операций одновременно. Пять лет спустя Крижевский, Суцкевер и Хинтон обучили AlexNet на двух картах NVIDIA GTX 580 с CUDA — прорыв, зажёгший глубокое обучение. С 2014 года cuDNN от NVIDIA поставлял оптимизированные строительные блоки, на которых сегодня работают TensorFlow, PyTorch и другие фреймворки. Если подходить честно: CUDA не изобрела GPGPU (программируемые шейдеры появились в 2001 году, BrookGPU — в 2004-м) и не стала единственной причиной глубокого обучения — но она сделала необходимые вычислительные мощности доступными, а без них ничего остального просто не было бы.
Обучение с нулевым числом примеров: обучение без данных
Формализация обучения на невиданных ранее классах посредством семантических описаний. В июле 2008 года Хьюго Ларошель, Думитру Эрхан и Йошуа Бенжио представили на конференции AAAI работу 'Zero-data Learning of New Tasks', заложив теоретическую предварительную формализацию. Само название 'Zero-Shot Learning' закрепили в 2009 году две другие группы исследователей: Палатуччи с коллегами в статье 'Zero-Shot Learning with Semantic Output Codes' на конференции NIPS 2009 и Лямперт с коллегами, предложивший основанный на атрибутах подход на конференции CVPR 2009. Фундаментальная проблема: как модель может классифицировать классы, для которых отсутствуют обучающие данные, а есть только описания? Решение состояло в семантических векторных представлениях (embedding) и переносе обучения — повторном использовании обученных моделей для новых задач. Формализация Ларошеля была направлена на очень большие наборы классов, которые не могут быть полностью охвачены обучающими данными. Экспериментальный анализ подтвердил значительные способности к обобщению в этом контексте. Эта работа заложила концептуальный фундамент для современных возможностей Few-Shot и Zero-Shot в GPT-3, GPT-4 и других больших языковых моделях. Обучение с нулевым числом примеров стало ключевой технологией для масштабируемых систем ИИ.
Создание датасетов CIFAR
Создание фундаментального бенчмарка для компьютерного зрения. В 2009 году Алекс Крижевский, Винод Наир и Джеффри Хинтон в Университете Торонто разработали датасеты CIFAR-10 и CIFAR-100. Они были созданы как размеченные подмножества из 80-миллионного датасета изображений «Tiny Images». CIFAR-10 содержит 60 000 цветных изображений 32x32 пикселя в десяти категориях: самолёты, автомобили, животные и другие, а CIFAR-100 распределяет то же количество изображений по ста более детальным классам. Датасеты стали одним из важнейших бенчмарков в исследованиях компьютерного зрения и позволили стандартизировать сравнение различных алгоритмов. Примечательна связь с AlexNet: Крижевский использовал CIFAR-10 ещё до 2011 года для обучения небольших CNN на одиночных GPU — предшественник его позднейшего успеха ImageNet в 2012 году.
ImageNet: набор данных, изменивший всё
Создание набора данных, который открыл путь к развитию глубокого обучения. В 2009 году Фэй-Фэй Ли вместе со своей командой представила статью по ImageNet и продемонстрировала визуальную базу данных, призванную преобразовать компьютерное зрение. На момент запуска она насчитывала около 3,2 миллиона изображений с ручной разметкой примерно в 5 200 категориях. В полном объёме ImageNet впоследствии охватил более 14 миллионов изображений с ручными аннотациями и около 22 000 категорий, основанных на иерархиях WordNet, — тем самым устраняя критическое узкое место: нехватку больших, высококачественных обучающих данных. Разметку выполняли около 49 000 работников из 167 стран через Amazon Mechanical Turk — проект беспрецедентного масштаба. То, что начиналось как постер в углу конференц-зала в Майами-Бич, переросло в ежегодный ImageNet Challenge (ILSVRC) и стало одним из трёх движущих факторов развития современного ИИ. ImageNet открыл путь к прорыву AlexNet в 2012 году и заложил фундамент для автономных транспортных средств, распознавания лиц и медицинской визуализации.
Основание DeepMind
Рождение лаборатории ИИ, которой предстояло делать заголовки новостей. В сентябре 2010 года Демис Хассабис, Шейн Легг и Мустафа Сулейман основали в Лондоне DeepMind Technologies. Их цель: разработать общий искусственный интеллект, объединив знания из нейронауки и машинного обучения. Хассабис, бывший вундеркинд в шахматах и разработчик игр, принёс уникальное видение: ИИ должен учиться подобно человеческому мозгу. В 2014 году Google приобрела стартап примерно за 500 миллионов долларов — одно из крупнейших приобретений в области ИИ в истории. Впоследствии DeepMind поразит мир прорывами AlphaGo, AlphaFold и другими достижениями.
ImageNet Challenge: начало соревнования
Учреждение важнейшего эталона компьютерного зрения в истории ИИ. В 2010 году стартовал первый ImageNet Large Scale Visual Recognition Challenge (ILSVRC) — стандартизированное соревнование, которое определило направление исследований компьютерного зрения на следующее десятилетие. С 1 000 категориями объектов и 1,2 миллиона обучающих изображений этот конкурс значительно превзошёл доступные на тот момент эталоны, например PASCAL VOC, располагавший лишь 20 классами. Оценка проводилась по метрикам Top-1 и Top-5 ошибок — стандартам, актуальным и по сей день. С 2010 по 2017 год точность Top-5 у победителей существенно выросла: с 71,8 % до 97,3 %, в конечном счёте превысив уровень человека. Ежегодный конкурс привлёк более 50 организаций со всего мира и катализировал достижения, кульминацией которых в 2012 году стал значительный прорыв AlexNet — уровень ошибок Top-5 составил всего 15,3 % (около 84,7 % точности).
Watson побеждает чемпионов Jeopardy
Триумф IBM в обработке естественного языка и доказательство машинного понимания речи. 16 февраля 2011 года система IBM Watson в телевизионном шоу Jeopardy! победила двух самых успешных чемпионов за всю историю: Кена Дженнингса (74 победы подряд) и Брэда Раттера (3,25 миллиона долларов выигрышей до 2005 года). Watson, разработанный командой DeepQA под руководством Дэвида Феруччи, состоял из 90 серверов IBM Power 750 (в 10 стойках) с 16 терабайтами оперативной памяти и 2 880 процессорными ядрами POWER7. Новаторство заключалось в обработке естественного языка: Watson понимал вопросы на обычном языке и отвечал точнее любой стандартной поисковой технологии — без подключения к интернету. Выиграв 77 147 долларов (пожертвованных на благотворительность), Watson обошёл своих соперников-людей более чем на 50 000 долларов. Знаменитая заключительная реплика Кена Дженнингса — 'I for one welcome our new computer overlords' — подчеркнула историческое значение этого рубежа в области обработки естественного языка.
Запуск Siri: голосовой ассистент становится массовым явлением
4 октября 2011 года Apple существенно изменила взаимодействие человека с компьютером, представив Siri на iPhone 4S. Как первый голосовой ассистент, глубоко интегрированный в смартфон для широкой аудитории, Siri принесла ИИ в карманы миллионов людей. 'Какая сегодня погода?' или 'Найди мне хороший греческий ресторан' — внезапно пользователи смогли говорить со своим телефоном естественным образом. Siri не была совершенно новым изобретением: с 2010 года она существовала как отдельное iOS-приложение компании Siri Inc. (приобретённой Apple), а Google уже предлагал голосовой поиск Voice Actions. Но именно бесшовная интеграция Apple в операционную систему превратила голосового ассистента в массовое явление. Siri опиралась на десятилетия исследований в SRI International и проекте CALO от DARPA. Сьюзан Беннетт ещё в 2005 году неосознанно записала оригинальный голос. Стив Джобс, тяжело больной в последние дни жизни, сам не выступил на презентации — iPhone 4S представлял Тим Кук. На следующий день после представления Siri Джобс скончался. Siri не была идеальной — критики указывали на жёсткие команды и недостаточную гибкость. Но цель была достигнута: ИИ стал массовым явлением. Siri вдохновила Amazon Alexa, Google Assistant и Microsoft Cortana. Эпоха голосовых ассистентов началась.
Dropout-регуляризация
В июле 2012 года Джеффри Хинтон, Нитиш Шривастава, Алекс Крижевский, Илья Суцкевер и Руслан Салахутдинов значительно изменили обучение нейронных сетей, изобретя Dropout-регуляризацию. Эта элегантная техника предотвращает переобучение (Overfitting) путём случайного отключения примерно половины всех нейронов во время обучения, что устраняет сложные совместные адаптации. Вместо того чтобы запоминать специфические комбинации признаков, каждый нейрон учится распознавать устойчивые, универсально полезные паттерны. Метод, опубликованный на arXiv 3 июля 2012 года, несколько месяцев спустя стал одним из ключевых элементов победы AlexNet на ImageNet в рамках ILSVRC 2012, результаты которого были представлены в октябре 2012 года, — наряду с GPU-обучением, ReLU-активацией и глубиной сети, — и превратился в стандарт большинства современных архитектур глубокого обучения. Dropout устанавливает новые рекорды в распознавании речи и объектов и решает центральную проблему переобучения глубоких сетей.
Успех AlexNet
Переломный момент для глубокого обучения и современного ИИ. 30 сентября 2012 года были опубликованы результаты конкурса ImageNet Challenge, который AlexNet выиграл с таким отрывом, что это навсегда изменило компьютерное зрение. Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон из Университета Торонто разработали CNN-архитектуру, которая превзошла конкурентов на впечатляющие 10,9 процентных пункта — улучшение, признанное в научном сообществе исключительным. Имея 60 миллионов параметров и используя инновационные методы, такие как активации ReLU и слои Dropout, AlexNet наглядно продемонстрировал практическое превосходство глубокого обучения. Это был момент, когда интересная теория стала доминирующей технологией. Янн ЛеКун назвал это 'несомненным переломным моментом в истории компьютерного зрения'. Реализация на основе GPU открыла путь к современному развитию ИИ.
Революция глубокого обучения
Год, ознаменовавший начало современной эпохи ИИ благодаря сочетанию наборов данных, вычислительной мощи GPU и нейронных архитектур. 2012 год отметил подъём глубокого обучения (Deep Learning) как доминирующей технологии ИИ — катализатором стала впечатляющая победа AlexNet на ImageNet. Это стало возможным благодаря конвергенции трёх факторов: набор данных ImageNet, созданный Фэй-Фэй Ли, предоставил огромное количество размеченных обучающих данных; вычисления на GPU обеспечили необходимую мощность для обучения глубоких сетей; улучшенные методы обучения — ReLU-активации и Dropout-регуляризация — преодолели прежние ограничения. Команда Джеффри Хинтона — Алекс Крижевский, Илья Суцкевер и сам Хинтон — доказала в доме родителей Крижевского на двух картах Nvidia, что глубокие нейронные сети практически применимы. AlexNet стал поворотным моментом для компьютерного зрения. Этот успех значительно усилил интерес к глубокому обучению и открыл путь к VGG, ResNet и, наконец, к сегодняшнему развитию генеративного ИИ.
Word2Vec: слова как векторы
Преобразование представления слов через семантические векторные пространства. 16 января 2013 года Томас Миколов вместе со своей командой в Google опубликовал основополагающую статью 'Efficient Estimation of Word Representations in Vector Space'. Word2Vec изменил обработку естественного языка, представив слова в виде плотных, низкоразмерных векторов (как правило, от 100 до 300 измерений), отражающих семантические и синтаксические связи, — в противовес огромным, разреженным one-hot-векторам прежних методов. Две архитектурных варианта — CBOW (Continuous Bag of Words) и Skip-Gram — обучались на больших текстовых корпусах на основе наблюдения, что схожие слова встречаются в схожих контекстах. Знаменитый пример продемонстрировал векторную арифметику: король - мужчина + женщина = королева. С более чем 49 000 цитирований работа Миколова стала одной из самых влиятельных в области обработки естественного языка. Word2Vec заложил фундамент для всех современных техник встраивания (embedding) и открыл возможность семантических рассуждений в векторных пространствах. Это новшество проложило путь к архитектурам Transformer и современным большим языковым моделям.
VAE: вариационные автокодировщики
Разработка вероятностных генеративных моделей посредством моделирования скрытого пространства. 20 декабря 2013 года Дидерик Кингма и Макс Веллинг опубликовали статью 'Auto-Encoding Variational Bayes'. Вариационные автокодировщики (VAE) соединяют сети кодировщика и декодировщика через вероятностное скрытое пространство — как правило, многомерное гауссово распределение. В отличие от детерминированных автокодировщиков, кодировщик представляет данные как распределения, а не отдельные точки, что позволяет осуществлять непрерывную интерполяцию и генерацию данных. Трюк репараметризации (Reparameterization Trick) делает случайность дифференцируемым элементом входных данных модели и обеспечивает стандартную оптимизацию по градиенту. В своих экспериментах VAE генерировали рукописные цифры (MNIST) и небольшие изображения лиц (Frey Faces) — пусть и размытые, но служащие доказательством применимости вариационного вывода. Эта работа заложила фундамент современного генеративного ИИ и оказала влияние на последующие вероятностные подходы вплоть до диффузионных моделей.
Adam: стандартный оптимизатор глубокого обучения
Чтобы нейронная сеть обучалась, оптимизатор должен шаг за шагом поворачивать миллионы настроечных параметров в нужную сторону. В 2014 году Дидерик Кингма и Джимми Ба представили метод, который быстро стал самым востребованным в отрасли: Adam — название происходит от английского Adaptive Moment Estimation и не является аббревиатурой. Хитрость Adam в том, что для каждого отдельного параметра ведётся собственная, автоматически адаптируемая скорость обучения. Метод объединяет две проверенные идеи — импульс (momentum), сохраняющий предыдущее направление, и адаптивный размер шага в духе RMSProp. Результат: сети обучаются надёжно, без мучительного подбора скорости обучения. Статья стала одной из наиболее цитируемых в исследованиях ИИ. Если подходить честно: Adam — не панацея. В ряде случаев более простой SGD лучше обобщает данные на новые ситуации. Кроме того, Adam опирается на предшественников — AdaGrad и RMSProp, — а более поздние варианты, такие как AdamW (2017), пришлось доработать, чтобы исправить слабые места оригинала.
MS COCO: золотой стандарт компьютерного зрения
В 2014 году исследовательская группа под руководством Microsoft Research, Корнеллского университета и Калифорнийского университета в Беркли существенно изменила исследования в области компьютерного зрения с помощью набора данных COCO (Common Objects in Context). В отличие от ImageNet с изолированными объектами, COCO показывал предметы в их естественном контексте — так, как они встречаются в реальном мире. 2,5 миллиона аннотаций в 328 000 изображениях, разделённых на 91 категорию в исходной статье, из которых 80 образуют актуальный по сей день эталон для задач обнаружения объектов, — всё это предметы повседневной жизни, которые узнал бы четырёхлетний ребёнок. Инновация заключалась в деталях: маски сегментации с точностью до пикселя вместо обычных ограничивающих рамок. COCO впервые обеспечил возможность точной локализации объектов и понимания сложных сцен. Набор данных стал золотым стандартом для обнаружения объектов, сегментации экземпляров и создания описаний изображений. От YOLO до Mask R-CNN — все ведущие модели компьютерного зрения оцениваются по COCO. Стандартизированные метрики, такие как средняя точность (mAP), сделали сравнение моделей объективно возможным. Спустя более десяти лет COCO по-прежнему остаётся важнейшим эталоном в сообществе компьютерного зрения. Без COCO не было бы современных систем обнаружения объектов в автономных транспортных средствах, системах видеонаблюдения и дополненной реальности.
GAN — генеративно-состязательные сети
Иэн Гудфеллоу изобрёл генеративно-состязательные сети (GAN) в 2014 году за одну ночь в Монреале после посещения паба. Его новаторский подход заставляет две нейронные сети соревноваться в игре с минимакс-стратегией: генератор создаёт искусственные данные, дискриминатор пытается отличить настоящие данные от поддельных. Это состязательное обучение кардинально изменило генеративный ИИ. Оригинальная GAN 2014 года генерировала лишь небольшие размытые изображения (например, цифры и лица), однако проложила путь к последующей фотореалистичной генерации изображений. Работа, опубликованная в 2014 году на arXiv, стала одной из наиболее влиятельных статей в области ИИ и принесла Гудфеллоу широкую известность. За ней последовали сотни вариантов GAN.
Механизм внимания: ключ к современным большим языковым моделям
Сентябрь 2014 года: Дзмитры Бахданау, Кюнхён Чо и Йошуа Бенжио опубликовали статью, которой предстояло навсегда изменить мир обработки естественного языка (NLP). 'Neural Machine Translation by Jointly Learning to Align and Translate' решила фундаментальную проблему моделей Sequence-to-Sequence. Прежние архитектуры кодировщик-декодировщик сжимали каждое входное предложение в единственный вектор фиксированной длины — информационное узкое место при длинных предложениях. Attention Бахданау стала значительным шагом вперёд: вместо фиксированного вектора модель использовала динамическое внимание к различным частям входного предложения. Подобно тому как человеческий глаз перемещается при чтении, внимание ИИ перескакивает между релевантными словами. Эта 'Additive Attention' стала концептуальным предшественником современных NLP-систем. Трансформер (2017), появившийся позже, опирался на идею внимания, но заменил аддитивный вариант более эффективным Scaled-Dot-Product Attention. Без концепции Attention Бахданау не было бы трансформеров, без трансформеров — ни семейства GPT, ни BERT. Этот прорыв произошёл за три года до выхода статьи 'Attention Is All You Need'.
Запуск Amazon Alexa и Echo
6 ноября 2014 года Amazon представил Alexa и умную колонку Echo, существенно изменив взаимодействие человека с технологиями. Поначалу Echo продавался только по приглашениям и исключительно для участников Prime; лишь с началом открытых продаж в 2015 году голосовой ИИ стал доступен широкому кругу потребителей и превратил дом в управляемую голосом среду. Опираясь на польскую технологию синтеза речи Ivona, приобретённую 24 января 2013 года, Amazon создал принципиально новый пользовательский опыт. Echo стартовал как устройство для управления музыкой, однако быстро превратился в универсальный центр умного дома. Это новшество породило массовую категорию продуктов и ознаменовало начало масштабного развития рынка умных колонок, вдохновив многочисленных конкурентов.
Deep Q-Networks: ИИ учится играть в Atari по пикселям
Задолго до того как AlphaGo попал в заголовки газет, DeepMind в 2015 году научила ИИ играть в видеоигры Atari, опираясь исключительно на сырые пиксели изображения, — и тем самым заложила фундамент глубокого обучения с подкреплением. В феврале 2015 года команда под руководством Владимира Мних опубликовала в Nature статью 'Human-level control through deep reinforcement learning' (предварительная версия вышла в 2013 году). Нейронная сеть, которая видела лишь экран и счёт, обучилась играть в 49 различных игр Atari — с одной и той же архитектурой, без дополнительной настройки под каждую игру. Технически DeepMind объединила свёрточную сеть с Q-обучением, буфером опыта (Experience Replay, введённым Лином в начале 1990-х) и стабилизирующей целевой сетью. При оценке важна точность: система достигала человеческого уровня примерно в половине игр и превзошла все прежние методы в 43 из 49 — однако в играх с редкими наградами, таких как Montezuma's Revenge, её результат был почти нулевым. Тем не менее это стало доказательством того, что глубокие сети и обучение с подкреплением совместимы в большом масштабе — мостом от Q-обучения 1990-х к AlphaGo и AlphaZero.
Batch Normalization: важный прогресс в обучении нейронных сетей
11 февраля 2015 года Сергей Иоффе и Кристиан Сегеди из Google опубликовали статью, которая существенно изменила обучение глубоких нейронных сетей. Их диагноз: 'Internal Covariate Shift' — распределение входных данных каждого слоя смещается в процессе обучения, что делает его нестабильным. Их элегантное решение: Batch Normalization (пакетная нормализация) нормализует активации каждого слоя для каждого мини-пакета. Эффект оказался значительным: примерно в 14 раз меньше шагов обучения до достижения той же точности. Стали возможны более высокие скорости обучения, Dropout нередко оказывался лишним, а инициализация — менее критичной. Метод выступал одновременно и как регуляризатор, и как ускоритель. Ансамбль на ImageNet достиг 4,8% ошибок в топ-5, превзойдя тем самым людей-оценщиков (около 5,1%). Примечательно: последующие исследования (Santurkar и др., 2018) показали, что истинный механизм действия связан не столько с подавлением Covariate Shift, сколько со сглаживанием ландшафта функции потерь — то есть исходное объяснение сегодня считается относительным. Статья, набравшая уже более 60 000 цитирований, вдохновила множество методов нормализации: GroupNorm, LayerNorm, InstanceNorm. Сегодня Batch Normalization является стандартом во многих современных архитектурах — от ResNet до актуальных CNN. Трансформеры, напротив, как правило используют вдохновлённую этой работой Layer Normalization.
YOLO: You Only Look Once
Трансформация детекции объектов в реальном времени через унифицированную однопроходную архитектуру. 8 июня 2015 года Джозеф Редмон, Сантош Диввала, Росс Гиршик и Али Фархади представили прорывную статью 'You Only Look Once: Unified, Real-Time Object Detection'. YOLO преодолел традиционную двухэтапную парадигму детекции объектов и сформулировал детекцию как задачу регрессии для пространственно разделённых bounding boxes. Одна нейронная сеть предсказывает bounding boxes и вероятности классов непосредственно из полных изображений за одну оценку. С базовой производительностью 45 fps и Fast YOLO на поразительных 155 fps система была в сотни-тысячи раз быстрее существующих детекторов. Архитектура на основе сетки разделяла изображения на ячейки, где каждая ячейка предсказывает объекты в своём центре.
Разработка DeepMind AlphaGo
В октябре 2015 года DeepMind достиг исторического прорыва: AlphaGo стал первой системой ИИ, победившей профессионального игрока в го на полной доске без форы. AlphaGo обыграл европейского чемпиона по го Фань Хуэя со счётом 5:0, завоевав тем самым самую сложную классическую настольную игру в мире — на десятилетие раньше, чем прогнозировали эксперты. Поначалу матч оставался в тайне; публично об успехе объявили лишь 27 января 2016 года — одновременно с публикацией в научном журнале Nature. Го несравнимо сложнее шахмат — примерно в гугол (10^100) раз больше допустимых позиций, а число возможных конфигураций доски превышает количество атомов в наблюдаемой вселенной. Этот замечательный успех демонстрирует мощь нейронных сетей и поиска Монте-Карло по дереву.
Автопилот Tesla: системы помощи водителю для массового рынка
14 октября 2015 года Tesla выпустила программную версию 7.0 и тем самым впервые активировала автопилот для автомобилей Model S. Аппаратное обеспечение было установлено в автомобилях ещё в сентябре 2014 года — за год до программной активации. Система использовала технологию Mobileye с фронтальной камерой, радаром и 12 ультразвуковыми датчиками. Водители получили возможность пользоваться адаптивным круиз-контролем, системой удержания полосы движения и автоматической парковкой — функциями, прежде доступными только в автомобилях премиум-класса. Tesla охарактеризовала это как автономность 2-го уровня: система помогает водителю, но не заменяет его. При выпуске Маск подчеркнул: 'Мы рекомендуем водителям держать руки на руле.' Уже в первый год автопарк Tesla собрал сотни миллионов километров с активным автопилотом — к концу 2016 года Tesla сообщила о примерно 222 миллионах пройденных миль. Концепция — предустановить аппаратное обеспечение, а функции открывать через обновления программного обеспечения — показала автомобильной промышленности новый путь. От Mercedes до чисто технологических поставщиков, таких как Mobileye, многочисленные игроки продвигали собственные системы помощи водителю.
TensorFlow: ML-фреймворк Google становится открытым
Демократизация машинного обучения благодаря мощному внутреннему инструменту Google. 9 ноября 2015 года Google открыл исходный код TensorFlow под лицензией Apache 2.0 и сделал свою вторую ML-систему доступной для всех. TensorFlow заменил внутреннюю систему DistBelief и предложил двукратную скорость с улучшенной масштабируемостью и готовностью к производству. Как универсальный процессор графов вычислений TensorFlow позволял не только глубокое обучение, но и любые дифференцируемые вычисления. Гибкий интерфейс Python, автоматическое дифференцирование и первоклассные оптимизаторы революционизировали ML-разработку. Стратегия Google: разработка на основе сообщества ускоряет прогресс ИИ для всех. Разработанный более чем 30 авторами из команды Google Brain, TensorFlow стал одной из ведущих ML-платформ и позволил миллионам разработчиков создавать продвинутые ИИ-приложения.
ResNet: остаточные сети меняют глубокое обучение
Решение проблемы деградации очень глубоких сетей и рождение ультраглубоких нейронных архитектур. 10 декабря 2015 года команда Кайминга Хэ в Microsoft Research опубликовала статью 'Deep Residual Learning for Image Recognition' и существенно изменила глубокое обучение. До этого точность обучения ухудшалась при увеличении глубины сетей — не столько из-за затухающих градиентов, сколько потому, что глубокие сети было просто сложнее оптимизировать. ResNet ввёл остаточные соединения (residual connections) — пропускные связи, которые напрямую передают входные данные более поздним слоям и позволяют обучать ультраглубокие нейронные сети. При 152 слоях ResNet был в восемь раз глубже VGG, но менее сложным. Замечательный результат: 3,57 % ошибок Top-5 (ансамбль моделей) на ImageNet — триумф, который обеспечил первое место во всех категориях. ResNet выиграл ImageNet Classification, Detection, Localization, а также COCO Detection и Segmentation в 2015 году. Фреймворк остаточного обучения переосмыслил слои как обучение остаточным функциям (residual functions) вместо безреференсных функций. Это новшество открыло возможность обучать сети с сотнями слоёв.
Основание OpenAI
Организация, стремившаяся сделать ИИ доступным для всех, — и изменившая мир. 11 декабря 2015 года Сэм Альтман, Илон Маск и другие известные технологические деятели объявили об основании OpenAI. Заявив о намерении привлечь миллиард долларов — финансовом обещании инвесторов, распределённом на несколько лет, из которого поначалу реально поступила лишь небольшая часть, — и поставив целью разработку безопасного общего ИИ на благо всего человечества, OpenAI вышла на арену как некоммерческая исследовательская организация. То, что начиналось как идеалистическое начинание, превратилось в наиболее влиятельную лабораторию ИИ в мире. В 2019 году была учреждена дочерняя коммерческая компания. С GPT-3 и ChatGPT OpenAI заново определила, на что способен ИИ.
AlphaGo побеждает Ли Седоля
Исторический момент, когда ИИ впервые победил чемпиона мира в сложнейшей настольной игре. С 9 по 15 марта 2016 года в Сеуле прошёл матч DeepMind Challenge Match — пять партий между Ли Седолем, одним из лучших игроков в го в мире, и AlphaGo. Результат поразил мир: 4:1 в пользу машины. Особенно знаменитый «ход 37» во второй партии продемонстрировал машинную креативность — ход с вероятностью 1:10000, перевернувший вековые истины го. AlphaGo сочетал глубокое обучение с поиском по дереву Монте-Карло и обучался как на человеческих партиях, так и на самоигре. Однако ответ Ли Седоля в четвёртой партии с его «божественным ходом 78» показал, что человеческая интуиция всё ещё может удивлять. Более 200 миллионов человек по всему миру следили за этими партиями.
XGBoost: Extreme Gradient Boosting доминирует в ML
Совершенствование градиентного бустинга и завоевание задач на структурированных данных. 9 марта 2016 года Тяньци Чен и Карлос Гестрин опубликовали на arXiv статью 'XGBoost: A Scalable Tree Boosting System', представленную в августе 2016 на конференции KDD. Разработанный из PhD-проекта Чена в University of Washington, XGBoost значительно улучшил традиционный градиентный бустинг через экстремальные оптимизации: L1- и L2-регуляризация предотвращала переобучение, градиенты второго порядка давали более точную информацию о направлении, а параллелизация значительно ускорила построение деревьев. XGBoost доминировал в соревнованиях машинного обучения 2010-х и стал стандартным выбором для команд-победителей на Kaggle. На Higgs Boson ML Challenge Тяньци Чен получил специальный приз, и XGBoost использовался многими топ-участниками.
Google Assistant: стратегия 'ИИ прежде всего' становится реальностью
18 мая 2016 года Сундар Пичаи на конференции Google I/O представил Google Assistant — ответ Google на Siri и Alexa. После многих лет отставания в области голосовых помощников Google догонял конкурентов в полную силу. Assistant был чем-то большим, чем просто обновление Google Now, — он стал фундаментом стратегии Пичаи 'ИИ прежде всего' (AI-First). 'Мы хотим, чтобы пользователи вели непрерывный диалог с Google', — объяснил Пичаи. 'Мы создаём индивидуальный Google для каждого пользователя.' Планировалось, что Assistant станет 'ambient experience', охватывающим все устройства — от смартфонов до Google Home и автомобилей. В отличие от конкурентов, работавших на основе команд, Google делал ставку на естественный диалог и понимание контекста. Поначалу Assistant был лишь анонсирован; первым его домом стало приложение для обмена сообщениями Allo, а затем, в конце 2016 года, умная колонка Google Home. Запуск ознаменовал серьёзный выход Google в разработку голосового ИИ и заложил основу для нынешнего доминирования компании в области ИИ.
Partnership on AI: технологические гиганты объединяются
Значимый альянс ведущих технологических компаний ради ответственного развития ИИ. 28 сентября 2016 года Amazon, Facebook, Google, DeepMind, IBM и Microsoft основали 'Partnership on Artificial Intelligence to Benefit People and Society' — необычную коалицию бывших конкурентов. С Эриком Хорвицем (Microsoft Research) и Мустафой Сулейманом (DeepMind) в роли временных сопредседателей Partnership поначалу имела совет директоров, состоявший исключительно из корпоративных представителей, объявив о планах преобразовать его в паритетный орган с равным числом некорпоративных членов. Миссия охватывает исследования и лучшие практики в области этики, справедливости, прозрачности, защиты данных и взаимодействия человека и ИИ. Примечательно: Apple поначалу отсутствовала, но присоединилась в 2017 году. Partnership сознательно отказывается от лоббирования и сосредоточивается на научном сотрудничестве. Эта инициатива ознаменовала начало структурированного отраслевого саморегулирования в развитии ИИ.
Распознавание речи достигает уровня человека
18 октября 2016 года Microsoft добился исторического успеха: впервые компания достигла производительности уровня человека в системе распознавания речи на эталонном тесте Switchboard для разговорной речи. После 25 лет исследований цель была достигнута — уровень ошибок слов 5,9 %, что соответствует точности профессиональных транскрибистов на этой задаче. (В 2017 году Microsoft скорректировал человеческий показатель до 5,1 % и был вынужден снова догонять.) Сюэдун Хуан, главный учёный Microsoft по речевым технологиям, объявил: 'Мы достигли паритета с человеком. Это историческое достижение.' Система использовала новейшие технологии глубокого обучения: свёрточные нейронные сети, архитектуры LSTM и нейронные языковые модели с непрерывными векторами слов. Сила заключалась в систематическом сочетании проверенных компонентов — ансамбль акустических моделей CNN и BLSTM, адаптация к диктору с помощью i-vector и переоценка с помощью языковой модели. Это стало возможным благодаря конвергенции трёх факторов: больших наборов данных (Switchboard Corpus), вычислений на GPU и улучшенных методов обучения. Это достижение открыло путь для современных голосовых ассистентов — однако оно подтверждает паритет лишь в узко определённой задаче транскрипции, а не общие когнитивные способности человека.
Принципы Асиломара: экспертное сообщество устанавливает ориентиры
В начале 2017 года, задолго до ChatGPT, ведущие исследователи ИИ собрались в Асиломаре на побережье Калифорнии — там же, где биологи в 1975 году обсуждали риски генной инженерии. Конференцию по полезному ИИ организовал Future of Life Institute. Итогом стали 23 Асиломарских принципа ИИ: руководящие принципы в области исследований, таких ценностей, как безопасность и прозрачность, а также долгосрочных рисков. Под ними подписались более тысячи специалистов по ИИ, в том числе такие известные фигуры, как Стивен Хокинг и Илон Маск. Это была одна из первых масштабных попыток экспертного сообщества установить для себя ориентиры — за многие годы до того, как к теме обратились правительства. Если подходить честно: принципы носили добровольный и необязательный характер. Они повлияли на дискуссию, однако не имели юридической силы.
MobileNet — ИИ для смартфонов
В апреле 2017 года Google Research существенно изменил мобильный ИИ с помощью MobileNet — одной из первых моделей глубокого обучения, специально разработанной для смартфонов, интернета вещей и встраиваемых систем (предшественники, такие как SqueezeNet, уже существовали). Благодаря инновационной архитектуре Depthwise Separable Convolution MobileNet снижает вычислительные затраты при сохранении той же эффективности примерно до одной восьмой по сравнению с обычными свёртками. Эта примечательная эффективность — около девяти раз меньше вычислительных операций при ядрах 3x3 — открывает путь к обработке изображений в реальном времени на мобильных устройствах. MobileNet демократизировал компьютерное зрение для миллиардов смартфонов и утвердил граничные вычисления (edge computing) как новую ИИ-парадигму за пределами облачных решений.
Публикация исследовательской статьи о RLHF
Техника, которая сделала ChatGPT возможным — за годы до прорыва. В июне 2017 года исследователи из OpenAI и DeepMind опубликовали статью «Deep Reinforcement Learning from Human Preferences». Идея: вместо обучения ИИ-систем с идеально определёнными функциями вознаграждения, они учатся напрямую из человеческой обратной связи. Люди оценивают различные выводы ИИ, и система учится, какое поведение предпочтительно. Этот метод, позже известный как RLHF (обучение с подкреплением на основе человеческой обратной связи), стал ключевой технологией за ChatGPT и другими современными языковыми моделями. RLHF позволил сделать ИИ-системы более полезными, честными и безопасными.
Трансформер: 'Attention Is All You Need'
12 июня 2017 года восемь исследователей — преимущественно из Google, среди которых был и стажёр Университета Торонто — опубликовали на arXiv статью 'Attention Is All You Need' — основу современных больших языковых моделей. Эшиш Васвани, Ноам Шазир и их коллеги предложили новую архитектуру: трансформер (Transformer). В отличие от прежних моделей последовательностей, трансформер отказывается от рекуррентных и свёрточных слоёв. Вместо них используются чистые механизмы внимания. Механизм самовнимания (Self-Attention) улавливает связи между всеми позициями последовательности параллельно — последовательная обработка больше не нужна. Многоголовое внимание (Multi-Head Attention) использует несколько параллельных голов внимания, обучающихся различным аспектам отношений между словами. На наборе WMT 2014 модель достигла показателя 28,4 BLEU для пары английский — немецкий и 41,8 BLEU для пары английский — французский — новые рекорды. Архитектура оказалась широко применимой: GPT, BERT, ChatGPT и многие другие модели основаны на вариантах трансформера. Статья набрала значительно более 100 000 цитирований — и эта цифра неуклонно растёт — и входит в число наиболее цитируемых научных работ XXI века.
Генеральный план Китая по ИИ: борьба за мировое лидерство
20 июля 2017 года Государственный совет Китая объявил 'План развития искусственного интеллекта нового поколения' — первую комплексную национальную стратегию в области ИИ такого масштаба. Цель: к 2030 году стать мировой державой-лидером в области ИИ. Трёхэтапный план был чётко сформулирован: к 2020 году — конкурентоспособность на глобальном уровне; к 2025 году — мировое лидерство в отдельных областях и крупные прорывы в фундаментальной теории ИИ; к 2030 году — ведущая ИИ-сверхдержава с объёмом индустрии в 1 триллион юаней. Китай прямо обозначил ИИ как 'фокус международной конкуренции' и 'стратегическую технологию для национальной безопасности'. Инвестиции значительны: десятки миллиардов долларов направляются в исследования, инфраструктуру и развитие кадров. План охватывает военные и гражданские применения: от автономного оружия до умных городов. Принципы открытого исходного кода призваны содействовать международному сотрудничеству, тогда как Китай одновременно добивается технологической независимости. Эта стратегия существенно изменила глобальный ИИ-ландшафт и спровоцировала волну национальных ИИ-инициатив в США и Европе.
Монреальская декларация об ответственном ИИ
Первая международная инициатива, разработавшая этические принципы ИИ посредством демократического участия граждан. 3 ноября 2017 года Университет Монреаля запустил процесс совместного создания Монреальской декларации об ответственном развитии ИИ. Форум по общественно ответственному развитию ИИ собрал более 400 участников из различных секторов и дисциплин. В ходе 15 дискуссионных семинаров на протяжении трёх месяцев более 500 граждан, экспертов и заинтересованных сторон обсуждали общественные вызовы, связанные с ИИ. Опубликованная 4 декабря 2018 года декларация представляет 10 принципов и 59 рекомендаций, основанных на таких ценностях, как благополучие, автономия, справедливость, конфиденциальность и демократия. Набрав более 500 подписантов, Монреальская декларация утвердила партисипативный подход к управлению ИИ и оказала влияние на последующие международные усилия по ответственному развитию ИИ.
AlphaZero осваивает три игры
Рождение универсального игрового ИИ посредством чистого самообучения. В декабре 2017 года DeepMind представил AlphaZero — систему, освоившую три совершенно разные стратегические игры без каких-либо предварительных знаний: шахматы, сёги и го. Подход tabula rasa означал: никаких дебютных баз, никаких человеческих стратегий — только правила игры в качестве отправной точки. За 24 часа AlphaZero достиг сверхчеловеческого уровня — в шахматах уже через 4 часа, в сёги через 2 часа. В матче из 100 партий против Stockfish он выиграл 28 партий, не проиграл ни одной и свёл 72 к ничьей. Особенность заключалась в эффективном поиске: пока Stockfish оценивает 60 миллионов позиций в секунду, AlphaZero анализирует лишь 60 000 — но значительно целенаправленнее благодаря своей глубокой нейронной сети. Это достижение убедительно продемонстрировало универсальность и доменную независимость чистого обучения с подкреплением.
Премия Тьюринга за глубокое обучение
В 2019 году ИИ получил высшую награду информатики: премия А.М. Тьюринга 2018 года — нередко именуемая Нобелевской премией по информатике — была присуждена Йошуа Бенжио, Джеффри Хинтону и Яну ЛеКуну, трём крёстным отцам глубокого обучения. Ассоциация вычислительной техники (ACM) отметила их концептуальные и технические прорывы, сделавшие глубокие нейронные сети центральным элементом информатики — от метода обратного распространения ошибки и свёрточных сетей до идей, обеспечивших прорыв 2012 года. Награда стала запоздалым официальным признанием революции, над которой десятилетиями насмехались. Важная оговорка: у глубокого обучения много авторов — такие исследователи, как Юрген Шмидхубер, публично критиковали недостаточную оценку важных вкладов. Премия отмечает центральную роль трио, но не единоличное авторство.
GDPR: переломный момент в защите данных с влиянием на ИИ
25 мая 2018 года вступил в силу Общий регламент по защите данных ЕС (GDPR/DSGVO) — переломный момент для ИИ и защиты данных во всём мире. Как 'мать всех законов о защите данных' он заменил устаревшую директиву 95/46/ЕС 1995 года, принятую в эпоху зарождения интернета. GDPR ввёл принцип 'Privacy by Design' как обязательное требование: защита данных должна быть встроена в системы ИИ с самого начала. Глобальный охват регламента оказался весьма широким — даже технологические гиганты США обязаны соблюдать стандарты ЕС при обработке европейских данных. Для ИИ это стало принципиальным вызовом: как объяснить работу алгоритмов-'чёрных ящиков', когда GDPR требует прозрачности? Наблюдатели усмотрели в этом стимул к разработке более экономных с точки зрения данных систем ИИ, а методы вроде Transfer Learning приобрели большее значение. GDPR вдохновил законы о защите данных по всему миру — от Калифорнии до Сингапура. Регламент подготовил почву для Закона об ИИ ЕС 2024 года: от защиты данных к регулированию ИИ был всего один логичный шаг.
GPT-1: рождение генеративного предобучения
Основа всех современных больших языковых моделей — через обучение без учителя. 11 июня 2018 года Алек Рэдфорд с командой OpenAI опубликовал основополагающую статью 'Improving Language Understanding by Generative Pre-Training'. Эта работа впервые объединила архитектуру Transformer с предобучением без учителя и заложила двухэтапную парадигму: сначала генеративное обучение на больших текстовых корпусах, затем дообучение (Fine-Tuning) под конкретные задачи. Располагая 117 миллионами параметров и обучаясь на наборе данных BooksCorpus, включавшем более 7 000 неопубликованных книг различных жанров, GPT-1 доказал, что Transfer Learning работает для понимания языка. Двенадцатислойная архитектура Transformer на основе декодера с маскированным самовниманием (masked self-attention) задала шаблон для всей серии GPT. Это открытие превратило архитектуру Transformer 2017 года в практический инструмент для широкого круга задач обработки естественного языка (NLP) и положило начало эпохе больших языковых моделей.
BERT существенно улучшил понимание языка
Важный прогресс двунаправленных языковых моделей и рождение современной обработки естественного языка (NLP). В октябре 2018 года Джейкоб Девлин и его команда в Google Research опубликовали статью о BERT — Bidirectional Encoder Representations from Transformers (двунаправленные представления кодировщика на основе трансформеров). Эта новаторская разработка существенно изменила обработку языка: впервые были обучены глубокие двунаправленные представления на неразмеченных текстах. В отличие от предыдущих моделей, BERT одновременно учитывает как левый, так и правый контекст во всех слоях. Результат оказался примечательным: BERT достиг новых лучших показателей в одиннадцати задачах NLP и улучшил показатель GLUE на 7,7 процентных пункта — до 80,5%. Само предварительное обучение (Pre-Training) заняло несколько дней на множестве TPU, однако открытая публикация демократизировала передовые технологии: готовую предобученную модель можно было тонко настроить (Fine-Tuning) под собственную задачу примерно за 30 минут на одном облачном TPU. BERT установил парадигму Pre-Training — Fine-Tuning, которая сегодня лежит в основе всех крупных языковых моделей.
GPT-2 - "Слишком опасно для публикации"
В феврале 2019 года OpenAI выпустила GPT-2, но неожиданно решила придержать полную модель с 1,5 миллиарда параметров — якобы «слишком опасную» для полного релиза. Это беспрецедентное решение разделило ИИ-сообщество: сторонники хвалили ответственную позицию перед лицом рисков злоупотребления, таких как фейковые новости и автоматический спам. Критики обвинили OpenAI в «закрытии» исследований и раздувании необоснованных страхов. Через девять месяцев без серьёзных свидетельств злоупотреблений OpenAI выпустила полную модель, отметив поворотный момент в дебатах об ответственной разработке ИИ.
AlphaStar достигает уровня гроссмейстера
Завоевание самой сложной стратегии в реальном времени искусственным интеллектом. В июле и августе 2019 года AlphaStar компании DeepMind анонимно участвовал в рейтинговых матчах на Battle.net; 30 октября 2019 года DeepMind сообщил в журнале Nature, что система стала первым ИИ, достигшим уровня гроссмейстера в StarCraft II — игре, которая считалась слишком сложной для машин. AlphaStar превзошёл более 99,8% всех активных игроков Battle.net и освоил все три расы: Протоссов, Терранов и Зергов. Ранее AlphaStar уже победил профессиональных игроков Гжегожа 'MaNa' Кэминча и Дарио 'TLO' Вюнша со счётом 5:0 каждого. Особенностью стала архитектура многоагентного обучения с подкреплением (Multi-Agent Reinforcement Learning), обучавшая различные стратегии и контрстратегии в рамках лиги. Совершая в среднем 280 действий в минуту, AlphaStar оставался даже ниже показателей профессиональных игроков-людей, однако демонстрировал более точное исполнение. Это достижение стало важной вехой для ИИ в видеоиграх и принятии решений в реальном времени.
T5 — Text-to-Text Transfer Transformer
В октябре 2019 года Google AI существенно изменил NLP с помощью T5, Text-to-Text Transfer Transformer, который преобразует все задачи обработки языка в единый формат «текст-в-текст». С инновационным подходом «Everything is Text» перевод, резюмирование, ответы на вопросы и классификацию можно выполнять одной моделью, одной функцией потерь и одними гиперпараметрами. T5 вводит обширный датасет C4 и достигает почти человеческой производительности на бенчмарках SuperGLUE. Как базовая модель с до 11 миллиардами параметров, T5 прокладывает путь для современных больших языковых моделей и утверждает единую парадигму текст-в-текст как стандарт.
RAG: языковые модели с внешней памятью
Языковая модель знает лишь то, что содержалось в её обучающих данных, — и при неопределённости уверенно что-то придумывает. В 2020 году Патрик Льюис и его коллеги из Facebook AI предложили выход: Retrieval-Augmented Generation, сокращённо RAG (генерация с поиском и дополнением). Идея подкупает своей простотой. Прежде чем модель ответит, она ищет в внешнем источнике знаний — например, в Википедии — подходящие фрагменты текста и опирает ответ на найденное. Это позволяет обновлять знания без переобучения модели, а ответ становится проверяемым. После успеха ChatGPT RAG превратился в стандартный метод привязки языковых моделей к актуальным, проверяемым источникам — основу почти всех приложений, позволяющих общаться с собственными документами. Важная оговорка: RAG снижает количество галлюцинаций, но не устраняет их. Если найденное содержит ошибки или модель неверно его интерпретирует, ошибки сохраняются. Метод даёт ссылки, но не настоящее понимание — и опирается на более ранние исследования в области поиска информации.
Законы масштабирования нейросетей
Джаред Каплан, Сэм МакКандлиш, Том Браун и Дарио Амодеи в январе 2020 года открыли фундаментальные математические законы масштабирования нейросетей и тем самым существенно изменили разработку больших языковых моделей. Основополагающая работа OpenAI и Университета Джонса Хопкинса показала, что производительность подчиняется степенным законам в зависимости от размера модели, объёма набора данных и вычислительной мощности — с трендами, охватывающими семь порядков величины. Элегантные уравнения впервые позволили систематически прогнозировать распределение ресурсов и утвердили парадигму 'чем больше — тем лучше'. Эти математические основы непосредственно привели к успеху GPT-3 и преобразовали разработку ИИ: от экспериментального метода проб и ошибок к научно обоснованному, предсказуемому масштабированию. Конкретное правило распределения ресурсов по Каплану — активно масштабировать размер модели при слабом увеличении объёма данных — было скорректировано в 2022 году статьёй Chinchilla от DeepMind: оптимальное по вычислениям обучение требует значительно большего объёма обучающих данных, чем рекомендовалось изначально.
GPT-3: модель с 175 миллиардами параметров
Прорыв к обучению с несколькими примерами (Few-Shot Learning) и проявляющимся способностям ИИ. 28 мая 2020 года команда OpenAI под руководством Тома Брауна представила значимую статью 'Language Models are Few-Shot Learners' — GPT-3 со 175 миллиардами параметров, более чем в 100 раз превышающей GPT-2. Масштабирование выявило проявляющиеся способности: модель могла решать новые задачи лишь с несколькими примерами, без дообучения. От переводов до словесных головоломок и трёхзначной арифметики GPT-3 демонстрировал впечатляющую универсальность. Оценщики-люди едва могли отличить написанные GPT-3 новостные статьи от настоящих. Только за счёт обучения в контексте (In-Context Learning) GPT-3 приближался к передовому уровню на отдельных подзадачах SuperGLUE — однако на общем тесте набирал около 71,8 балла, заметно уступая дообученным лидирующим моделям (около 89). 31 исследователь OpenAI (Том Браун и 30 соавторов) доказали: масштабное увеличение числа параметров способно порождать качественно новые возможности. GPT-3 заложил фундамент для ChatGPT и современной эпохи больших языковых моделей.
DDPM: Диффузионные модели утверждены
Математическая основа современной генерации изображений через процессы шумоподавления. В июне 2020 года Джонатан Хо, Аджай Джейн и Питер Эббил опубликовали влиятельную статью «Denoising Diffusion Probabilistic Models» — класс латентных переменных моделей, вдохновлённый неравновесной термодинамикой. Их инновация заключалась во взвешенной вариационной границе и связи между диффузионными моделями и Denoising Score Matching с динамикой Ланжевена. Результаты были впечатляющими: показатель FID 3,17 на CIFAR-10 и показатель Inception 9,46. DDPM установили прогрессивный подход с потерями при декомпрессии, который можно интерпретировать как обобщение авторегрессивного декодирования. Эта работа заложила математический фундамент для Stable Diffusion и всей современной генерации изображений из текста.
Vision Transformer: 'An Image is Worth 16x16 Words'
Архитектура Transformer в компьютерном зрении. 22 октября 2020 года команда Алексея Досовицкого в Google Research опубликовала статью 'An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale'. Vision Transformer (ViT) показал, что свёрточные нейронные сети (CNN) не обязательны — чистые Transformer могут напрямую применяться к последовательностям фрагментов изображения. Ключевой вывод ('at Scale'): лишь после масштабного предварительного обучения на огромных наборах данных (ImageNet-21k или JFT-300M) ViT достигает сравнимых или лучших результатов, чем современные CNN; на наборах среднего размера без такого предобучения ViT показывает более слабые результаты. Система разбивает изображения на фрагменты — как правило, 16x16 пикселей, хотя в зависимости от варианта размер может меняться — обрабатывает их как последовательности токенов и применяет стандартную архитектуру Transformer. Универсальность архитектуры Transformer стала очевидна: та же технология, которая изменила обработку естественного языка, работает и в компьютерном зрении. ViT вдохновил новое поколение моделей компьютерного зрения на основе механизма внимания и продемонстрировал мощь унифицированных архитектур.
Успех AlphaFold
Решение 50-летней биологической загадки с помощью искусственного интеллекта. В ноябре 2020 года AlphaFold 2 от DeepMind доминировал на соревновании CASP14 с точностью, которую учёные назвали «поразительной» и «трансформационной». Система достигла показателя GDT 92,4 из 100 баллов в предсказании структуры белков — точность, сравнимая с экспериментальными методами вроде рентгеновской кристаллографии. При этом AlphaFold значительно превзошёл 145 других команд, решив проблему, над которой биология билась с 1970-х годов. Архитектура нейронной сети на основе механизма внимания может за несколько дней предсказать, как сворачиваются белки — процесс, фундаментальный для понимания жизни. За это достижение Демис Хассабис и Джон Джампер получили Нобелевскую премию по химии 2024 года.
CLIP: мост между изображением и языком
В тот же день, когда OpenAI представила DALL-E — 5 января 2021 года, — вышла, пожалуй, более значимая модель: CLIP. Она не генерировала изображения, а обучалась понимать картинку и текст в едином пространстве. Команда Алека Радфорда обучила два энкодера контрастным методом на примерно 400 миллионах пар изображение — текст из интернета, пока связанные изображения и подписи к ним не оказались в одной точке общего векторного пространства. Эффект оказался поразительным: CLIP мог классифицировать изображения в режиме zero-shot — категории просто описывались словами, без какого-либо обучения на конкретной задаче. Так модель достигла 76,2 % на ImageNet — наравне с ResNet-50, обученной на 1,28 миллиона размеченных примеров, — хотя CLIP не видел ни одного из них. Для общей картины это принципиально: CLIP стал фундаментом волны генерации изображений по тексту — DALL-E 2 опирается на эмбеддинги CLIP, а Stable Diffusion напрямую использует его текстовый энкодер. Если быть точным: контрастивные модели 'изображение — текст' уже существовали (ConVIRT вышел месяцами раньше) — вклад CLIP заключался в масштабе, ширине zero-shot и открытых весах, которые запустили целую экосистему.
DALL-E создаёт изображения из текста
Важный прорыв в генерации изображений по тексту и значительный прогресс в области творческих возможностей ИИ. 5 января 2021 года OpenAI представила DALL-E — систему, которая создаёт связные и нередко поразительно креативные изображения на основе текстовых описаний. Модели преобразования текста в изображение существовали и прежде (например, alignDRAW в 2015 году или подходы на основе GAN — StackGAN и AttnGAN), однако DALL-E подняла связность и универсальность на принципиально новый уровень. Основанная на версии GPT-3 с 12 миллиардами параметров, DALL-E доказала, что границу между пониманием языка и восприятием изображений можно преодолеть. Система обучалась на 250 миллионах пар 'изображение — текст' из интернета и в результате приобрела примечательные способности: очеловечивать животных, правдоподобно объединять несвязанные концепции и даже воспроизводить текст в изображениях. Марк Ридль из Технологического института Джорджии отметил, что результаты 'поразительно более связны', чем у всех прежних систем преобразования текста в изображение. DALL-E успешно расширила языковое понимание GPT на область зрительного восприятия и открыла принципиально новое измерение творческих возможностей ИИ.
Основание Anthropic
Бывшие руководители OpenAI решили воплотить собственное видение безопасного ИИ. В январе 2021 года Дарио и Даниэла Амодеи вместе с пятью другими бывшими исследователями OpenAI — в том числе Томом Брауном, Джаредом Капланом и Крисом Ола — основали Anthropic; всего семь сооснователей. Брат и сестра ранее занимали ключевые должности в OpenAI — Дарио в должности вице-президента по исследованиям. Их новая компания должна была сосредоточиться на безопасности ИИ и разработке надёжных, интерпретируемых систем. С помощью Constitutional AI компания Anthropic разработала инновационный подход к обучению ИИ-систем на основе принципов, а не только человеческой обратной связи. Claude, их ИИ-ассистент, стал одним из ведущих конкурентов ChatGPT.
GitHub Copilot: ИИ-парный программист
Демократизация ИИ-разработки программного обеспечения для миллионов разработчиков. 29 июня 2021 года GitHub анонсировал Technical Preview Copilot — первого ИИ-парного программиста на базе OpenAI Codex. Основанный на варианте GPT-3, обученном на миллиардах строк публичного кода из репозиториев GitHub, Copilot мог генерировать автодополнения кода и целые функции из комментариев. Базовая модель Codex достигла 28,8% успеха с первой попытки в бенчмарке HumanEval — значительно лучше GPT-3 с 0%. Особенно впечатляюще: со 100 попытками семплирования успешность выросла до 70,2%. Copilot особенно хорошо работал с Python, JavaScript, TypeScript, Ruby и Go. Ограниченный Technical Preview вызвал огромный интерес и утвердил ИИ-программирование как практичный инструмент. Copilot фундаментально изменил опыт разработчиков и проложил путь новому поколению ИИ-инструментов для программирования.
OpenAI Codex: ИИ программирует для людей
10 августа 2021 года OpenAI опубликовала Codex через API и существенно изменила разработку программного обеспечения — масштабная система ИИ для генерации кода. Основанный на GPT-3, но обученный на 159 гигабайтах кода Python из 54 миллионов репозиториев GitHub, Codex преобразовывал естественный язык в работоспособный код. 'Создай функцию для простых чисел' превращалось в реальный код Python за считанные секунды. Ещё раньше, 29 июня 2021 года, из партнёрства с GitHub появился Technical Preview Copilot — ИИ-ассистент программирования, уже работавший на ранней версии Codex. Codex владел более чем дюжиной языков программирования: Python, JavaScript, Go, Ruby, Swift и другими. В бенчмарке HumanEval точно настроенная модель Codex-S решала около 37 % задач с первой попытки (pass@1) — базовая модель справлялась примерно с 29 %; впечатляет, но не является меркой для произвольных запросов. GitHub Copilot оказался значительным инструментом повышения производительности для разработчиков. Codex доказал: ИИ способен поддерживать творческую, когнитивно сложную работу. От генерации кода к его пониманию — Codex открыл дверь в разработку программного обеспечения с поддержкой ИИ.
InstructGPT: мост к ChatGPT
Между методом и мировым успехом пролегал решающий промежуточный шаг — и он назывался InstructGPT. В начале 2022 года OpenAI показала в статье 'Training language models to follow instructions with human feedback', как заставить GPT-3 действительно делать то, чего хотят пользователи: с помощью обучения с подкреплением на основе обратной связи от людей (RLHF). Поразительный результат: InstructGPT с 1,3 миллиарда параметров люди предпочитали ответам GPT-3 в сто раз большего размера (175 миллиардов параметров). Разницу определяла не грубая величина, а согласованность с намерением. InstructGPT стал прямым техническим мостом между идеей RLHF (2017) и ChatGPT, который в конце 2022 года сделал этот метод широко известным. Если подходить честно: InstructGPT не изобрёл RLHF — это сделала статья 2017 года, — но именно InstructGPT впервые показал в большом масштабе, насколько согласованность делает языковую модель полезнее.
Chinchilla: масштабирование осмыслено заново
В 2022 году DeepMind задала неудобный вопрос: а не строим ли мы свои ИИ-модели неправильно? В статье 'Training Compute-Optimal Large Language Models' команда под руководством Джордана Хоффмана показала, что крупнейшие языковые модели того времени — GPT-3, Gopher — имели множество параметров, но слишком мало обучающих данных. Предложенная ими корректировка, сегодня известная как законы масштабирования Chinchilla: при заданном вычислительном бюджете размер модели и объём данных должны расти примерно в одном темпе. В качестве доказательства они обучили Chinchilla с 70 миллиардами параметров на 1,4 триллиона токенов — и превзошли вчетверо большую модель Gopher (280 миллиардов). Это изменило подход к обучению практически каждой последующей ведущей модели. Если подходить честно: Chinchilla не изобрела законы масштабирования, а скорректировала более ранние законы Каплана (2020); более поздние модели вроде Llama намеренно выходили за пределы оптимального по вычислениям соотношения ради повышения эффективности при использовании.
PaLM: гигантская языковая модель Google на 540 миллиардов параметров
В 2022 году Google продемонстрировал, насколько высоко можно масштабировать языковые модели: PaLM (Pathways Language Model) насчитывал 540 миллиардов параметров и обучался с помощью системы Pathways на тысячах TPU-чипов. Впечатляло не столько огромное число параметров, сколько то, на что PaLM оказался способен. С так называемыми подсказками цепочки мыслей (Chain-of-Thought Prompts), при которых модель записывает своё рассуждение шаг за шагом, PaLM решал многоэтапные текстовые задачи и даже объяснял суть анекдотов. PaLM стал символом идеи эмерджентных способностей — умений, которые внезапно появляются лишь при достижении определённого размера модели. Это был апогей эпохи масштабирования Google и предтеча PaLM 2 и Gemini. Важная оговорка: 540 миллиардов параметров были чрезвычайно дорогостоящими, и PaLM так и не был опубликован как открытая модель. Тезис об эмерджентных способностях также вызывает споры — некоторые подобные скачки отчасти являются артефактом выбранной метрики измерения.
Stable Diffusion: генерация изображений с открытым кодом
Демократизация ИИ-генерации изображений благодаря первой мощной модели с открытым исходным кодом. 22 августа 2022 года Stability AI выпустила Stable Diffusion и существенно изменила доступ к продвинутой технологии преобразования текста в изображение. Как первая модель своего класса с открытым кодом, Stable Diffusion могла генерировать фотореалистичные изображения 512x512 пикселей на потребительских GPU — важный прогресс для скорости и доступности. Основанная на латентных диффузионных моделях (LDM), система итеративно «удаляет шум» в латентных пространствах вместо прямой манипуляции пикселями. С 860 миллионами параметров в U-Net и 123 миллионами в текстовом энкодере она оставалась относительно лёгкой несмотря на высокую производительность. Исходный код на GitHub позволил взрывообразно растущему сообществу разрабатывать бесчисленные варианты и инструменты. Stable Diffusion разрушила монополию проприетарных систем и сделала высококачественную ИИ-генерацию изображений доступной для каждого.
OpenAI выпускает Whisper
Когда распознавание речи наконец стало надёжным — и доступным для всех. 21 сентября 2022 года OpenAI выпустила Whisper — систему распознавания речи, обученную работать устойчиво с различными языками, акцентами и фоновыми шумами. В отличие от ранних систем, обучавшихся на чистых аудиоданных, Whisper использовал 680 000 часов многоязычных данных из интернета. Результат — система, способная транскрибировать речь на 99 языках и конкурирующая с коммерческими решениями. OpenAI сделала Whisper общедоступным в виде открытого исходного кода — подарок разработчикам по всему миру, открывший возможности для бесчисленных приложений.
ChatGPT обозначил поворотный момент в использовании ИИ
Момент, когда ИИ стал доступен всем и началась новая эра. 30 ноября 2022 года OpenAI выпустила ChatGPT как бесплатный Research Preview — без масштабного маркетинга и с минимальными ожиданиями. То, что последовало, превзошло все прогнозы: через 5 дней ChatGPT достиг 1 миллиона пользователей, а через два месяца — 100 миллионов. Это был тогда самый быстрый рост аудитории, который когда-либо демонстрировало потребительское приложение (в июле 2023 года этот рекорд побил Threads от Meta). Основанный на GPT-3.5, ChatGPT впервые открыл широкой аудитории прямой доступ к мощной системе ИИ без технических барьеров. Кевин Рус из New York Times назвал его 'лучшим ИИ-чат-ботом, когда-либо выпущенным для широкой публики'. ChatGPT демократизировал искусственный интеллект и превратил исследовательскую область в инструмент повседневного использования. Этот выпуск ознаменовал начало нынешней волны генеративного ИИ.
Constitutional AI — безопасность ИИ через принципы
В декабре 2022 года компания Anthropic представила Constitutional AI (CAI) — новый метод разработки безвредных, полезных и честных систем ИИ. 'Конституция' из этических принципов позволяет ИИ самостоятельно критиковать и улучшать собственные ответы на вредоносный контент — без необходимости использовать человеческую разметку именно для оценки вреда. (Явную привязку этих принципов к Всеобщей декларации прав человека ООН и другим основополагающим документам Anthropic описала лишь в мае 2023 года в 'Claude's Constitution'; в исходной статье применялся прагматично составленный набор принципов.) Новаторский метод RLAIF (Reinforcement Learning from AI Feedback — обучение с подкреплением на основе обратной связи от ИИ) заменяет человеческую обратную связь лишь применительно к безвредности — посредством самокритики ИИ; полезность же по-прежнему обучается на основе человеческих предпочтений (RLHF). Таким образом, CAI устанавливает подход 'безопасность прежде всего' как альтернативу чисто производительностному подходу ChatGPT и прокладывает путь к ответственной разработке ИИ.
Система NIST AI: США определяют стандарты надёжного ИИ
26 января 2023 года Национальный институт стандартов и технологий США (NIST) опубликовал первую комплексную систему управления рисками ИИ (AI RMF 1.0) — ответ Америки на глобальное регулирование искусственного интеллекта. После 18 месяцев разработки при участии более 240 организаций из промышленности, науки и гражданского общества NIST впервые определил федеральные стандарты надёжного ИИ. Система устанавливает четыре основные функции: Govern, Map, Measure, Manage — и семь характеристик надёжного ИИ: безопасный, устойчивый, объяснимый, уважающий конфиденциальность, справедливый, прозрачный и достоверный. Как добровольный стандарт, он призван минимизировать риски ИИ для отдельных людей, организаций и общества. Публикация последовала за Сводом прав ИИ Байдена (2022) и была дополнена его указом об ИИ (октябрь 2023 года). AI RMF был создан по поручению Национального закона об инициативе в области ИИ 2020 года — NIST продолжил свою устоявшуюся роль федерального органа по стандартизации. Система стала основой для отраслевых стандартов и международной координации — противовесом государственному контролю над ИИ в Китае и регуляторному подходу Европы.
LLaMA: открытая базовая языковая модель
Демократизация больших языковых моделей через открытые исследовательские модели. 24 февраля 2023 года Meta AI опубликовала LLaMA (Large Language Model Meta AI) — набор базовых моделей от 7B до 65B параметров, обученных исключительно на общедоступных данных. Основополагающая статья 'LLaMA: Open and Efficient Foundation Language Models' доказала, что результаты уровня state-of-the-art достижимы без проприетарных наборов данных. LLaMA открыла исследователям без доступа к крупной инфраструктуре возможность изучать передовые языковые модели. Код вывода был опубликован под лицензией GPLv3, тогда как доступ к весам модели предоставлялся в отдельных случаях исключительно для академических исследований. Благодаря обучению на триллионах токенов и различным размерам моделей LLaMA отвечала разным аппаратным требованиям. Эта работа катализировала волну открытых исследований в области больших языковых моделей и вдохновила многочисленные производные модели в сообществе открытого программного обеспечения.
Claude и Constitutional AI
Представление ИИ со встроенной системой ценностей и этическими принципами. В марте 2023 года Anthropic представила Claude — ИИ-ассистента на базе Constitutional AI, который установил новый подход к безопасности ИИ. В отличие от традиционных систем, Claude обучается двухфазным методом: сначала модель критикует и улучшает свои собственные ответы на основе конституции из этических принципов, затем улучшается через обратную связь, генерируемую ИИ — без человеческих оценок для предотвращения вреда. Результат — система, которая действует одновременно полезно и безвредно. Anthropic одновременно выпустила Claude и Claude Instant, причём последний представляет более быструю и экономичную версию. Метод Constitutional AI оказался улучшением по Парето по сравнению с человеческой обратной связью и открыл новые пути для масштабируемого контроля ИИ.
GPT-4: мультимодальная модель ИИ
Прорыв к человеческому уровню в профессиональных и академических тестах. 14 марта 2023 года OpenAI представил GPT-4 — большую мультимодальную модель (Large Multimodal Model), обрабатывающую текстовые и графические данные и достигающую человеческого уровня в различных дисциплинах. Улучшения были существенными: если GPT-3.5 сдавал экзамен на право занятия адвокатской практикой (Bar Exam) в нижних 10 %, то GPT-4 достиг верхних 10 %. На тесте SAT по математике результат вырос с 70-го до 89-го перцентиля. После шести месяцев итеративного выравнивания с учётом результатов программы тестирования на устойчивость к атакам (adversarial testing) и обратной связи от ChatGPT весь стек глубокого обучения был выстроен заново. Мультимодальные возможности позволяют обрабатывать документы, диаграммы и скриншоты с тем же качеством, что и чисто текстовые запросы. GPT-4 установил новые стандарты безопасности и производительности ИИ.
Midjourney V5: фотореалистичное ИИ-искусство
Фотореалистичная генерация изображений с помощью ИИ достигает нового уровня качества и существенно меняет творческую индустрию. 15 марта 2023 года Midjourney выпустила версию 5, сделав качественный скачок, который пользователи описывали как 'пугающий' и 'слишком совершенный'. Альфа-версия впервые позволила создавать фотореалистичные изображения, практически неотличимые от настоящих фотографий. Особенно примечательно: хроническая проблема с некорректным изображением рук была существенно улучшена — в большинстве случаев V5 правильно отображала пять пальцев. Графический дизайнер Джули Виланд сравнила этот опыт с 'тем, как наконец надеть очки после того, как слишком долго мирился с плохим зрением' — вдруг всё видишь в качестве 4K [источник: Ars Technica, март 2023]. Улучшенная чувствительность к запросам (промптам) обеспечила более точный творческий контроль, а автоматическое масштабирование позволяло увеличивать базовые изображения размером 1024x1024 пикселей без дополнительных затрат на GPU. V5 вызвала интенсивные дискуссии о будущем человеческого творчества.
Указ Байдена об ИИ — первое комплексное регулирование США
30 октября 2023 года президент Байден подписал Executive Order 14110 о 'безопасной, защищённой и заслуживающей доверия разработке и использовании искусственного интеллекта' — первый комплексный нормативный акт США в области ИИ и, со своими 110 страницами, самый длинный президентский указ в истории. Этот масштабный документ обязывал разработчиков мощных систем ИИ раскрывать результаты тестирований безопасности и устанавливал строгие стандарты Red Team через NIST. Указ предусматривал защиту от мошенничества с применением ИИ посредством аутентификации контента и водяных знаков, а также затрагивал риски для критической инфраструктуры и биологические угрозы. На момент подписания этот указ задавал глобальные стандарты ответственной разработки ИИ и позиционировал США как лидера в области управления ИИ (AI Governance). Однако его действие оказалось недолгим: 20 января 2025 года президент Трамп отменил EO 14110 своим указом EO 14148 — таким образом, этот документ отражает регуляторное положение дел по состоянию на 2023 год.
Письмо о паузе и Блетчли: безопасность ИИ становится глобальной темой
В 2023 году, в первое потрясение после ChatGPT, мир искал правила для внезапно обретшей мощь технологии. В марте тысячи подписантов — среди них Ёшуа Бенджио и Илон Маск — потребовали в открытом письме Future of Life Institute шестимесячной паузы в обучении ИИ-систем мощнее GPT-4. Паузы не последовало, однако письмо поставило тему на мировую повестку дня. В ноябре прошёл первый глобальный саммит по безопасности ИИ в британском Блетчли-парке — намеренно в том самом месте, где Тьюринг некогда взламывал шифры. 28 государств и ЕС, в том числе США и Китай, подписали Блетчлийскую декларацию о рисках высокоразвитого ИИ. Это был первый случай, когда соперничающие державы заговорили вместе о безопасности ИИ, — старт серии саммитов (Сеул 2024, Париж 2025). Если подходить честно: пауза так и не наступила, а Блетчлийская декларация носила необязательный характер — оба события поставили темы на повестку дня, но не создали механизмов принуждения.
Mistral и Mixtral: открытые европейские модели
Пока в 2023 году заголовки новостей в основном определяли американские компании, из Парижа выступил конкурент: Mistral AI, основанный весной 2023 года Артуром Меншем (ранее работавшим в Google DeepMind), а также Гийомом Лямплем и Тимоте Лакруа (ранее работавшими в Meta). Уже в сентябре небольшая модель Mistral 7B удивила профессиональное сообщество — она распространялась свободно под лицензией Apache 2.0 и превосходила значительно более крупную Llama 2 13B. В декабре последовала Mixtral 8x7B: открытая модель типа Mixture-of-Experts, достигшая на многих задачах уровня GPT-3.5, однако активировавшая лишь малую часть своих параметров на каждый запрос (около 13 из 47 миллиардов). Mistral стала европейским символом открытых моделей и привлекла миллиарды инвестиций. Важная оговорка: открытые веса — это не то же самое, что открытый исходный код; данные и код обучения остаются закрытыми. И Mixtral достигла уровня GPT-3.5, но не тогдашней флагманской модели GPT-4; при этом сама архитектура Mixture-of-Experts значительно старше.
Google Gemini: мультимодальное семейство ИИ
Ответ Google на ChatGPT и прорыв к нативной мультимодальности. 6 декабря 2023 года Google представил Gemini 1.0 — семейство ИИ-моделей, разработанных с нуля для мультимодальности. Совместная работа DeepMind и Google Brain воплотилась в три размера моделей: Gemini Ultra для высококомплексных задач, Gemini Pro как сбалансированное решение и Gemini Nano для использования непосредственно на устройствах. В отличие от систем, расширенных мультимодальностью постфактум, Gemini изначально создавался с нативным пониманием текста, аудио, кода и видео. В шести из восьми тестов Gemini Pro превзошёл стандарт GPT-3.5, включая тесты MMLU. В день анонса обычный Bard получил новые возможности на базе Gemini Pro; более мощный Bard Advanced с Gemini Ultra Google объявил на начало 2024 года. Gemini стал стратегическим ответом Google на доминирование OpenAI и закрепил мультимодальный ИИ как новый стандарт для больших языковых моделей.
Воплощённый ИИ: модели обретают тело
Долгие годы крупные ИИ-модели существовали только на экранах — они писали тексты, создавали изображения, вели беседы. В 2024 году это начало меняться: год стал годом воплощённого ИИ (embodied AI). Идея состоит в том, чтобы помещать те же базовые модели, которые понимают язык и изображения, в настоящие тела — прежде всего в человекоподобных роботов. Компания Figure объединилась с OpenAI и показала робота, который говорит, видит и манипулирует предметами. NVIDIA представила Project GR00T — базовую модель специально для гуманоидов, а молодые компании, такие как Physical Intelligence, оценивались в миллиарды долларов. Многие уже говорили о своём 'ChatGPT-моменте' для робототехники. Если подходить честно: большинство из этого пока оставалось демонстрациями и анонсами, а не надёжно работающими в повседневной жизни машинами. Физический мир несравнимо сложнее для робота, чем экран, — ловкость, безопасность и надёжность по-прежнему остаются нерешёнными проблемами.
Waymo: беспилотное такси становится реальностью
Более десяти лет автономное вождение служило показательным примером обещаний ИИ, которые постоянно откладывались. В 2024 году оно стало реальностью: Waymo, дочерняя компания Google по разработке роботизированных автомобилей, впервые в широком масштабе открыла беспилотные такси для широкой публики — в Сан-Франциско, Лос-Анджелесе и Финиксе. Летом 2024 года компания сообщила о более чем 100 000 платных поездок в неделю, полностью без водителя-оператора за рулём. После многих лет обещаний это стало первым убедительным доказательством того, что автономное вождение способно функционировать как реальный, повседневный сервис. Важная оговорка: Waymo работает только в строго ограниченных, тщательно картированных городских районах — не везде и не в любую погоду. Поломки и заблокированные автомобили по-прежнему случаются, а эксплуатация обходится дорого. Полностью автономное вождение повсеместно остаётся нерешённой задачей; уход конкурента Cruise после серьёзного происшествия в 2023 году показал, насколько технология ещё хрупка.
Sora: видео из текста, созданное ИИ
Прогресс в создании фотореалистичных видео с помощью ИИ и его влияние на киноиндустрию. 15 февраля 2024 года OpenAI представила Sora — модель преобразования текста в видео, которая по кратким описаниям генерирует детализированные HD-видео продолжительностью до одной минуты. Названная в честь японского слова, означающего 'небо', Sora символизирует 'безграничный творческий потенциал'. Как диффузный трансформер (Diffusion Transformer), Sora адаптирует технологию DALL-E 3 для временной согласованности и нередко — хотя и не всегда надёжно — симулирует физически правдоподобное движение. Демонстрационные видео превзошли все существующие системы преобразования текста в видео и установили новые стандарты для ИИ-творчества. Режиссёр Тайлер Перри остановил расширение студии стоимостью 800 миллионов долларов из-за опасений по поводу влияния Sora на индустрию. OpenAI придерживалась осторожного подхода, проводя тестирование в Red Team на предмет дезинформации и предвзятости перед более широким выпуском.
Семейство Claude 3 с мультимодальными возможностями
Представление семейства ИИ с поддержкой зрения и тремя специализированными моделями. 4 марта 2024 года Anthropic представила семейство Claude 3: Opus, Sonnet и Haiku — три модели с различными сильными сторонами для разных сценариев использования. Ключевой функцией стала продвинутая обработка изображений, способная анализировать фотографии, графики, диаграммы и технические чертежи. Claude 3 Opus установил новые рекорды в когнитивных задачах, превзойдя конкурентов в бенчмарках MMLU и GPQA. Sonnet предложил идеальный баланс между интеллектом и скоростью для бизнеса, а Haiku отличался почти мгновенным временем отклика. С контекстным окном в 200 000 токенов (расширяемым до 1 миллиона) и доступностью в 159 странах Claude 3 установил новые стандарты для мультимодальных ИИ-систем.
Devin: первый автономный ИИ-инженер по программному обеспечению
Рождение полностью автономной разработки программного обеспечения с помощью искусственного интеллекта. 12 марта 2024 года компания Cognition Labs представила Devin — позиционируемый фирмой как первый в мире полностью автономный ИИ-инженер по программному обеспечению. Система способна самостоятельно планировать, клонировать репозитории, писать код, отлаживать, тестировать и даже развёртывать его. На сложном тесте SWE-Bench Devin достиг 13,86% успешных решений реальных задач из GitHub — огромный скачок по сравнению с предыдущим лучшим результатом в 1,96%. Стартап получил оценку около 350 миллионов долларов на раннем раунде финансирования; вскоре после запуска появились сообщения об оценке около 2 миллиардов долларов. Несмотря на впечатляющие результаты, тесты выявили и ограничения: только 3 из 20 задач были решены успешно, нередко с непредсказуемыми сбоями.
AlphaFold 3: ИИ предсказывает взаимодействие молекул
Спустя четыре года после прорыва AlphaFold 2 в мае 2024 года Google DeepMind сделала следующий шаг — совместно с дочерней компанией Isomorphic Labs. AlphaFold 2 предсказывал, как отдельный белок сворачивается в трёхмерную структуру. AlphaFold 3 идёт принципиально дальше: он моделирует, как белки взаимодействуют с другими молекулами — с ДНК, РНК, ионами и небольшими молекулами лекарственных веществ. Именно это взаимодействие имеет ключевое значение для фармацевтических исследований: так можно на компьютере оценить, как действующее вещество связывается со своим белком-мишенью. Если подходить честно: предсказания впечатляют, но не безупречны — их точность варьируется в зависимости от типа молекулы, и в лаборатории их по-прежнему необходимо проверять. Кроме того, AlphaFold 3 изначально вышел без открытого исходного кода, только в виде ограниченного веб-сервиса, что вызвало в научном сообществе критику относительно воспроизводимости результатов.
AlphaProof: ИИ завоёвывает серебро на математической олимпиаде
Математика долгое время считалась королевской дисциплиной, недоступной для ИИ: слишком творческой, слишком требовательной к подлинному пониманию. В июле 2024 года Google DeepMind поставила восклицательный знак: система AlphaProof совместно с AlphaGeometry 2 решила четыре из шести задач Международной математической олимпиады. Это соответствовало уровню серебряной медали — всего на одно очко ниже золота. Принципиально важна методика работы: AlphaProof формулирует доказательства на формальном языке Lean, в котором каждый шаг поддаётся машинной проверке — значит, ИИ не может 'схитрить'. Обучение проходило с применением метода обучения с подкреплением. Впервые ИИ достиг медального уровня на этом престижном соревновании. Если подходить честно: это были не настоящие условия соревнования. Там, где участники располагают четырьмя с половиной часами, ИИ иногда работал несколько дней, и специалистам пришлось вручную переводить задачи на формальный язык. Две комбинаторные задачи так и остались нерешёнными.
Закон ЕС об ИИ: первый комплексный закон об искусственном интеллекте
Первое в мире комплексное регулирование искусственного интеллекта вступает в силу. 1 августа 2024 года Закон ЕС об ИИ приобрёл юридическую силу — основанный на оценке рисков свод правил, включающий 180 преамбульных пунктов и 113 статей для всего жизненного цикла систем ИИ. Закон классифицирует системы ИИ по четырём уровням риска: недопустимые приложения запрещены, системы высокого риска в образовании, занятости и правосудии подлежат детальным требованиям по соблюдению нормативов, системы ограниченного риска обязаны выполнять требования о прозрачности, а подавляющее большинство систем с минимальным риском остаются в значительной мере нерегулируемыми. Параллельно действуют отдельные правила для базовых моделей общего назначения (GPAI), таких как GPT, лежащих в основе ChatGPT. Экстерриториальное действие закона распространяется также на поставщиков за пределами ЕС, обслуживающих европейских пользователей. За нарушения грозят штрафы до 35 миллионов евро или 7% мирового годового оборота. Подобно GDPR 2018 года, Закон об ИИ может установить глобальные стандарты и определить, как ИИ влияет на нашу жизнь. Поэтапное введение в действие начинается в 2025 году и завершается к 2027 году.
OpenAI O1 — прогресс в рассуждении
12 сентября 2024 года OpenAI выпустила сначала o1-preview (и o1-mini), существенно расширив возможности ИИ в области рассуждения (reasoning) благодаря цепочке размышлений (chain-of-thought), обученной методом обучения с подкреплением (reinforcement learning). O1 — первая широко доступная языковая модель, которая систематически 'думает' перед ответом: используя закрытую цепочку размышлений, она анализирует проблемы шаг за шагом. Этот новый подход открывает дополнительное измерение масштабирования — масштабирование на этапе вывода (test-time scaling), при котором более длительное 'обдумывание' даёт лучшие результаты. Полная модель o1 в бенчмарк-тестах достигает уровня, сопоставимого с кандидатами PhD в физике, химии и биологии, и решает 83 % задач American Invitational Mathematics Examination (GPT-4o: 13 %). Технология показывает, что ИИ способен значительно улучшить навыки решения задач за счёт структурированного рассуждения.
Нобелевские премии по ИИ 2024 года
В октябре 2024 года произошло нечто беспрецедентное: сразу две Нобелевские премии по естественным наукам отметили основы современного ИИ. 8 октября Нобелевская премия по физике была присуждена Джону Хопфилду и Джеффри Хинтону — за фундаментальные открытия, открывшие путь к машинному обучению с искусственными нейронными сетями. То, что именно физика отметила нейронные сети, вызвало дискуссии — однако вдохновлённые физикой сети Хопфилда (1982) и методы обучения Хинтона действительно заложили фундамент. Днём позже Нобелевскую премию по химии разделили Дэвид Бейкер (за компьютерное проектирование белков), а также Демис Хассабис и Джон Джампер из DeepMind — за AlphaFold, решивший 50-летнюю проблему предсказания структуры белков. Впервые фундаментальные исследования в области ИИ были признаны на высшем уровне мировой науки. Примечательно: Хинтон, только что удостоенный премии, воспользовался трибуной, чтобы одновременно предупредить об опасностях технологии, у истоков которой стоял.
OpenAI o3: прорыв на тесте ARC-AGI
Незадолго до конца 2024 года, 20 декабря, OpenAI анонсировала o3 — преемника o1 и доказательство того, что масштабирование рассуждений во время работы модели (Test-Time Scaling) можно продолжать. Особое внимание привлёк один результат: o3 набрала 87,5 % на ARC-AGI — тесте, намеренно построенном так, чтобы его нельзя было пройти простым запоминанием; предыдущие модели оставались здесь почти на нуле. Тем самым o3 впервые приблизилась к человеческому уровню на этом тесте и одновременно продемонстрировала высокие результаты в математике и программировании. Вместе с o1 и DeepSeek-R1, o3 ознаменовала эру моделей-рассуждателей (Reasoning Models) (o3-mini последовала в конце января 2025 года, полная o3 — в апреле). Важная оговорка: 87,5 % были получены в режиме максимальной производительности с огромными — и очень дорогостоящими — вычислительными затратами на каждую задачу; организаторы ARC Prize особо подчеркнули, что o3 не является AGI и показывает значительно худшие результаты на более сложном тесте ARC-AGI-2.
Агентный ИИ выходит в массы
В 2024–2025 годах изменилось само предназначение ИИ: от ответов — к действиям. Первой ласточкой стала Anthropic: в октябре 2024 года она первой из крупных ИИ-лабораторий представила модель, которая умеет самостоятельно управлять компьютером — видеть экран, двигать мышью, кликать, печатать. В январе 2025 года OpenAI выпустила Operator — агента, который самостоятельно выходит в интернет и выполняет задачи, а вскоре после этого — Deep Research, способный проводить многоэтапные исследования и составлять подкреплённые ссылками отчёты. Чат-бот, выдающий текст, превратился в систему, действующую от имени пользователя, — качественный сдвиг, намеченный ещё Devin в 2024 году. Если подходить честно: первые версии работали медленно, часто давали сбои и справлялись лишь с узко очерченными задачами; системы, выпущенные в 2025 году под маркой агентов, продвигались активнее, чем позволяла реальная надёжность.
DeepSeek-R1: ИИ-шок из Китая
В конце января 2025 года ИИ-модель впервые ощутимо пошатнула мировые фондовые рынки. 20 января 2025 года китайская лаборатория DeepSeek опубликовала R1 — модель рассуждения (reasoning model) на уровне o1 от OpenAI, но с открытыми весами (лицензия MIT) и стоимостью обучения, оказавшейся значительно ниже ожидаемой. Это стало возможным благодаря масштабному обучению с подкреплением на базовой модели DeepSeek-V3. Когда неделю спустя приложение DeepSeek возглавило американские чарты, настроение переломилось: 27 января акции Nvidia упали примерно на 17 % — около 600 миллиардов долларов за один день, крупнейшие однодневные потери в истории американской биржи, — поскольку инвесторы усомнились в том, что передовому ИИ непременно нужны бесконечно дорогие чипы. R1 одновременно поколебал несколько убеждений: что только американские гиперскейлеры могут конкурировать на вершине, что модели рассуждения остаются закрытыми и что наращивание вычислительных мощностей — единственный путь вперёд. Если подходить честно: расхожая цифра в несколько миллионов долларов относится только к финальному обучающему прогону базовой модели V3 (не к R1 как таковой, не к исследованиям и оборудованию в целом) — и R1 превосходила o1 далеко не по всем показателям.
Stargate: ИИ как инфраструктура национального масштаба
21 января 2025 года искусственный интеллект оказался в Белом доме на сцене — как инфраструктурный проект национального масштаба. OpenAI, SoftBank, Oracle и инвестиционная компания MGX объявили о проекте Stargate: до 500 миллиардов долларов за четыре года на центры обработки данных для ИИ в США, причём вложение 100 миллиардов долларов должно было начаться немедленно. Тем самым стало очевидно, что следующая фаза ИИ — это меньше вопрос алгоритмов и больше вопрос энергетики и строительства: вычислительные мощности в масштабе электростанций и промышленных парков. Для области, красной нитью которой со времён AlexNet является вычислительная мощь (см. CUDA 2007), это была логичная, но грандиозная следующая ступень — и сигнал того, что ИИ стал национальным геополитическим приоритетом. Важная оговорка: объявление — это не готовый центр обработки данных. Полнота финансирования в размере 500 миллиардов долларов вызывала сомнения с самого начала — в том числе у участников и наблюдателей, публично высказывавших скептицизм.
Парижский саммит по ИИ (AI Action Summit)
10 и 11 февраля 2025 года в парижском Гран-Пале встретились главы государств и правительств, технологические компании и исследователи на саммите AI Action Summit — третьем крупном международном форуме по ИИ после Блетчли (2023) и Сеула (2024), который совместно возглавляли президент Франции Макрон и премьер-министр Индии Моди. Примечательным стал сдвиг в тоне: если первый саммит уделял главное внимание безопасности ИИ, то в Париже речь шла прежде всего о возможностях, инвестициях и конкурентоспособности — вице-президент США открыто выступал против избыточного регулирования. В итоге 58 государств, а также ЕС и Африканский союз подписали декларацию об инклюзивном и устойчивом ИИ — однако США и Великобритания от подписи отказались. Тем самым саммит обнажил трансатлантический раскол в сфере управления ИИ. Важная оговорка: декларация носила необязательный характер, а критики назвали саммит упущенной возможностью для решения вопросов безопасности.
Frontier-модели 2025 года
В 2025 году способность к рассуждению, которую запустили o1 и R1, превратилась в стандарт ведущих моделей — в темпе, за которым было трудно успевать. В марте Google представила Gemini 2.5 Pro, в мае Anthropic выпустила Claude 4 (Opus 4 и Sonnet 4), в августе OpenAI — GPT-5; между ними вышли Claude 3.7 (первая гибридная модель, по выбору отвечающая быстро или рассуждающая дольше), GPT-4.5, Llama 4 от Meta и Grok от xAI. Новое поколение объединило две линии: пошаговое рассуждение reasoning-моделей и способность действовать самостоятельно (агентность). Особое место заняло автономное программирование на длинных дистанциях. Если подходить честно: лаборатории каждую неделю перебивали друг друга в рекордах по бенчмаркам, и каждая заявляла о своём первенстве — реальный прогресс есть, но часто употребляемое слово AGI оставалось скорее маркетингом, чем реальностью.