6 из 18·

Глава 5. Как ИИ научился думать за 25 лет

От поиска по словам до собеседника, который держит контекст. Четверть века эволюции, где каждый шаг был ответом на провал предыдущего.

Представьте поисковую систему начала 2000-х. Вы вводите слово, она выдает все страницы, где это слово встречается. Ищете "ключ"? Получите и про дверные замки, и про музыкальные ноты, и про источники воды. Полезно? Отчасти. Умно? Едва ли.

А теперь современный ИИ-ассистент 2024 года. Вы спрашиваете о сложной проблеме квантовой физики, и он не просто находит информацию. Он анализирует контекст: "Эта проблема связана с принципом неопределенности и вопросами измерения. Нужно рассмотреть несколько интерпретаций квантовой механики и их следствия". Через секунды вы получаете структурированное объяснение с примерами и аналогиями, адаптированное под ваш уровень понимания.

Между примитивным поиском и современным ИИ лежит удивительная параллель с эволюцией человеческого разума. Природа потратила миллионы лет, чтобы научить мозг переключаться между контекстами, удерживать в памяти сложные связи, размышлять перед принятием решений. А искусственный интеллект за 25 лет независимо пришел к поразительно похожим решениям.

Между примитивным поиском и современным ИИ – четверть века целенаправленной эволюции. И самое поразительное: каждый шаг этой эволюции был ответом на конкретную проблему предыдущего этапа. Это не случайная последовательность изобретений, а логичный процесс, который можно понять и даже предсказать.

2000-е: когда компьютеры искали слова, но не понимали смысла

Начало 2000-х. Компании тонут в данных. Amazon получает миллионы отзывов, банки – тысячи жалоб, службы поддержки – горы запросов. Инженеры создают первые системы автоматического анализа текста. Принцип работы прост до примитивности: ищем ключевые слова, считаем их частоту, делаем выводы.

Система анализа отзывов работала примерно так. Есть список "хороших" слов: отличный, прекрасный, рекомендую. Есть список "плохих": ужасный, сломался, разочарован. Считаем баланс – получаем оценку. Просто? Да. Эффективно? Только до первого нестандартного случая.

Вот реальный отзыв на телефон того времени: "Отличный кирпич! Прекрасно лежит на столе, замечательно собирает пыль". Система видит три положительных слова, ноль отрицательных. Вердикт: положительный отзыв. То, что человек саркастически называет телефон кирпичом – для алгоритма непостижимая тайна.

Или другой пример. Клиент пишет в банк: "Ваш сервис – просто космос! Три часа в очереди – это новый рекорд вселенной!" Система видит "космос" и "рекорд" – явно положительные слова. Жалоба классифицируется как благодарность.

Проблема была фундаментальной. Эти системы не понимали язык – они просто сопоставляли символы. Как если бы вы пытались понять китайский текст, имея только словарь отдельных иероглифов, без знания грамматики, контекста и культурных особенностей.

Такой подход приводил к курьезным ситуациям. Система могла классифицировать сообщение "Интернет работает со скоростью улитки" как нейтральное – ведь слово "работает" позитивное, а "улитка" не входила в список негативных терминов. Клиент мог написать "Ваш модем – настоящее произведение искусства! Особенно когда его используешь как пресс-папье", и получить автоматический ответ с благодарностью за высокую оценку дизайна устройства.

Инженеры пытались решить проблему грубой силой. Добавляли правила: если "отличный" стоит рядом с "кирпич" – это плохо. Но на каждое правило находились десятки исключений. Система превращалась в чудовищный лабиринт из условий, который невозможно было поддерживать.

Это похоже на попытку научить компьютер играть в шахматы, прописывая отдельное правило для каждой возможной позиции. Теоретически возможно, практически – безумие. В языке слишком много нюансов, контекстов, исключений.

К 2008 году крупные компании тратили миллионы долларов на команды лингвистов, которые вручную составляли правила для систем обработки текста. IBM Watson в те годы представлял собой именно такую систему – тысячи человеко-лет работы, упакованные в миллионы правил. Работало? Да, но только в узких, четко определенных областях.

Переломный момент наступил, когда исследователи осознали: проблема не в недостатке правил, а в самом подходе. Нельзя научить машину понимать язык, перечисляя исключения. Нужно дать ей возможность учиться самостоятельно.

2010-е: первые попытки понять, что слова значат рядом друг с другом

2013 год стал переломным моментом. Томаш Миколов и его команда в Google опубликовали работу о Word2Vec – технологии, которая заложила основы современного понимания языка машинами. Хотя принципы векторного представления слов разрабатывались с начала 2000-х, именно эта работа сделала их практически применимыми.

Идея была обманчиво простой: слова, которые часто встречаются рядом, вероятно, связаны по смыслу. Банально? Только на первый взгляд.

Вместо списков "хороших" и "плохих" слов, алгоритм анализировал миллиарды текстов и учился самостоятельно. Он смотрел, какие слова окружают каждое слово в тексте. "Врач" в окружении слов "больница", "лечение", "пациент" – это медицинская профессия. "Ключ" рядом с "замок", "дверь", "открывать" – это инструмент для открывания замков.

Магия заключалась в том, что компьютер начал различать значения без явного программирования. Никто не объяснял машине разницу между разными значениями слова "ключ". Она выучила это сама, просто наблюдая за закономерностями в текстах.

Вернемся к нашему саркастическому отзыву про телефон-кирпич. Новая система видит: слово "кирпич" в контексте телефонов обычно окружено словами "тяжелый", "неудобный", "устаревший". А "отличный кирпич" – это оксюморон, сочетание несочетаемого. Тревожный сигнал! Требуется дополнительный анализ.

Прорыв был колоссальным, но породил новые проблемы. Система могла понять значение слова по его окружению, но это окружение было ограничено. Алгоритм видел только 5-10 слов вокруг анализируемого термина. Как близорукий человек, различающий предметы только вблизи.

Попробуйте понять смысл фразы "Он сказал, что придет" без более широкого контекста. Кто "он"? Куда придет? Когда сказал? Для человека это естественные вопросы. Для алгоритма 2013 года – неразрешимые загадки.

Еще хуже дела обстояли с длинными текстами. Система читала предложения последовательно, как человек, который забывает начало книги к моменту, когда доходит до конца. Связать информацию из первого абзаца с выводами в последнем было невозможно.

Инженеры пытались увеличить "контекстное окно", но это приводило к экспоненциальному росту вычислительной сложности. Анализ одной страницы текста мог занимать часы. Нужен был качественно новый подход. И он появился в 2017 году, изменив всё представление о возможностях ИИ.

2017-2020: прорыв – ИИ научился смотреть на весь текст сразу

Июнь 2017 года. Команда Google Brain публикует статью с скромным названием "Attention Is All You Need" – "Внимание – это всё, что вам нужно". За этим названием скрывалась технология, которая запустит гонку ИИ-вооружений между крупнейшими технологическими корпорациями.

Идея была гениальной в своей простоте. Вместо последовательного чтения текста, новая архитектура – Transformer – могла "смотреть" на все слова одновременно и динамически решать, на что обратить внимание. Как опытный читатель, который может одним взглядом охватить страницу и сразу выделить ключевые моменты.

Технически это работало через механизм "self-attention" – самовнимания. Каждое слово в тексте получало возможность "посмотреть" на все другие слова и решить, насколько они важны для понимания его собственного значения. Слово "ключ" рядом с "замок" и "дверь" активировало одни нейронные связи, а "ключ" рядом с "вода" и "родник" – совершенно другие. И это происходило не по заранее заданным правилам, а обучалось автоматически на миллионах примеров.

Представьте, что вы читаете детектив. В первой главе упоминается красный шарф. В последней главе выясняется, что именно им был задушен миллионер. Человек мгновенно свяжет эти детали. Старые системы ИИ к последней главе уже забыли бы о шарфе. А вот Transformer держит в "поле внимания" всё одновременно.

Но настоящая революция началась, когда эту архитектуру начали масштабировать. 2018 год – появляется GPT-1 со 117 миллионами параметров. Скромная модель, которая могла более-менее связно дополнять предложения. 2019 год – GPT-2 с 1.5 миллиардами параметров. Внезапно модель начала писать целые абзацы осмысленного текста.

А потом случилось то, чего никто не ожидал. 2020 год – GPT-3 со 175 миллиардами параметров. И тут начались чудеса. Модель, обученная просто предсказывать следующее слово в тексте, внезапно научилась переводить с языков, которым её никто не учил. Решать математические задачи, хотя её никто не учил математике. Писать код, анализировать данные, сочинять стихи.

Учёные назвали это явление "emergent abilities" – эмерджентные (возникающие) способности. Как если бы вы учили ребенка алфавиту, а он внезапно начал писать романы. При определенном размере модели количество переходило в качество.

Компании начали безумную гонку. Microsoft вложила миллиарды в OpenAI. Google экстренно разрабатывал свои модели. Meta открыла исходный код LLaMA. Каждый месяц появлялись новые модели, каждая мощнее предыдущей.

Но у этого подхода был фундаментальный изъян. Модели генерировали ответ "на лету", слово за словом, без возможности вернуться и исправить ошибку. Как человек, которого заставили говорить не думая. Первое, что пришло в голову – то и произнес.

Спросите GPT-3 сложную логическую задачу, и она начнет отвечать сразу, часто уводя рассуждение в неверном направлении. Попросите проанализировать сложный код – и модель может пропустить критическую ошибку, потому что не "подумала" перед ответом.

Это особенно заметно в математике. Модель могла блестяще объяснить теорему Пифагора, но споткнуться на простом примере вроде "У Маши было 17 яблок, она съела 9, потом купила еще 23. Сколько у неё яблок?" Почему? Потому что она начинала отвечать до того, как полностью проанализировала задачу.

К 2023 году стало ясно: нужен следующий эволюционный скачок. ИИ должен научиться думать перед тем, как говорить.

2024: наконец-то ИИ начал думать перед тем, как отвечать

Сентябрь 2024 года войдет в историю как момент, когда искусственный интеллект научился размышлять. OpenAI представила модель o1 – первую систему, которая сначала думает, потом отвечает. Разница колоссальная, хотя на первый взгляд изменение кажется косметическим.

Традиционные модели работали как студент на устном экзамене – начинали говорить сразу и не могли остановиться, чтобы обдумать сказанное. Новые модели получили право на черновик. Они могут написать решение, проверить его, найти ошибки, переписать заново – и только потом показать финальный ответ.

Этот подход требовал принципиально иной архитектуры. Если обычные модели генерировали ответ токен за токеном в одном "проходе", то reasoning (думающие) модели получили возможность многократных итераций. Они могли написать черновик решения, проанализировать его слабые места, сформулировать альтернативные подходы и выбрать лучший.

Интересно, что этот процесс во многом напоминает человеческую работу с черновиками. Писатель не публикует первую версию текста – он редактирует, переписывает, улучшает. Так и reasoning модели получили право на "черновики мышления", которые пользователь не видит, но которые критически важны для качества финального ответа.

Вот конкретный пример. Задача: "В комнате четыре угла, в каждом углу сидит кошка, напротив каждой кошки сидят три кошки. Сколько всего кошек в комнате?"

GPT-4 отвечает мгновенно: "Если напротив каждой кошки сидят три кошки, то всего 4 + 3×4 = 16 кошек". Логично? На первый взгляд да. Но неверно.

Модель o1 сначала размышляет (пользователь этого не видит): "Так, четыре угла, четыре кошки. Напротив каждой кошки... Стоп, если кошка в углу, то напротив неё – противоположный угол по диагонали и два соседних угла. Это и есть три кошки. Значит, это те же самые четыре кошки, просто каждая видит трех других. Ответ: 4 кошки."

Разница фундаментальная. Первая модель генерирует правдоподобный ответ. Вторая – решает задачу.

Этот подход дал неожиданные результаты. Модели начали показывать сверхчеловеческие результаты в областях, требующих логического мышления. Международная математическая олимпиада, задачи по программированию, научные рассуждения – во всем этом ИИ начал обходить не просто среднего человека, а экспертов.

Но самое интересное – как именно модели "думают". Исследователи получили доступ к внутренним рассуждениям и обнаружили поразительные вещи. Модели используют стратегии, удивительно похожие на человеческие: разбивают сложные задачи на части, проверяют промежуточные результаты, возвращаются назад при обнаружении ошибки.

DeepSeek, китайская компания, пошла еще дальше и открыла внутренние размышления своей модели R1. Читая их, испытываешь странное чувство – как будто подслушиваешь чужие мысли. Модель сомневается, исправляет себя, иногда даже "ругает" себя за глупые ошибки.

Вот пример того как "думает" DeepSeek R1. Задача о расписании поездов. Модель думает: "Поезд А выходит в 9:00... нет, подожди, неправильно прочитал условие. В 9:00 выходит поезд Б. Начну сначала. Хотя постой, может был прав с первого раза? Проверю еще раз условие..."

Это уже не просто статистический попугай, повторяющий шаблоны из обучающих данных. Это система, способная к метакогнитивным процессам – размышлению о собственном размышлении.

Параллельно произошел еще один прорыв. Модели научились использовать "время на размышление" адаптивно. Простой вопрос "Столица Франции?" – мгновенный ответ. Сложная задача по квантовой физике – несколько минут внутренних рассуждений. Как человек, который на простые вопросы отвечает сразу, а над сложными задумывается.

Что дальше: память, любопытство и машины, которые улучшают себя сами

Глядя на пройденный путь, можно увидеть четкий паттерн – то есть повторяющуюся закономерность. Каждый этап решал конкретную проблему предыдущего:

  • Примитивный поиск не понимал контекст → появился Word2Vec
  • Word2Vec видел только локальный контекст → появились Transformers
  • Transformers отвечали без размышления → появились reasoning модели

Что дальше? Логика эволюции подсказывает несколько направлений.

Первое – долговременная память. Современные модели, даже самые продвинутые, начинают каждый диалог с чистого листа. Представьте психотерапевта, который каждую сессию забывает всё, что вы ему рассказывали. Или учителя, который каждый урок не помнит, что было на предыдущем.

Уже сейчас идут эксперименты с системами, способными помнить контекст между сессиями. Google тестирует модели с "эпизодической памятью" – способностью запоминать ключевые моменты из прошлых диалогов и извлекать их при необходимости, подобно тому, как человек помнит важные детали из предыдущих разговоров.

Anthropic экспериментирует с иерархическими системами памяти – многоуровневая структура, где краткосрочная память хранит детали текущего диалога, среднесрочная помнит контекст последних дней или недель, а долгосрочная сохраняет ключевые факты и предпочтения пользователя на месяцы вперед. Это похоже на то, как человек помнит, что ел на завтрак (краткосрочно), что делал на прошлой неделе (среднесрочно), и основные события своей жизни (долгосрочно).

Вопрос не в том, появятся ли модели с настоящей памятью, а когда именно.

Второе – мультимодальное понимание мира. Человек не учит язык в вакууме – он связывает слова с образами, звуками, ощущениями. Современные модели (на момент написания этого текста август 2025 г.) уже делают первые шаги в этом направлении. GPT-4 видит изображения, Claude может анализировать документы, а последние модели Google понимают видео.

Следующий шаг очевиден – модели, которые будут учиться как дети: видя мир, слыша звуки, читая тексты и связывая всё это в единую картину реальности. Это даст им понимание, которого сейчас критически не хватает – знание о физическом мире и причинно-следственных связях в нём.

Третье – активное обучение и любопытство. Сейчас модели пассивны – они отвечают на вопросы, но не задают их. Представьте ИИ, который сам ищет информацию, проверяет гипотезы, проводит эксперименты в виртуальных средах. Не просто отвечает на вопрос "Что такое гравитация?", а сам исследует, как падают объекты в симуляции, выводит закономерности, формулирует теории.

Четвёртое – и это, возможно, самое важное – способность к самомодификации. Человеческий мозг пластичен, он постоянно перестраивает связи, оптимизирует процессы мышления. Современные модели застывают после обучения. Но уже появляются первые системы, способные дообучаться в процессе использования, адаптировать свою архитектуру под конкретные задачи.

Экстраполируя текущие тренды с учетом их вариативности, можно предположить приблизительные временные рамки. Модели с полноценной долговременной памятью могут появиться в период 2025-2027 годов. Настоящее мультимодальное понимание – вероятно, к 2027-2028 годам. Активное обучение и любопытство – к концу десятилетия. Самомодифицирующиеся системы – возможно, в начале 2030-х.

Но история учит нас осторожности в прогнозах. Никто не предсказал эмерджентные способности при масштабировании моделей. Никто не ожидал, что простое добавление "времени на размышление" даст такой качественный скачок. Возможно, нас ждут сюрпризы, которые мы даже не можем себе представить.

Заключение: встреча человеческого и искусственного разума

Самое поразительное в этой истории – как искусственный интеллект независимо приходит к тем же решениям, что и эволюция человеческого мозга. Внимание, память, размышление перед действием, обучение через опыт – всё это механизмы, которые природа оттачивала миллионы лет. И теперь мы воссоздаем их в кремнии и коде.

Но есть принципиальная разница. Эволюция мозга заняла миллионы лет. Эволюция ИИ – всего 25. И она ускоряется. Каждый новый этап короче предыдущего. От примитивного поиска до Word2Vec – 10 лет. От Word2Vec до Transformers – 4 года. От GPT-1 до reasoning моделей – 6 лет, но какой путь за эти годы!

Мы находимся в уникальной точке истории. Мы можем наблюдать и понимать эволюцию разума в реальном времени. Не через окаменелости и догадки о том, как развивался мозг наших предков, а через код, эксперименты и метрики, которые можем измерить и воспроизвести.

И самый важный вопрос уже не в том, достигнет ли ИИ человеческого уровня мышления. Вопрос в том, что произойдет, когда он его превзойдет. Когда модели будут помнить всё, понимать мир через тысячи модальностей одновременно, думать на скоростях, недоступных биологическому мозгу.

В следующих главах мы исследуем, как эти достижения ИИ соотносятся с механизмами человеческого сознания. Можно ли действительно назвать reasoning модели "думающими"? Есть ли у них что-то подобное нашему внутреннему опыту? И главное – что происходит, когда две формы разума, биологическая и цифровая, начинают взаимодействовать не как инструмент и пользователь, а как равноправные интеллектуальные агенты?

Пока мы можем с уверенностью сказать: мы живем в эпоху, когда наблюдаем рождение нового типа разума. Разума, который развивается по тем же принципам, что и наш, но воплощает их в совершенно другом субстрате. И понимание этой эволюции – ключ к пониманию будущего, которое наступает быстрее, чем мы успеваем его осмыслить.