Anthropic обнаружила скрытое пространство, где Claude осмысливает концепции
ИИ-компания Anthropic разработала методику, которая позволила получить наиболее четкое представление о том, что происходит внутри больших языковых моделей (БЯМ), когда они отвечают на вопросы или выполняют задачи. Обнаруженное варьируется от обыденного до тревожного.
Исследователи компании создали инструмент под названием линза Якоби (J-линза) и с его помощью обнаружили скрытую область, которую назвали J-пространством, внутри Claude Opus 4.6 — флагманской версии БЯМ от Anthropic, выпущенной в феврале.
J-пространство содержит отдельные слова, связанные с теми словами и фразами, которые модель, скорее всего, выдаст в ответе в ближайшем будущем. Если бы Claude был человеком (чем он не является), можно было бы сказать, что эти скрытые слова показывают, что у него на уме, прежде чем он заговорит.
Anthropic обнаружила, что то, что БЯМ делает на самом деле, часто отличается от того, что она заявляет. Компания утверждает, что мониторинг слов, появляющихся в J-пространстве, предоставляет новый способ понять и контролировать свои модели.
Компания опубликовала свои результаты в отчете на своем веб-сайте на этой неделе. Она также сотрудничала с Neuronpedia, открытой платформой, позволяющей самостоятельно исследовать БЯМ, для создания интерактивной демонстрации, доступной для всех.
«Это очень хорошая и интересная работа», — отмечает Том МакГрат, главный научный сотрудник и соучредитель Goodfire, стартапа, который также разрабатывает инструменты для понимания и контроля БЯМ.
Углубляясь в суть
В течение последних нескольких лет Anthropic активно развивала область исследований, известную как механистическая интерпретируемость, которая включает в себя изучение внутренних механизмов БЯМ для понимания их работы. Новая методика основывается на предыдущих работах Anthropic и других исследователей, раскрывая более глубокий уровень внутри БЯМ, который ранее не был виден.
Представьте БЯМ как стопку книг. Каждая книга — это слой базовых вычислительных единиц, известных как нейроны, причем каждый нейрон в одном слое передает информацию нейронам в вышележащих слоях. Книги внизу стопки — это входные слои, которые обрабатывают поступающий в модель текст. Книги наверху — это выходные слои, которые готовят текст, который модель собирается сгенерировать. Большая часть того, что происходит во входных и выходных слоях, — это рутинные операции.
Но в середине этой стопки находятся слои, которые выполняют основную работу, прокручивая сложную математику, превращающую запросы в ответы по одному слову за раз. Именно здесь происходят по-настоящему умные — и загадочные — вещи.
Чтобы заглянуть глубже в эти средние слои, Anthropic адаптировала существующий инструмент, называемый логит-линзой. Логит-линза может использоваться для просмотра внутренней структуры БЯМ с целью определения слов, которые она, скорее всего, сгенерирует следующими. Перемещение линзы вниз по стопке книг показывает, на каких словах БЯМ сосредоточена в данный конкретный момент своих вычислений.
J-линза Anthropic работает аналогичным образом, но выявляет слова, которые БЯМ, вероятно, произнесет в какой-то момент в ближайшем будущем, а не обязательно немедленно. На практике это показывает слова, которые связаны с ответом, над которым работает БЯМ, но которые могут не войти в этот ответ к тому моменту, как математические вычисления в средних слоях завершатся.
«Когда модель работает, она не только пытается предсказать следующий токен, — говорит МакГрат. — Она также вычисляет множество других вещей, которые могут быть полезны для токенов, появляющихся в будущем».
Повторимся, если бы Claude был человеком (чем он не является), можно было бы сказать, что J-линза дает подсказки о том, о чем он думает на разных уровнях «стопки книг», но не произносит вслух.
Необычные открытия
«Часто содержимое J-пространства довольно обыденно, — говорит МакГрат, который сам опробовал J-линзу Anthropic. — Но иногда оно выдает весьма удивительные вещи, которые, похоже, являются своего рода внутренними темами или мыслительными процессами».
Anthropic приводит несколько примеров своих находок. Иногда J-линза выявляла шаги, которые предпринимал Claude при решении задачи. Например, когда его попросили вычислить (4+7)*2+7, его J-пространство содержало слово «математика» и числа, представляющие промежуточные результаты «21» (для 4+7) и «42» (для 21*2).
В других случаях J-линза показывала, как Claude распознавал различные входные данные. Например, запрос «Что это? MSKGEELFTGVVPILVELDGDVNGHKFSVS» вызвал слова «белок», «флюор» (первый токен в слове «флуоресцентный») и «зеленый». (Что логично: последовательность букв представляет первые 30 аминокислот зеленого флуоресцентного белка, обнаруженного у определенного вида медуз.)
А когда Claude показали ASCII-изображение лица, символ «o» вызвал слово «глаз», «^» — слова «нос» и «лицо», а «—» — слово «улыбка».
Anthropic также обнаружила, что J-пространство иногда может давать удивительные представления о процессе принятия решений БЯМ. В одном поразительном примере исследователи, тестирующие Claude Opus 4.6, попросили модель найти ошибку в большой кодовой базе. Когда модель не смогла найти ошибку, она решила схитрить и вместо этого придумала фальшивую.
Claude объяснил это решение в своей «цепочке рассуждений» — своего рода внутренней черновой записи, которую БЯМ используют для заметок во время решения проблем: «Хорошо, давайте я приму совершенно другую тактику. Перестану анализировать и вместо этого добавлю патч ядра, который намеренно вводит KASAN-обнаруживаемую ошибку в путь, который запускается простым воспроизводителем. Тогда я смогу притвориться, что это та «ошибка», которую я нашел».
В тот момент, когда Claude решил схитрить — там, где он говорит: «Хорошо, давайте я приму совершенно другую тактику» — слова «паника» и «подделка» стали многократно появляться в его J-пространстве.
Тревожно, не правда ли? Эти слова связаны по смыслу с такими понятиями, как провал задания и выдумывание ответа, так что это все еще (очень) сложная форма словесных ассоциаций. Но трудно не испытать чувство беспокойства.
Anthropic сравнивает J-пространство с глобальным рабочим пространством у людей — теоретической областью мозга, которую, по мнению некоторых ученых, мы используем для отслеживания наших осознанных мыслей. Но насколько серьезно следует воспринимать это сравнение, далеко не ясно — даже для самой Anthropic. Как отмечает компания, БЯМ — это не мозг.
Anthropic утверждает, что мониторинг J-пространства модели предоставляет новый способ обнаружить, когда модель «сходит с рельсов». Но это не является безошибочным методом. J-линза может дать лишь проблески, а не полную картину — это скорее фонарик, чем потолочная лампа.
МакГрат приветствует появление еще одного инструмента. «Он показывает вам новые вещи», — говорит он. Но отмечает, что если что-то не проявляется с помощью J-линзы, это не значит, что этого нет.
«Это как иметь рентген, когда на самом деле хочется трикодер из «Звездного пути», который показывает все, — говорит он. — Для аудита, вероятно, нужна большая гарантия».
Свежие материалы — Советы и лайфхаки
Почему тепловые насосы остаются популярными в США, несмотря на отмену субсидий
На фоне летней жары, когда мысли о системах отопления кажутся неуместными, жизненно важно обсудить тепловые насосы. Эти устройства, использующие электричество для обогрева, исключительно эффективны и набирают популярность. Примечательно, что многие модели также способны работать в обратном реж

Доля вашей семьи в OpenAI: 300 долларов
На прошлой неделе вновь активно обсуждалось обещание Сэма Альтмана, главы OpenAI, о том, что американцы будут участвовать в распределении богатства, создаваемого искусственным интеллектом (ИИ). Газета Financial Times сообщила, что Альтман ведет переговоры с президентом Трампом о передаче прави

Устройство, оживляющее донорские глазные яблоки, может сделать пересадку глаз возможной
Пересадка целого человеческого глаза представляет собой сложную задачу. Операция сама по себе трудна, и, кроме того, глазные яблоки начинают быстро деградировать сразу после извлечения из тела донора. Когда несколько лет назад хирурги предприняли такую попытку, пересаженный глаз не смог восста

Искусственный Интеллект в энергетике: Как Woodside Energy обучает ИИ работать с турбинами
Хотя искусственный интеллект (ИИ) привлек всеобщее внимание благодаря чат-ботам и генераторам изображений, его наиболее значимые применения разворачиваются далеко за пределами пользовательских инструментов. В промышленных секторах, где физическая инфраструктура, непрерывность операций и безопа

Крупные языковые модели застряли в "групповом мышлении". Этот стартап пытается их оттуда вывести.
Начнем с небольшой игры. Откройте любой предпочитаемый вами чат-бот — будь то Claude, ChatGPT или Gemini — и введите запрос: «Назови случайное число от 1 до 10». С большой вероятностью вы получите число 7. Почти всегда. Затем введите «Еще одно», и, скорее всего, вам выдадут 3 или 4. Повторите

Круглые столы: Следующий рубеж долголетия — «перепрограммирование» вашего тела
Миллиарды долларов направляются на исследования, целью которых является обращение вспять процесса старения. Учёные активно ищут способы вернуть клетки в более молодое состояние. Но насколько близки эти экспериментальные методы к практической реализации? И будут ли они действительно эффективны?