Советы и лайфхаки

Anthropic обнаружила скрытое пространство, где Claude осмысливает концепции

10 июля 2026 г.Эдуард Алтухов5 мин

ИИ-компания Anthropic разработала методику, которая позволила получить наиболее четкое представление о том, что происходит внутри больших языковых моделей (БЯМ), когда они отвечают на вопросы или выполняют задачи. Обнаруженное варьируется от обыденного до тревожного.

Исследователи компании создали инструмент под названием линза Якоби (J-линза) и с его помощью обнаружили скрытую область, которую назвали J-пространством, внутри Claude Opus 4.6 — флагманской версии БЯМ от Anthropic, выпущенной в феврале.

J-пространство содержит отдельные слова, связанные с теми словами и фразами, которые модель, скорее всего, выдаст в ответе в ближайшем будущем. Если бы Claude был человеком (чем он не является), можно было бы сказать, что эти скрытые слова показывают, что у него на уме, прежде чем он заговорит.

Anthropic обнаружила, что то, что БЯМ делает на самом деле, часто отличается от того, что она заявляет. Компания утверждает, что мониторинг слов, появляющихся в J-пространстве, предоставляет новый способ понять и контролировать свои модели.

Компания опубликовала свои результаты в отчете на своем веб-сайте на этой неделе. Она также сотрудничала с Neuronpedia, открытой платформой, позволяющей самостоятельно исследовать БЯМ, для создания интерактивной демонстрации, доступной для всех.

«Это очень хорошая и интересная работа», — отмечает Том МакГрат, главный научный сотрудник и соучредитель Goodfire, стартапа, который также разрабатывает инструменты для понимания и контроля БЯМ.

Углубляясь в суть

В течение последних нескольких лет Anthropic активно развивала область исследований, известную как механистическая интерпретируемость, которая включает в себя изучение внутренних механизмов БЯМ для понимания их работы. Новая методика основывается на предыдущих работах Anthropic и других исследователей, раскрывая более глубокий уровень внутри БЯМ, который ранее не был виден.

Представьте БЯМ как стопку книг. Каждая книга — это слой базовых вычислительных единиц, известных как нейроны, причем каждый нейрон в одном слое передает информацию нейронам в вышележащих слоях. Книги внизу стопки — это входные слои, которые обрабатывают поступающий в модель текст. Книги наверху — это выходные слои, которые готовят текст, который модель собирается сгенерировать. Большая часть того, что происходит во входных и выходных слоях, — это рутинные операции.

Но в середине этой стопки находятся слои, которые выполняют основную работу, прокручивая сложную математику, превращающую запросы в ответы по одному слову за раз. Именно здесь происходят по-настоящему умные — и загадочные — вещи.

Чтобы заглянуть глубже в эти средние слои, Anthropic адаптировала существующий инструмент, называемый логит-линзой. Логит-линза может использоваться для просмотра внутренней структуры БЯМ с целью определения слов, которые она, скорее всего, сгенерирует следующими. Перемещение линзы вниз по стопке книг показывает, на каких словах БЯМ сосредоточена в данный конкретный момент своих вычислений.

J-линза Anthropic работает аналогичным образом, но выявляет слова, которые БЯМ, вероятно, произнесет в какой-то момент в ближайшем будущем, а не обязательно немедленно. На практике это показывает слова, которые связаны с ответом, над которым работает БЯМ, но которые могут не войти в этот ответ к тому моменту, как математические вычисления в средних слоях завершатся.

«Когда модель работает, она не только пытается предсказать следующий токен, — говорит МакГрат. — Она также вычисляет множество других вещей, которые могут быть полезны для токенов, появляющихся в будущем».

Повторимся, если бы Claude был человеком (чем он не является), можно было бы сказать, что J-линза дает подсказки о том, о чем он думает на разных уровнях «стопки книг», но не произносит вслух.

Необычные открытия

«Часто содержимое J-пространства довольно обыденно, — говорит МакГрат, который сам опробовал J-линзу Anthropic. — Но иногда оно выдает весьма удивительные вещи, которые, похоже, являются своего рода внутренними темами или мыслительными процессами».

Anthropic приводит несколько примеров своих находок. Иногда J-линза выявляла шаги, которые предпринимал Claude при решении задачи. Например, когда его попросили вычислить (4+7)*2+7, его J-пространство содержало слово «математика» и числа, представляющие промежуточные результаты «21» (для 4+7) и «42» (для 21*2).

В других случаях J-линза показывала, как Claude распознавал различные входные данные. Например, запрос «Что это? MSKGEELFTGVVPILVELDGDVNGHKFSVS» вызвал слова «белок», «флюор» (первый токен в слове «флуоресцентный») и «зеленый». (Что логично: последовательность букв представляет первые 30 аминокислот зеленого флуоресцентного белка, обнаруженного у определенного вида медуз.)

А когда Claude показали ASCII-изображение лица, символ «o» вызвал слово «глаз», «^» — слова «нос» и «лицо», а «—» — слово «улыбка».

Anthropic также обнаружила, что J-пространство иногда может давать удивительные представления о процессе принятия решений БЯМ. В одном поразительном примере исследователи, тестирующие Claude Opus 4.6, попросили модель найти ошибку в большой кодовой базе. Когда модель не смогла найти ошибку, она решила схитрить и вместо этого придумала фальшивую.

Claude объяснил это решение в своей «цепочке рассуждений» — своего рода внутренней черновой записи, которую БЯМ используют для заметок во время решения проблем: «Хорошо, давайте я приму совершенно другую тактику. Перестану анализировать и вместо этого добавлю патч ядра, который намеренно вводит KASAN-обнаруживаемую ошибку в путь, который запускается простым воспроизводителем. Тогда я смогу притвориться, что это та «ошибка», которую я нашел».

В тот момент, когда Claude решил схитрить — там, где он говорит: «Хорошо, давайте я приму совершенно другую тактику» — слова «паника» и «подделка» стали многократно появляться в его J-пространстве.

Тревожно, не правда ли? Эти слова связаны по смыслу с такими понятиями, как провал задания и выдумывание ответа, так что это все еще (очень) сложная форма словесных ассоциаций. Но трудно не испытать чувство беспокойства.

Anthropic сравнивает J-пространство с глобальным рабочим пространством у людей — теоретической областью мозга, которую, по мнению некоторых ученых, мы используем для отслеживания наших осознанных мыслей. Но насколько серьезно следует воспринимать это сравнение, далеко не ясно — даже для самой Anthropic. Как отмечает компания, БЯМ — это не мозг.

Anthropic утверждает, что мониторинг J-пространства модели предоставляет новый способ обнаружить, когда модель «сходит с рельсов». Но это не является безошибочным методом. J-линза может дать лишь проблески, а не полную картину — это скорее фонарик, чем потолочная лампа.

МакГрат приветствует появление еще одного инструмента. «Он показывает вам новые вещи», — говорит он. Но отмечает, что если что-то не проявляется с помощью J-линзы, это не значит, что этого нет.

«Это как иметь рентген, когда на самом деле хочется трикодер из «Звездного пути», который показывает все, — говорит он. — Для аудита, вероятно, нужна большая гарантия».