Anthropic Academy Courses My Profile Sign Out

Исследуйте!

Интерактивная демонстрация «Напишите другу Маркову»

Стопроцентно интерпретируемый генератор следующего токена

Отправьте сообщение

Давным-давно мы с друзьями играли в игру, где берёшь телефон и пишешь сообщение другу, используя только рекомендуемые следующие слова. Может, вы тоже в это играли.

Вот симулятор, «обученный» на небольшом контенте. Поиграйте!

Пример переписки: «hey does anyone know how to fix the build» — «i think».

Мы говорили об этом как о «Me-боте». Мы знали, что он рекомендует слова на основе наших индивидуальных паттернов использования, и мы видели наши голоса в наших персонализированных рекомендациях.

В то время мы с радостью списывали это на техническую магию. Не думаю, что мы понимали, насколько простым может быть алгоритм.

Читайте дальше, если хотите построить его вместе со мной.

«Обучение» вашей модели

Давайте обучимся на горсти сообщений. Всё, что нужно, — подсчитать связи между словами. Сделаем это по одному сообщению за раз.

Таблица переходов

Добавляйте сообщения выше, чтобы начать строить матрицу.

Эта готовая карта связей между словами называется таблицей частот. Нормализуйте каждую строку — и получите распределение вероятностей того, что идёт дальше.

Акт выбора следующего слова на основе того, что есть сейчас, называется сэмплированием. Мы используем тот же термин для этого процесса в современных языковых моделях вроде Claude.

Сделайте сэмплирование

Используя ту же матрицу на основе 5 текстов, поиграйте в нашу игру более осознанно. Мы покажем вам вероятности.

Подсвеченная строка — ваш текущий контекст. Выберите слово из доступных вариантов, чтобы продолжить.

Технология столетней давности

«Это настоящая технология?» Отличный вопрос, читатель.

Марков опубликовал эту идею в 1906 году. Век спустя, в 2010-м, n-граммные модели вроде этой питали предсказание следующего слова на вашем телефоне (SwiftKey, затем Apple QuickType). Около 2015-го нейросети — сначала RNN, затем трансформеры в 2017-м — начали заменять табличный подход обучаемой функцией, а остальное... ну, это то, над чем мы работаем сейчас.