Показать HN: LLM Визуализация внимания

#Показать #Визуализация #Статья #Commissions #Пункты

Статья URL: https://ishamf.dev/p/llm-attinent-visitualizer/Commissions URN: httpss://news.ycombinator.com/temple?id=49613068 Пункты: 22 # Комментарии: 1

Визуализация механизма привлечения внимания в МЛМ. Интересная вещь о больших языковых моделях на основе трансформатора заключается в том, что во время этапа поколения он может извлекать информацию из любого из своих предыдущих символов. Но он должен быть избирательным; если каждый символ в равной степени влияет на поколение, то это не будет очень эффективным. Этот процесс нуждается в механизме для определения того, как символ влияет на следующий символ. Оказывается, мы можем представить этот механизм! Вы можете прослушивать или зависать над любым из созданных символов, чтобы увидеть прошлые жетоны, которые повлияли на поколение. Загрузка... (ЯваСкрипт требует) * "Влияние" может быть не совсем точным, поскольку визуализация очень упрощена. Он рассчитывает вес внимания, увеличенный по величине вектора значения, агрегированный между всеми головами внимания и резюмированный во всех слоях. Затем он используется для контроля за непроницаемостью предыдущих символов. Крупнейшие значения всегда имеют дымность 1, а остальные интерполяции. Много информации пришлось выбрасывать, чтобы ограничить визуализацию лишь одним цифровым значением за прошлый символ. Поэтому, когда я начал это применять, я подумал, что это может быть не понятно. Но на самом деле она может создать некоторые интересные модели! Например, в по умолчанию "Office Move Summary" вы можете зависнуть над текстом, который копирован дословно как адрес и даты. Затем вы можете увидеть, что первоначальные данные выделяются…