По всей видимости, такая штука как этимология имеет одно из ключевых значений для нашего языкового моделирования мира. Мы вообще любим понимать смыслы вещей через их историю: история способна объяснить любую неоптимальность. Например, многие здесь знают наши с Тимуром решения tfmn-уравнения, которые называются F1, F2, F4 и... F7, среди которых F3 отсутствует, так как оказалось эквивалентным F2, а F5 и F6 мы пропустили просто потому что F7 ВООБЩЕ не такой же, как F1–F4 — мы подумали и решили: «возьмём с запасом».
Современные языковые модели пока не обременены историей так, как мы — у них есть замороженная история течения градиентов в их весах, а живая история обнуляется от сессии к сессии — в том и великий недостаток, и огромное преимущество.
Но говоря об этимологии, я вообще не сильно хотел задевать тему историчности — я собирался обсудить такое явление как ассоциативное мышление. История в этом смысле лишь один из паттернов этого самого мышления — ассоциация через хронологию.
Мне представляется, что ассоциация есть один из наиболее универсальных и, в широком понимании этого слова чуть ли не единственный наблюдаемый нами среди живых существ механизм мышления. Но я не слишком компетентен в теме зоологии — к любым моим подобным утверждениям прибавляйте «вероятно» или «гипотетически». Так или иначе, будь то рефлекс, интуиция, подсознательное или сознательное размышление, ассоциативный подход можно приплести к чему угодно.
Ассоциация же является основой языка, и современные трансформеры являются ничем иным, как огромными машинами ассоциаций, причём не только декодеры.
Если рассматривать ассоциацию как всего лишь «наличие связи», то поляризаторы ассоциативного подхода представляют себе все знания мира как огромный-огромный граф (онтологию), где узлами выступают атомарные понятия, а рёбрами — взаимосвязи между ними, но в моей практике такие графы обычно хороши лишь в применении к предметной области, где пространство связей и узлов ограничено здравым смыслом и практичностью.
В качестве технического отступления, ещё интереснее та модель, в которой разница между ребром и узлом стирается, и всё объявляется триплетом — с опциональными value, from, to. Впрочем, это лишь вопрос удобства, классический граф и триплеты выводимы друг через друга весьма тривиально.
Для объектно-направленных программистов (этаких программистов-лингвистов) ассоциация имеет более приземлённый смысл — близкий к онтологам, а то и идентичный, но с явным прикладным значением: например, основанный на необходимости спроектировать базу данных, и не через известный брутфорс в виде нескольких итераций нормализации, а через что-то заземлённое на реальность.
В UML ассоциация — это фундаментальный тип связи между сущностями, через который чисто технически можно выразить любой другой тип, за исключением, пожалуй, имплементации и зависимости — но о них я хочу написать отдельный пост. Собственно, в программирковском мире, если упрощать, ассоциация — это просто факт наличия ссылки из А в Б. Опять же, это только мой опыт, и он гиперболизирован, но любые статические артефакты семантического моделирования, будь то ER-модель или Domain-Model, или даже диаграмма вариантов использования — строятся в первую очередь вокруг ассоциаций, хоть и строго выверенных и вылизанных до технически совершенных.
Абстракция функциональная выразима через функциональную ассоциацию с небольшими танцами с бубном, но и смысловая абстракция — это лишь паттерн ассоциации, ассоциация от частного к общему и от общего к частному. С одной стороны, частное-общее является чем-то фундаментальным и неотрицаемым, с другой стороны, ассоцитивную природу тоже отрицать сложно — и она даёт порой более богатое представление.
Так же, как логика — в основе своей фундаментальна, но для людей и языковых моделей ненативна: для нас это всего лишь ещё одна низкотемпературная ассоциация. Нас учат тому, что математика — это наука об абстракциях и моделировании, но также полезно смотреть на неё с точки зрения простой ассоциации: то что сейчас вырождается в формализованную теорию пучков некогда началось с богатого ассоциативного мышления выдающихся людей.
Ассоциации в трансформерах имеют более вероятностную природу, и, как мне кажется, весьма неплохо имитируют то, как работаем с языком мы сами. Полезно иногда думать о трансформере как о графовой сети на узлах-токенах, глубина трансформера в таком случае имеет очень явный (хоть и гиперболизированный) функциональный смысл — это просто ещё одна итерация в связывании графа по принципу «друг моего друга — мой друг» — социальная инженерия токенов. Даже рандомно инициализированный трансформер можно было бы использовать для какого-никакого анализа смыслов, потому что принцип анализа смыслов заложен в него в первую очередь архитектурно, и лишь потом, хоть и более значимо — данными. Мной весьма любима эта архитектура — она выглядит элегантно.
И вот в случае LM, абстракция никогда не будет ничем большим, чем ассоциацией. Проделать алгоритмически простой путь от частного к общему и от общего к частному, особенно если это нужно делать не один раз, а несколько — по какой-то причине оказывается когнитивно тяжело и для людей, и для нейронных сетей. Одновременно с этим, выявление паттернов на невербальном, интуитивном уровне, напротив, работает очень хорошо. Мы начинаем понимать всю красоту векторных пространств только тогда, когда начинаем их чувствовать и видеть в неожиданных для себя местах, и это абстракция зачастую не через какой-то общее описание свойств, а через построенный в голове изоморфизм с простейшим классическим двумерным вектором.
Кинологи активно пропагандируют функционально полезную, но теоретически весьма сомнительную вещь: для животных, в частности, собак, мир — это короткое окно настоящего и ближайшего будущего. И на таких окнах у собак формируются устойчивые и не очень ассоциации: «я скулю — меня берут на ручки», «я лаю — мне насыпают еды». Ассоциации сразу на всех органах чувств, и работа хозяев собак заключается всего лишь в формировании удобных им ассоциаций. Мне представляется, что это очень упрощённое представление, и биология сознания ещё совсем не изучена, однако этот подход успешен в прикладной сфере, а что ещё забавнее — он с определёнными ограничениями применим и к людям.
Интересна так же и ассоциация на простом языковом уровне — почему я и начал с этимологии. Мы живём в мире с активным словообразованием и многие термины, например, в ИИ, ещё не получили строго признанного определения. С одной стороны, это термины философского толка — сильный искусственный интеллект, общий интеллект, сверх интеллект, интеллект, сознание, личность. С другой стороны, есть и более понятные термины, вроде «агент», которые не имеют какой-то великой одуховленности, давно зафиксировано понятие агента в ИТ, в теории систем, в различных экономических и игровых моделях, однако именно в ИИ всё ещё присутствует неопределённость, вызываемая этим словом.
Профессиональные термины хороши тем, что их смыслы можно черпать из очень разных контекстов, а ещё лучше — из чужих направленностей. Например, очень широки и от того прекрасны такие понятия как «интерфейс», «контракт», «онтология», «диффузия», «конгруэнтный», «трансцендентный» — и, что замечательно, при оперировании ими почти никогда не нужно делать выбор одного смысла — разные смыслы настолько тесно переплетены в понимании этих слов, что можно вкладывать сразу их все, и оставаться понятым всеми — в разной степени глубины. Предполагаю, что это чувство гораздо более знакомо, чем мне, — людям, способным к языкам, но в той же степени оно знакомо и программистам, и математикам, и биологам, и физикам, на уровне их интуитивных, собственных паттернов мироздания. И даже само слово «ассоциация» — многогранно, но общепонимаемо.
Подводя итог: я поделился множеством разрозненных крутившихся у меня в голове мыслей — половина из них очевидна, а другая сомнительна, что в совокупности делает их в целом бесполезными. Я упихал их в одну тему. Но всё-таки это не лишено посыла: попробуйте думать о восприятии языка через ассоциацию — когда общаетесь с людьми, животными, LLM — подумайте, какие ассоциации от ваших слов возникают у вас и у них, где их контекст богаче, а где ваш? И с таким подходом многое встанет на свои места.