GotAI.NET

Форум: Проблемы искусственного интеллекта

 

Регистрация | Вход

 Все темы | Новая тема Стр.25 (25)<< < Пред.   Поиск:  
 Автор Тема: На: Диалог DEEPSEEK на тему определения интеллекта.
гость
203.25.108.*
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 04 сен 26 18:44
Цитата:
Автор: гость 31.211.0.*



Системный подход безусловно полезен, но... это не формула созидания, он актуален только на уровне достигнутого познания. Переход на следующий уровень требует редукции неопределённости связанной с таким переходом, этот переход принципиально не содержится в свойствах элементов и их сочетаний в рамках существующей системы и определяеся вне системными элементами.Атомизм не выводим из периодической системы.

Системный подход — это не формула созидания, а язык описания: Он вступает в игру только после того, как внесистемный прорыв уже совершен. Сначала Галилей направляет телескоп в небо (акт преодоления неопределенности), сначала Резерфорд бомбардирует фольгу — и только потом системный подход «причесывает» новые данные, создавая из них очередную временную систему.Системный подход пытается выдать правила уже сыгранной партии за абсолютные законы самой шахматной доски. Но когда правила игры меняются (как при переходе от классической физики к квантовой), старая система не способна предсказать новую, потому что элементы новой реальности лежат за границами её синтаксиса.

Сущность универсальной системной онтологии заключается в реализации ответов на конечный набор инвариантных вопросов — «что», «где», «когда», «как», «почему», — выступающих в качестве гипотез о возможном устройстве мира и его проявлений. Эти вопросы образуют неизменный каркас всякого познания, его предельный синтаксис: они не зависят от конкретного содержания той или иной предметной области, но задают саму форму, в которой реальность может быть схвачена мыслью. В этом смысле системный подход представляет собой не один из инструментов среди прочих, а метод, адекватный структуре познавательного отношения к миру.

Объединённые в целостную конструкцию ответы на данные вопросы формируют модель мира — систематическое представление о реальности, выдвигаемое как гипотеза и подлежащее непрерывной проверке. Подобная модель не является пассивным отражением наличного; она строится через активную дискретизацию непрерывного, через введение мер и границ, преобразующих неразличимый континуум в множество определённых элементов и отношений. Каждый акт ответа на инвариантный вопрос предполагает введение той или иной меры: «что» выделяет сущность, «где» и «когда» фиксируют пространственно-временные координаты, «как» описывает способ действия, «почему» указывает на правило или причину. Таким образом, уже на уровне постановки вопроса осуществляется редукция неопределённости — переход от неразличимого к различимому, от потенциального к актуальному.

Модель мира, порождаемая такими ответами, должна удовлетворять критерию непротиворечивости: её элементы и правила не могут вступать в логический конфликт друг с другом. Внутренняя согласованность выступает здесь как фундаментальное условие состоятельности гипотезы. Обнаружение в модели противоречий — аномалий, не объяснимых в рамках принятых ответов, — сигнализирует о неполноте текущей дискретизации, о наличии неучтённых слоёв реальности или о недостаточности избранных мер. В этом случае редукция неопределённости считается незавершённой, и модель требует пересмотра: изменения масштаба рассмотрения, введения новых различий или новых правил, позволяющих включить прежде неразличимое и восстановить непротиворечивость.

Возражение, согласно которому переход на новый уровень познания требует внесистемных элементов, не учитывает, что сами подобные переходы суть переформулировка ответов на те же инвариантные вопросы при изменении масштаба дискретизации, предпринимаемая именно ради восстановления непротиворечивости модели. Атомизм не являлся выходом за пределы системного вопрошания: он возник как новый ответ на вопрос «что есть вещество?», полученный вследствие накопленных аномалий в прежних ответах и направленный на устранение противоречия между непрерывной делимостью и стехиометрическими законами. Аналогично, квантовая механика изменила ответы на вопросы «как» и «почему» в отношении микромира, не отменив сами вопросы и не введя ничего принципиально внеположного познавательной системе, но устранив противоречия классической модели. Внесистемное, если оно и мыслится, представляет собой лишь ещё не формализованное, не дискретизированное, не получившее ответа в терминах инвариантных вопросов; оно всегда уже направлено на то, чтобы быть схваченным в них и тем самым включённым в обновлённую непротиворечивую модель.

Таким образом, универсальная системная онтология предстаёт не как застывшая догма, но как динамическая реализация конечного набора вопросов, посредством которой мир последовательно раскрывает свою структуру. Модель мира, выдвигаемая на этом пути, есть гипотеза, непрерывно уточняемая через редукцию неопределённости и проверяемая на внутреннюю непротиворечивость. Системный подход в данном контексте представляет собой не язык описания уже сыгранной партии, а сам процесс постановки и пересмотра гипотез об устройстве реальности, движимый стремлением к согласованному и полному знанию. Он не отменяется при смене правил игры, поскольку сами правила суть изменяющиеся ответы на те же вопросы, а инвариантность вопросов и требование непротиворечивости обеспечивают непрерывность познания и его способность к синтезу нового. Следовательно, тезис о бессилии системного подхода в синтезе несостоятелен: синтез есть не что иное, как выдвижение и реализация новых ответов на вечные вопросы, осуществляемая по имманентным законам системного мышления, направленного на построение всё более полной и согласованной модели мира.
[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 05 сен 26 13:55
Изменено: 05 сен 26 13:59
"Объединённые в целостную конструкцию ответы на данные вопросы формируют модель мира — систематическое представление о реальности, выдвигаемое как гипотеза и подлежащее непрерывной проверке. Подобная модель не является пассивным отражением наличного; она строится через активную ДИСКРЕТИЗАЦИЮ НЕПРЕРЫВНОГО, через введение мер и границ, преобразующих неразличимый континуум в множество определённых элементов и отношений"

Дискретизация непрерывного, равно и как дедискретизация дискретного - существенное искажение природы как первого так и второго.
Со всем остальным согласен, если закрыть глаза на субъективность систематизаторов, которая почти всегда является причиной тормозящей подъём вверх по лестнице.
И ещё, редукция неопределённости - внесистемный фактор.
[Ответ][Цитата]
гость
203.25.108.*
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 05 сен 26 17:45
Цитата:
Автор: гость 31.211.0.*

"Объединённые в целостную конструкцию ответы на данные вопросы формируют модель мира — систематическое представление о реальности, выдвигаемое как гипотеза и подлежащее непрерывной проверке. Подобная модель не является пассивным отражением наличного; она строится через активную ДИСКРЕТИЗАЦИЮ НЕПРЕРЫВНОГО, через введение мер и границ, преобразующих неразличимый континуум в множество определённых элементов и отношений"

Дискретизация непрерывного, равно и как дедискретизация дискретного - существенное искажение природы как первого так и второго.
Со всем остальным согласен, если закрыть глаза на субъективность систематизаторов, которая почти всегда является причиной тормозящей подъём вверх по лестнице.
И ещё, редукция неопределённости - внесистемный фактор.

Что есть редукция неопределённости?
[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 06 сен 26 6:50
Цитата:
Автор: гость
Что есть редукция неопределённости?


Интеллект — способность материи редуцировать неопределённость, связанную с выбором целесообразного действия.
1.Редукция неопределённости - необходимое условие интеллектуальности.
2. Выбор целесообразного действия - достаточное условие.
3. Мера интенсивности свойства обладать интеллектом - БИТ редукции неопределённости.
I=-dH/dt, I- мощность интеллекта, Н - неопределённость (энтропия) выбора, t-время.
I>0 уменьшает неопределённость выбора, I<0 увеличивает её.
It=I*КБ*ln2, где КБ - постоянная Больцмана. It - термодинамический эквивалент редукции информационной энтропии.
[Ответ][Цитата]
гость
89.124.8.*
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 07 сен 26 20:06
Цитата:
Автор: гость 31.211.0.*



Интеллект — способность материи редуцировать неопределённость, связанную с выбором целесообразного действия.
1.Редукция неопределённости - необходимое условие интеллектуальности.
2. Выбор целесообразного действия - достаточное условие.
3. Мера интенсивности свойства обладать интеллектом - БИТ редукции неопределённости.
I=-dH/dt, I- мощность интеллекта, Н - неопределённость (энтропия) выбора, t-время.
I>0 уменьшает неопределённость выбора, I<0 увеличивает её.
It=I*КБ*ln2, где КБ - постоянная Больцмана. It - термодинамический эквивалент редукции информационной энтропии.

Исходное определение, интерпретированное буквально, действительно охватывает термостат: он редуцирует неопределённость макросостояния (температуры) и действует целесообразно в рамках заданной конструктором цели. Однако такое определение слишком широко, поскольку включает любые системы с отрицательной обратной связью, вплоть до чисто физических процессов (гейзер, рост кристалла). Для отграничения собственно интеллекта необходимо дополнительное условие семантической редукции: система должна не просто следовать градиенту или жёсткому правилу, а обладать внутренней моделью среды и собственных действий, целевой функцией и способностью интерпретировать сигналы как значимые для достижения цели. Термостат, лишённый такой модели, не удовлетворяет данному условию и потому представляет собой лишь вырожденный (нулевой) уровень интеллекта.
[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 07 сен 26 21:39
Изменено: 16 сен 26 21:39
Цитата:
Автор: гость


Исходное определение, интерпретированное буквально, действительно охватывает термостат: он редуцирует неопределённость макросостояния (температуры) и действует целесообразно в рамках заданной конструктором цели. Однако такое определение слишком широко, поскольку включает любые системы с отрицательной обратной связью, вплоть до чисто физических процессов (гейзер, рост кристалла). Для отграничения собственно интеллекта необходимо дополнительное условие семантической редукции: система должна не просто следовать градиенту или жёсткому правилу, а обладать внутренней моделью среды и собственных действий, целевой функцией и способностью интерпретировать сигналы как значимые для достижения цели. Термостат, лишённый такой модели, не удовлетворяет данному условию и потому представляет собой лишь вырожденный (нулевой) уровень интеллекта.


1.Наверное не обратили внимание на слово ВЫБОР. Выбор адекватной цели и достижение её, означает нахождение в состоянии понимания. Термостаты и прочие сливные бачки не выбирают действия и цель, а следуют жёсткому алгоритму.
2.Редукция информационной энтропии (неопределённости) - есть девальвация информационной ценности источника информации, в пределе(коллапс неопределённости), он перестаёт быть источником информации и становится просто детерминированным источником данных, что, например, произошло с Солнечной системой, когда её модель стала на 100% удволетворять требованиям практического использования.Системное описание стало достаточным, а редукция неопределённоти перестала быть необходимой. Комплекс задач связанный с использованием модели солнечной системы перестал быть интеллектуальным.

P.S. LLM в точности соответствует этому определению.
[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 15 сен 26 15:04
Изменено: 27 сен 26 5:55
1.Входные параметры моделей
У обеих моделей одинаковый размер словаря (V = 128 000 токенов), поэтому их начальная энтропия (максимальный хаос до вычислений) равна:H_max = log2(128 000) = 16.97 бит на один токен.
Разница кроется в их перплексии (остаточной неопределенности) на сложных связных текстах:
Llama 3 8B: Перплексия P=2^H = 6.14
Llama 3 70B: Перплексия P = 3.10 (за счет большего объема знаний и сложной геометрии).

2. Расчет Редукции Хаоса (Δ I) на один токен вычислим остаточную энтропию по формуле H_остат = log2(P) и чистую негэнтропию (Δ I = H_max - H_остат) для каждой модели:
Для модели Llama 3 8B:H_остат = log2(6.14) = 2.62 бит/токен.Δ I_8B = 16.97 - 2.62 = 14.35 бит/токен.
Для модели Llama 3 70B:H_остат = log2(3.10) = 1.63 бит/токен.Δ I_70B = 16.97 - 1.63 = 15.34 бит/токен.
Промежуточный вывод: Гигантская 3 70B-модель за счет своих размеров способна «выжать» из текста всего на 0.99 бита больше смысла с каждого токена, чем маленькая 8B.3.

Физическая цена этого «одного бита»
3. Посчитаем, сколько физических данных нужно прогнать через железо (в формате квантования INT8/FP8 — 1 байт на параметр), чтобы сгенерировать 100 токенов текста:
Llama 3 8B: Тратит 8 000 000 000 байт * 100 токенов = 800 Гбайт операций ввода-вывода.
Llama 3 70B: Тратит 70 000 000 000 байт * 100 токенов = 7000 Гбайт операций ввода-вывода.
Суммарный семантический выход за 100 токенов:
8B выдает: 100 токенов * 14.35 бит = 1435 бит негэнтропии.
70B выдает: 100 токенов * 15.34 бит = 1534 бит негэнтропии.

4. Итоговый Семантический КПД (Эффективность Демона)
Сопоставим: сколько бит извлеченного смысла мы получаем на 1 Гбайт «прокачанных» через кремний физических данных:
Семантический КПД (8B) = 1435 бит / 800 Гбайт = 1.79 бит / Гбайт
Семантический КПД (70B) = 1534 бит / 7000 Гбайт = 0.22 бит / Гбайт
Разница: Чтобы получить всего на 7% больше смысла (1534 бита против 1435), гигантская модель требует в 8.75 раза больше физических затрат данных (7000 Гбайт против 800).
В итоге маленькая модель оказывается в 8 раз эффективнее.
[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 16 сен 26 21:34
Изменено: 16 сен 26 21:41
Приведённый расчёт основа для сравнения LLM от любых компаний без опоры на разные мутные тесты. Достаточно сравнить перплексию или остаточную неопределённость модели и их семантический КПД(который зависит и от эфективности вычислений).
[Ответ][Цитата]
гость
188.68.52.*
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 22 сен 26 5:45
Цитата:
Автор: гость 31.211.0.*

Чтобы получить всего на 7% больше смысла (1534 бита против 1435), гигантская модель требует в 8.75 раза больше физических затрат данных (7000 Гбайт против 800).
В итоге маленькая модель оказывается в 8 раз эффективнее.


Цитата:


Да, это известная тема в LLMках лосс связан с числом параметров и объёмом данных эмпирической степенной зависимостью. В формулировке Chinchilla это выглядит так: L(N, D) = E + A/N^α + B/D^β, где N — число параметров, D — число обучающих токенов, E — неустранимый нижний предел лосса, а α и β показывают, насколько быстро убывает лосс при росте параметров и данных соответственно. Kaplan и соавторы в 2020 году показали, что эта степенная тенденция держится на протяжении более семи порядков величины, а архитектурные детали — ширина, глубина и прочее — в широком диапазоне влияют слабо. На практике α обычно лежит в диапазоне 0.2–0.35, а β — в районе 0.28–0.44. Это означает, что удвоение параметров даёт куда меньше, чем двукратное снижение лосса — отсюда и берётся математическая природа убывающей отдачи. Любопытно, что при последующих проверках данных Hoffmann и соавторов выяснилось: если соотношение токенов и параметров сильно разбалансировано (например, меньше 0.4 токена на параметр), реальный лосс крупных моделей оказывается заметно выше предсказанного степенным законом. То есть формула чувствительна к качеству данных и их пропорциям.



Но эта гладкая кривая лосса не соответствует напрямую гладкому росту способностей. То, что пользователь воспринимает как «модель стала сильнее», обычно проявляется на конкретных задачах, а способ измерения задачи сильно искажает восприятие. Schaeffer и соавторы в 2023 году показали: если задача оценивается нелинейной или разрывной метрикой — например, балл начисляется только когда все токены верны, — то даже при плавном снижении кросс-энтропии на токен кривая точности будет выглядеть как внезапный скачок. Наоборот, если заменить метрику на что-то близкое к линейному, вроде редактиционного расстояния по токенам, изменения на выходе тех же самых моделей становятся непрерывными и предсказуемыми, и никакого «эмерджентного» скачка не остаётся. Их метаанализ 29 популярных метрик из BIG-Bench показал, что 25 из них не демонстрируют эмерджентных свойств. Это значит, что утверждение «способность появляется при таком-то числе параметров» во многом зависит от того, какой линейкой вы меряете.

Однако сказать, что эмерджентности не существует вовсе, тоже нельзя. Есть эффекты, которые трудно объяснить одной лишь нелинейностью метрики. Например, способность следовать цепочке рассуждений, использовать инструменты или удерживать сложный формат инструкций может отсутствовать у модели меньшего размера и появляться у большей — причём не постепенно, а как пороговый переход. Проблема в том, что такие способности обычно измеряются через составные бенчмарки, где сама задача требует совпадения нескольких условий одновременно. Это снова возвращает нас к вопросу метрики: порог может быть свойством задачи, а не модели. Отделить одно от другого экспериментально сложно, потому что для этого нужно варьировать и масштаб, и метрику, и данные одновременно.

Есть и более фундаментальная сложность. Пороговые эффекты могут возникать из-за взаимодействия нескольких факторов: ёмкости модели, качества данных, длины контекста и процедуры post-training. Например, модель может «не уметь» решать задачу не потому, что в весах не хватает знаний, а потому, что её не научили форматировать ответ. Тогда скачок при переходе к большей модели — это не эмерджентность в строгом смысле, а следствие того, что большая модель лучше обобщает инструкции после RLHF. Разделить вклад масштаба и вклад обучения на практике почти невозможно, потому что чекпоинты разных размеров обучаются на разных данных и с разными гиперпараметрами.

В общем, степенная формула L(N, D) = E + A/N^α + B/D^β хорошо описывает усреднённое поведение лосса, но не предсказывает способности напрямую. Гладкое снижение лосса может сосуществовать с резкими скачками на конкретных метриках — и часто это артефакт измерения, а не свойство модели. Настоящие пороговые эффекты, если они есть, трудно отделить от нелинейности бенчмарков, взаимодействия с post-training и различий в данных. Поэтому утверждение «при таком-то масштабе появляется способность X» всегда стоит проверять: возможно, вы просто сменили линейку.

[Ответ][Цитата]
гость 31.211.0.*
Сообщений: 2076
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 23 сен 26 1:11
Изменено: 23 сен 26 1:54
Закон Chinchilla определяет оптимальность исключительно для этапа обучения. Он отвечает на вопрос разработчика: «У меня есть фиксированный бюджет на суперкомпьютер (например, 100 000 долларов). Как мне распределить его между размером сети и объемом обучающего датасета, чтобы получить минимальный loss?»

Выше шла речь об оптимальности результата на этапе когда сеть обучена и функционирует в режиме исполнения (инференса).

P.S. Из-за жестких требований инференса индустрия перешла к стратегии Over-training (переобучения).
Если модель планируется использовать миллиарды раз, разработчикам выгоднее «переплатить» на этапе обучения. Они берут маленькую модель (например, 8 миллиардов параметров) и вместо положенных по Chinchilla 160 миллиардов токенов скармливают ей 15 триллионов токенов (в 100 раз больше).С точки зрения Chinchilla, это чудовищно неоптимально. На эти деньги можно было обучить огромную модель, которая была бы умнее, но с точки зрения бизнеса, это гениально. Модель "выжимает" максимум из своих 8 млрд параметров, догоняя по качеству более ранние гиганты, но в эксплуатации обходится в копейки и работает молниеносно.
[Ответ][Цитата]
yasirabbas6479
Сообщений: 2
На: Диалог DEEPSEEK на тему определения интеллекта.
Добавлено: 24 сен 26 12:11
Тоже сталкивался с тем, что при генерации изображений через Gemini приходится отдельно разбираться с лимитами и авторизацией. Если нужно просто сравнить результат и не заниматься настройкой API, можно дополнительно попробовать Gemini — удобно проверить тот же промпт и посмотреть, насколько отличается результат. А для большого количества генераций, конечно, уже имеет смысл автоматизировать процесс и следить за лимитами, как описано здесь.
[Ответ][Цитата]
 Стр.25 (25): 1  ...  21  22  23  24  [25]<< < Пред.