Новый источник топлива Я всегда считал, что любую достаточно сложную задачу можно решить, используя достаточное количество шестерен, шкивов и очень большой запас сырья. Если вы хотите построить мозг на основе математики, вам нужны данные. А если у тебя кончится...
Новый источник топлива
Я всегда считал, что любую достаточно сложную задачу можно решить, используя достаточное количество шестерен, шкивов и очень большой запас сырья. Если вы хотите построить мозг на основе математики, вам нужны данные. А если у вас кончатся цифровые данные, вы просто пойдете к ближайшему источнику информации высокой плотности: магазину подержанных книг.
В последнее время наблюдается своеобразный всплеск в том, как некоторые компании, занимающиеся искусственным интеллектом, добывают свое «топливо». Оказывается, самый эффективный способ создания большой языковой модели — это не совсем деликатный процесс тщательного архивирования. Вместо этого он очень похож на измельчитель бумаги с прикрепленным сканером.
Недавно появились сообщения о том, что такие компании, как Anthropic, занимаются так называемым «деструктивным сканированием». Это прекрасный термин, не так ли? Это похоже на то, что сделал бы особенно эффективный злодей в малобюджетном научно-фантастическом фильме. Процесс прост: купить огромное количество книг в бумажном виде — часто академических или научно-популярных изданий 70-х годов — снять переплеты, пропустить страницы через высокоскоростной промышленный сканер, а затем… ну, сдать остатки на переработку.
Я думал о создании машины для автоматизации этого процесса, но логистика утилизации