«Агенты искусственного интеллекта» сейчас повсюду, и большинство объяснений являются либо маркетинговыми, либо исследовательскими статьями. Этот пост не является ни тем, ни другим. В нем подробно рассматривается, как на практике работает автоматизация агентов, с использованием AWFlow (инструмента автоматизации браузера, который я создаю) в качестве примера...
«Агенты искусственного интеллекта» сейчас повсюду, и большинство объяснений являются либо маркетинговыми, либо исследовательскими статьями. Этот пост не является ни тем, ни другим. В нем подробно рассматривается, как на практике работает автоматизация агентов, на примере AWFlow (инструмент автоматизации браузера, который я создаю): из чего состоит агент, что добавляет команда и что происходит между «вот моя цель» и «вот ваш ответ».
Часть 1: агент — 5 частей
1. Модель: мозг.
Языковая модель, которая читает, рассуждает и решает следующее действие. В AWFlow каждый агент выбирает свою собственную модель: модель, работающую в вашем браузере, локальную модель Ollama или облачную модель с вашим собственным ключом API. Разные агенты могут использовать разные мозги: большой у агента, который планирует, маленький — для узкой работы.
2. Инструкции: должностная инструкция.
Простой текст: кто это, для чего нужен, как должен себя вести. Написание хороших инструкций — это большая часть работы. Инструмент может составить их из одного предложения («агент, который каждое утро проверяет мой почтовый ящик»), и вы оттуда редактируете.
3. Память: что она узнала о вас.
Факты, которые сохраняются между чатами: ваше имя, ваши предпочтения, «Дана утверждает счета». Здесь имеют значение два варианта дизайна. Память хранится на вашем устройстве. И канун
