Питате асистента за фирма като вашата и той отговаря уверено, с подробности, с имена. Вашето име отсъства. Не защото сте по-лоши, а защото към момента, в който е спрял да чете, за вас не е имало какво да прочете.
Това е първото, което трябва да знаете за езиковия модел. Той не е търсачка.
Той е нов служител.
При SEO сте свикнали, че роботът на Google минава през сайта ви редовно и знае какво е ново.
Моделът не минава през нищо.
Представете си, че сте наели човек, който е прочел огромна част от интернет, но до една дата, и сте му дали бюро с ограничена площ, така че не вижда онова, което не е на бюрото.
Може да звъни на колеги, да отваря папки, да попълва формуляри, ако му ги дадете. Може да мисли, преди да отговори, но мисленето отнема време.
Хотел в Банско е отворил през април и сайтът му е готов от май.
| Клиентът пита | Какво се случва на екрана |
|---|---|
| В ChatGPT, без търсене: „нов хотел в Банско с басейн“ | Отговорът изброява хотели, които моделът помни от четенето си. Този хотел отсъства, защото е отворил след датата, до която моделът е чел. |
| Същият въпрос, асистентът решава да потърси в мрежата | Търсенето връща страницата на хотела, тя ляга на бюрото на служителя и той я цитира. |
Всяка от думите по-долу описва част от този служител. Заедно казват какво е чел, колко му е бюрото, на кого може да звъни и колко бързо отговаря.
Термините са английски, защото така ще ги чуете. Българското име е това, което се ползва навсякъде в сайта.
Базов модел
На английски foundation model.
Базовият модел е много голям модел, обучен предварително върху огромен и разнообразен набор от данни, който се справя с най-различни задачи и служи за основа, върху която се строят по-нататъшни приспособявания.
Агентът по същата логика е софтуер, който разсъждава върху зададеното, за да планира и изпълни действия от името на човека.
Това е служителят в деня, в който го наемате.
Знае много за всичко и нищо за вашата фирма. Базовият модел е AI търсачката, която довършва изречението вместо вас.
- Защо го споменават. Всяка AI търсачка, която отговаря, стъпва върху такъв модел, а моделите се сменят по-често от сайтовете.
- За вашия сайт. Моделът знае за вас само това, което е било публично и четимо, докато е учел.
Дообучение
На английски fine-tuning.
Дообучението е подаване на примери от вида „такъв въпрос, такъв отговор“, за да научи моделът как да се държи в определена задача.
OpenAI го разделя от отговора върху намерени документи така.
Намирането решава какво трябва да знае моделът в момента, дообучението решава как да действа.
В техния пример с поправка на исландски текст дообученият модел стига 87 точки, а добавянето на намерени документи ги сваля на 83.
4 точкиделят дообучения модел от същия модел с намерени документи, 87 срещу 83.
Курс срещу папка на бюрото. Първото променя навиците, второто дава фактите.
Споменават го, защото се предлага като решение и за едното, и за другото, а е годно само за навиците.
За вашия сайт това значи едно. Никой не дообучава публичните асистенти с вашите текстове, така че пътят към отговора минава през намирането, не през паметта.
Токени
На английски tokens.
Токените са единиците, на които моделът разбива текста, за да го обработи, и с тях се мери и таксува употребата.
В сметката влизат указанията, всяко съобщение, резултатите от инструменти, изображенията, документите и дори описанията на инструментите. И отговорът, който моделът пише, се брои.
Служителят не чете думи.
Чете парчета, малко по-къси от дума.
- Защо го споменават. Всяка цена и всяко ограничение в тази област се дават в токени, не в думи и не в страници.
- За вашия сайт. Страница с много излишен текст отнема повече от бюджета на модела за същото количество полза.
Работна памет
На английски context window.
Работната памет е целият текст, който моделът може да вижда, докато пише отговора, включително самия отговор.
Различна е от данните, на които моделът е обучен, защото това е работна памет, а не знание.
И повече не значи по-добре, защото с растежа на съдържанието точността и припомнянето падат.
| Модел | Работна памет |
|---|---|
| Моделите на Anthropic | до 1 милион токена, в зависимост от модела |
| GPT-5 на OpenAI | 400 000 токена |
Бюрото.
Каквото не е на него, не съществува за служителя.
Споменават го, защото обяснява защо AI търсачката взема откъси, а не цели сайтове. На вашия сайт на бюрото попада откъс от страница, не страницата, и откъсът трябва да стои сам.
Дата на знанието
На английски knowledge cutoff.
Датата на знанието е денят, до който стигат данните, на които е обучен моделът, и нищо след нея не му е известно, освен ако не му бъде подадено или намерено. GPT-5 на OpenAI има дата на знанието в края на септември 2024 г.
Служителят е чел до тази дата.
После е спрял. След тази дата моделът не мълчи, а измисля.
- Защо го споменават. Обяснява защо нов сайт, нова услуга или нова цена не се появяват в отговора по памет.
- За вашия сайт. Всичко, публикувано след датата, стига до отговора само през търсене на живо.
Разсъждаващи модели
На английски reasoning models.
Разсъждаващите модели изразходват вътрешни токени за разсъждение, преди да напишат отговора. В това време планират, ползват инструменти, преглеждат варианти и решават задачи на няколко стъпки.
Тези токени не се виждат, но заемат място в работната памет и се таксуват като изход. Настройката за усилие е от none до max, по-ниска за скорост и по-висока за качество.
Служителят мисли на глас в друга стая, а вие чувате само заключението.
Споменават го, защото „разсъждаващ“ звучи като „по-умен“, а на практика значи „по-бавен и по-скъп, когато трябва“. На вашия сайт при въпрос с няколко стъпки моделът може да търси повече пъти, и всяко търсене е шанс страницата ви да бъде намерена.
Опиране на Google Търсене
На английски Grounding with Google Search.
Опирането на Google Търсене е инструмент в Gemini API, който свързва модела с актуалното съдържание в мрежата.
Обещаните ползи са 3, по-точни факти, достъп до актуална информация и цитати.
Отговорът връща изпълнените търсения, бележки към цитираните адреси и готов за показване списък с предложения за търсене, чиято употреба е уредена в условията за ползване, и може да се съчетае с четенето на посочена страница.
Служителят звъни на справочното на Google и получава страници с адреси. Общата дума за това е четене вместо помнене, с посочени страници.
нов хотел в Банско с басейн
страницата на хотелацитиран адрес, намерен при търсенето
страница на пътнически сайтцитиран адрес
- Защо го споменават. Това е механизмът, през който сайтът ви влиза в отговор на Gemini.
- За вашия сайт. Цитатът носи адреса ви. Страницата трябва да е достъпна и да казва нещо, което заслужава цитиране.
Инструмент за търсене на живо
На английски web search tool.
Инструментът за търсене на живо е вграден в интерфейсите за програми на OpenAI и на Anthropic.
Моделът сам решава кога да потърси, системата изпълнява търсенето и отговорът идва с цитати.
При Anthropic всеки цитат носи адрес, заглавие и до 150 знака цитиран текст.
150 знакацитиран текст носи 1 цитат при Anthropic, заедно с адреса и заглавието.
Когато отговорът се показва на човек, цитатите трябва да са в него.
Простите въпроси ползват 1 до 3 търсения, а цената е 10 долара на 1 000 търсения.
OpenAI изисква цитатите да са ясно видими и да могат да се щракват. И OpenAI, и Anthropic позволяват списъци с разрешени и забранени сайтове.
Служителят решава сам кога да провери. При стабилни факти не проверява.
Споменават го, защото това е вратата към сайта ви за всичко след датата на знанието.
Питайте изпълнителя дали въпросът, по който искате да ви цитират, изобщо подтиква модела да търси.
Четене на посочена страница
На английски URL context.
Четенето на посочена страница е инструмент, чрез който моделът получава пълното съдържание на конкретни адреси вместо откъс от индекса. Индексът е списъкът с вече прочетени страници.
В Gemini API се нарича URL context и е допълнение към опирането на Google Търсене. Отговорът се опира и на публичната мрежа, и на подадените адреси.
При Anthropic същото е сървърен инструмент, наречен web_fetch.
Служителят отваря точно тази папка, която сте му посочили, и я чете цялата.
- Защо го споменават. Обяснява посещенията в дневника на сървъра, при които се изтегля една конкретна страница по искане на човек.
- За вашия сайт. Страницата трябва да се отваря бързо и без препятствия, защото в този момент се чете цялата, а не резюме.
Викане на инструменти
На английски tool use.
Викането на инструменти е механизмът, чрез който моделът стига до всичко извън паметта си.
И редът е един.
Моделът получава описание на наличните инструменти, решава кога да поиска някой от тях, връща повикване в зададен вид, приложението или доставчикът го изпълнява и моделът продължава с резултата.
- моделът получава описанията
- решава кой да поиска
- връща повикване
- инструментът се изпълнява
- моделът продължава с резултата
Инструментите на приложението работят при него, сървърните, като търсенето и четенето на страница, работят при доставчика.
Служителят звъни на колега.
Чака отговор и продължава.
Споменават го, защото търсенето на живо, четенето на страница и всичко „агентно“ е частен случай на този механизъм. На вашия сайт всяко посещение от асистент е резултат от такова повикване, така че сайтът трябва да отговаря и на програма, а не единствено на браузър.
Общ порт за инструменти (MCP)
Общият порт за инструменти, познат като MCP, е отворен стандарт за свързване на приложения с изкуствен интелект към външни системи. Външни системи са данните, инструментите и работните потоци.
Създателите му го сравняват с порта USB-C. Един стандартен начин за свързване замества отделната връзка за всяка двойка.
Поддържат го Claude, ChatGPT, Visual Studio Code, Cursor и други.
Един телефон, който работи с всяка централа, вместо различен апарат за всеки колега.
- Защо го споменават. Появява се в оферти като нещо, което сайтът трябва „да поддържа“.
- За вашия сайт. Няма действие засега. MCP свързва приложения с ваши данни и инструменти, не публични сайтове с асистенти.
Отговор в зададена форма
На английски structured output.
Отговорът в зададена форма е режим, в който моделът е задължен да отговори точно по подадена схема, без пропуснати полета и невалидни стойности.
Ползите са 3. Полетата идват в правилния вид от първия път, без повторни опити, отказите на модела се разпознават от програмата, а указанията към модела стават по-прости.
Служителят попълва формуляр вместо да пише свободен текст.
Споменават го, защото инструментите за измерване на присъствието ви в отговорите работят точно така. Те задават на модела да отговори в таблица, която после се брои.
За вашия сайт пряка връзка няма, но е полезно да знаете как се правят числата в отчетите, които ви показват.
Корпоративното търсене на Google Cloud (Vertex AI Search)
Vertex AI Search е продукт на Google Cloud, с който фирма строи собствено търсене и препоръки върху своите данни или върху публични сайтове с технологията на Google.
Новото му име е Agent Search.
Старите са Vertex AI Search, AI Applications и Agent Builder. Обещанието е търсене с качеството на Google върху собствени данни и отговори, написани върху тях.
Фирмената библиотека, в която служителят търси първо.
- Защо го споменават. Името се сменя често и в оферта може да срещнете всяко от тези имена.
- За вашия сайт. Това е вътрешен инструмент на фирми, не публична AI търсачка. Засяга ви само ако вие го внедрявате.
Забавяне
На английски latency.
Забавянето е времето, за което моделът прочита въпроса с указанията към него и пише отговора.
Зависи от 3 фактора.
Размерът на модела, сложността на въпроса и AI търсачките, на които работи.
Мери се и времето до първия токен, което тежи, когато отговорът се показва, докато се пише. Съветите за намаляване са прости. Помагат по-малък модел, по-къс въпрос и по-къс отговор, както и показване на отговора дума по дума.
Колко бързо служителят вдига телефона и колко бързо казва първата дума.
Споменават го, защото всяка стъпка от търсенето и четенето се прибавя към това време, а бавната страница е една от тях. На вашия сайт бавен сървър забавя и инструмента, който изтегля страницата ви за отговора.
Кое от това важи за вашата фирма в ChatGPT се проверява с въпросите на клиентите ви, не с четене.
Следващия път, когато промените нещо на сайта си, попитайте след месец един асистент за него. Ако отговорът е стар, вече знаете кой от термините по-горе е причината.