Қысқаша
Әр қадам нұсқауларды, әңгіме тарихын, құрал нәтижелерін және аралық күйді қайта-қайта өңдегенде AI агенттің токен шығыны өседі.
Токен көлемін бір іске қосу (run) деңгейіндегі бюджеттермен, құрал-нәтижені сүзгілеумен, контексті ықшамдаумен, қайта талпыныс шектеуімен және бақыланатын ойлаумен азайтыңыз. Тұрақты қайталанатын кіріс үшін промптты кэштеңіз, бірақ арзанырақ модельге ауыспастан бұрын агент циклін оңтайландырыңыз.
Өндірістегі ең пайдалы метрика — бүкіл іске қосу бойынша өлшенетін сәтті орындалған тапсырмаға шаққандағы құн, сұраныс бағасы немесе соңғы шақырудың контекст өлшемі емес.
Бұл нұсқаулық көпқадамды AI агенттеріне арнайы бағытталған. Қайталанатын контекст қалай іске қосудың бүкіл ұзындығында жиналатынын, ысыраптың ең үлкен көзін қалай анықтауды және алдымен қандай басқару тетіктерін енгізуді түсіндіреді.
Кіріспе
Чатбот пайдаланушының әр хабарламасына бір модель шақыруын жасайды. Ал AI агент бір тапсырманы аяқтамас бұрын 10, 20 немесе одан да көп қоңырау жасай алады.
Әр қадам нұсқауларды, әңгіме тарихын, құрал нәтижелерін және аралық күйді қайта жіберуі мүмкін. Қайта талпыныстар, ойлау және субагенттер пайдалану көлемін арттырады, сондықтан қысқа соңғы жауап та көп токен жұмсауы мүмкін.
Қолдану ауқымы өскен сайын, бұл шығындарды болжау қиындайды және өнім маржасын жылдам төмендетуі мүмкін. Оларды азайту үшін тек модельді арзаныраққа ауыстыру емес, толық агент циклін оңтайландыру қажет.
Бұл мақала Агентке тән шығындарға шоғырланады. Промпт кэштеу, дәл жауапты кэштеу, семантикалық кэштеу, модель маршрутизациясы және жалпы API құнын басқару туралы кең нұсқаулық үшін мына жерді қараңыз: AI API құнын қалай азайтуға болады.
Неліктен AI агенттің токен шығыны жинақталады?
Көпқадамды агентте бір тапсырманың құны — тек соңғы жауап емес, барлық модель шақыруларының қосындысы.
Агент токенін пайдаланудың негізгі көздері:
| Шығын көзі | Нені тудырады | Алдымен сынайтын басқару |
|---|---|---|
| Қайталанатын нұсқаулар | Жүйелік промпттар, құрал схемалары, саясаттар, мысалдар | Қайта пайдаланылатын префиксті тұрақтандыру |
| Өсіп келе жатқан тарих | Әр қадамда алдыңғы кезектер қайта жіберіледі | Күйді ықшамдау не іріктеп алу |
| Құрал нәтижелері | Іздеу беттері, файлдар, журналдар, ДҚ жазбалары | Контекстке қоспай тұрып сүзу |
| Аралық шығыс | Жоспарлар, күй хабарламалары, егжейлі құрал шешімдері | Ықшам құрылымды шығыс |
| Ойлау токендері | Қарапайым қадамдарда жоғары ойлау күші | Күрделілікке сай күшті сәйкестендіру |
| Қайта талпыныстар | Жарамсыз шығыс, таймауттар, құрал қателері, rate limit | Сәтсіздіктерді жіктеп, шектеу қою |
| Субагенттер | Жұмысшылар контексті, құралдарды, талдауды қайталайды | Әр жұмысшыға тар контекст бөлу |
Шотты азайтудың екі бөлек жолы бар:
- Фильтрация, ықшамдау, шығысты шектеу және циклді басқару арқылы өңделетін токендерді азайту.
- Қажетті токендердің тиімді бағасын промпт кэштеу немесе модельді таңдау арқылы төмендету.
Негізгі айырмашылық: Промпт кэштеу қайталанатын кірістің бағасын төмендетеді. Контексті ықшамдау қайталанатын кірістің өзін азайтады.
12-қадамдық агент 147 000 токенді қалай өңдей алады?
Келесі қасиеттері бар гипотетикалық қолдау агентін қарастырайық:
- 4 000 токендік тұрақты префикс
- Әр қадамнан кейін қосылатын 1 500 жаңа токен
- Әр сұраныста жиналған тарих толық қайта жіберіледі
- Барлығы 12 модель шақыруы
n-қадамдағы кіріс:
Input at step n = 4,000 + 1,500 × (n - 1)
12 шақыру бойынша жиынтық кіріс:
Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens
Соңғы шақыру тек 20 500 кіріс токенінен тұрады, бірақ толық іске қосу барысында 147 000 жиынтық кіріс токені өңделеді.
Енді екі басқаруды қолданайық:
- Алғашқы қоңыраудан кейін тұрақты 4 000 токендік префиксті кэштеу.
- Алтыншы қадамнан кейін тарихты 2 500 токендік күй қысқаша мазмұнына ықшамдау.
| Сценарий | Кэшсіз кіріс | Кэшті кіріс | Өңделген жиынтық кіріс | Өзгеріс |
|---|---|---|---|---|
| Әр қадамда толық тарих | 147,000 | 0 | 147,000 | Базалық |
| Тұрақты префикс кэштелген | 103,000 | 44,000 | 147,000 | Көлем бірдей, бірақ арзанырақ қоспа |
| Кэш + ықшамдау | 64,000 | 44,000 | 108,000 | 26.5% аз токен өңделді |
Бұл жоспарлау есебі, провайдер бенчмаркі емес.
Ол әр сұранысқа жиналған толық тарихты қосады деп болжайды. Күйді іріктеп құратын, ескі хабарламаларды жинақтайтын немесе тек өзекті ақпаратты алатын агенттер басқа шығын қисығын ұстануы мүмкін.
Құнның өсу ережесі: Толық іске қосу бойынша жиынтық кірісті өлшеңіз. Соңғы контекст өлшемі өңделген токендердің жалпы санын көрсетпейді.

Қай метрикалар агенттің токен ысырабына ишара етеді?
Алдымен модельді өзгертпеңіз. Алдымен жұмыс ағынында нәтижені жақсартпайтын жерге токендер қайда жұмсалатынын анықтаңыз.
Әр агент қадамы үшін мына өрістерді жазыңыз:
| Өріс | Маңызы |
|---|---|
run_id, step_id, parent_step_id | Агент және субагент ағашын қайта құрастырады |
| Rendered input tokens | Контексттің қоңыраулар арасында қалай өсетінін көрсетеді |
| Cached and uncached input | Қайта пайдалануды жаңа контексттен бөледі |
| Output and reasoning tokens | Қымбат генерация қадамдарын анықтайды |
| Tool result size and retained tokens | Кейінгі промпттарға қанша шикі дәлел кіретінін көрсетеді |
| Retry reason and attempt number | Қайталанатын сәтсіздіктерді анықтайды |
| Compaction tokens before and after | Контексттің нақты қысқаруын өлшейді |
| Worker ID and returned tokens | Субагент жұмысының қайталануын ашады |
| Accepted, rejected, or escalated result | Құнды тапсырма сапасымен байланыстырады |
Басты метрика болуы тиіс:
cost per successful task
= total workflow cost
/ accepted tasks
Арзанырақ іске қосу — егер ол көбірек сәтсіз тапсырмаға, құралдарды қайта шақыруға немесе адамдық түзетуге әкелсе — жақсарту емес.
Мәселені табуға көмектесетін төрт агентке тән метрика.
Контекст амплификациясы
context amplification
= cumulative input tokens
/ final-step input tokens
Мәннің жоғары болуы алдыңғы контексттің қайталанып өңделгенін көрсетеді.
Құрал нәтижелерін сақтау қатынасы
tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools
Жоғары қатынас агенттің қадамдар арасында тым көп шикі дәлелді көтеріп жүргенін көрсетуі мүмкін.
Қайта талпыныс салығы
retry tax
= retry and repair cost
/ total workflow cost
Ойлау үлесі
reasoning share
= reasoning-token cost
/ total model cost
Әр жұмыс жүктемесін бөлек өлшеңіз. Зерттеу, код жазу, браузер және қолдау агенттері ортақ бір базалық деңгейге ие болмауы керек.
AI агенттің токен шығынын азайтудың алты тәсілі
1. Толық орындауға бюджет орнатыңыз
Әр сұранысқа шығыс шектеуі көпқадамды агентті бақыламайды.
Мынау үшін іске қосу (run) деңгейінде шектер қойыңыз:
- Жиынтық модель қадамдары
- Жиынтық кіріс және шығыс
- Құрал қоңыраулары және құрал-нәтиже көлемі
- Сәтсіздік түрлері бойынша қайта талпыныстар
- Субагенттер
- Жалпы өткен уақыт немесе болжамды құн
Төмендегі провайдерге тәуелсіз Python мысалы әр модель шақыруының алдында іске қосуды бағалайды:
from dataclasses import dataclass
from enum import Enum
class Action(str, Enum):
CONTINUE = "continue"
COMPACT = "compact"
STOP = "stop"
@dataclass(frozen=True)
class Budget:
max_steps: int = 12
max_input_tokens: int = 120_000
max_output_tokens: int = 18_000
compact_at: float = 0.80
@dataclass
class Usage:
steps: int = 0
input_tokens: int = 0
output_tokens: int = 0
def evaluate_budget(usage: Usage, budget: Budget) -> Action:
if (
usage.steps >= budget.max_steps
or usage.input_tokens >= budget.max_input_tokens
or usage.output_tokens >= budget.max_output_tokens
):
return Action.STOP
input_ratio = usage.input_tokens / budget.max_input_tokens
if input_ratio >= budget.compact_at:
return Action.COMPACT
return Action.CONTINUE
Әр модель сұранысының алдында тексеруді іске қосыңыз және Usage мәндерін провайдер ұсынған токен деректерінен жаңартыңыз.
Кіріс бюджеттің 80%-ына жеткенде күйді ықшамдаңыз немесе келесі құрал сұрауын тарылтыңыз. 100%-да құрылымды себеппен тоқтаңыз.
Жиі қателік: Әр жауапты шектеп, бірақ қадамдар, құралдар және қайта талпыныстар санын шектемеу.
2. Құрал нәтижелерін транскриптке қосар алдында сүзгіден өткізіңіз
Агенттің келесі шешіміне қажет дәлелдерді ғана қайтарыңыз.
Келесі қадамға тек бірнеше өріс керек болғанда, мына толықты қоспаңыз:
- Веб-бет
- Журнал файлы
- Репозиторий ағашы
- Деректер қорының жауабы
- Терминал сессиясы
- API жүктемесі
Іздеу құралы, мысалы, мынадай қайтаруы мүмкін:
{
"source_id": "search_17",
"title": "Relevant page title",
"url": "https://example.com/page",
"relevant_passage": "A short evidence block"
}
Толық артефактты промпттан тыс сақтаңыз да, кейін тарылтылған бөлігін ғана алыңыз.
Құрал-сүзгі ережесі: Келесі шешімге қажет өрістерді ғана қайтарыңыз — кейін керек болуы мүмкін барлық өрістерді емес.
Жиі қателік: JSON жүктемесінің алғашқы 1 000 таңбасын жай ғана қию. Бұл құрылымды бұзуы немесе агентке шынында қажет жазбаларды алып тастауы мүмкін.
Алдымен жүктемені талдаңыз, өрістерді құрылымдық түрде таңдаңыз, массивтерді шектеңіз, содан соң валид JSON етіп сериализациялаңыз.
3. Жай әңгіме мәтінін емес, жұмыс күйін ықшамдаңыз
Ықшамдау келесі әрекетке қажет ақпаратты сақтап, енді әсер етпейтін тарихты алып тастауы тиіс.
Пайдалы ықшам күй құрамында мыналар болады:
- Пайдаланушы мақсаты және сәттілік критерийлері
- Бұған дейін қабылданған шешімдер
- Расталған фактілер және дереккөз ID-лары
- Өзгертілген файлдар немесе жазбалар
- Сәтсіз тәсілдер
- Ашық сұрақтар
- Келесі әрекет
- Қауіпсіздік және шығыс шектеулері
Ол толық әңгімені қайта баяндамауы керек.
OpenAI ұзақ Responses API өзара әрекеттесулері үшін ықшамдауды құжаттайды. Anthropic ескі контентті тазартуға немесе қорытындылауға арналған контекст-менеджмент басқаруларын ұсынады. Бұл іске асырулар әртүрлі, сондықтан интеграция алдында ағымдағы провайдер өрістерін тексеріңіз.
Ықшамдау ережесі: Шешімдер мен аяқталмаған жұмысты сақтаңыз. Қайта алуға болатын баяндау мен дәлелдерді алып тастаңыз.
Жиі қателік: Дереккөз ID-ларын, өзгертілген файл аттарын, қабылданбаған тәсілдерді немесе шешілмеген шектеулерді түсіріп қалдыру.
Ықшамдауды енгізгеннен кейін агенттің іздеулерді немесе құрал қоңырауларын қайталайтынын өлшеңіз. Қысқа промпт — егер агент жоғалған күйді қайта құруға мәжбүр болса — арзан емес.
4. Қайта пайдаланылатын префиксті тұрақты ұстаңыз
Агент промпттары жиі үлкен қайта пайдаланылатын блоктарды қамтиды:
- Жүйелік нұсқаулар
- Құрал схемалары
- Қауіпсіздік саясаттары
- Шығыс форматтары
- Ортақ анықтамалық материал
- Репозиторий немесе өнім нұсқаулары
Осы тұрақты элементтерді сұранысқа тән деректердің алдына орналастырыңыз:
1. Жүйелік нұсқаулар
2. Саясаттар және шектеулер
3. Құрал анықтамалары
4. Тұрақты мысалдар
5. Ортақ анықтамалық материал
6. Сұранысқа тән деректер
Уақыт белгілерін, сұраныс ID-ларын, сессия деректерін немесе жиі өзгеретін мәндерді басына жақын орналастырмаңыз.
Кэштеу префикс ұзын, тұрақты және қайта пайдаланылатын кезде ең пайдалы. Ол қысқа сессиялар немесе жиі өзгеретін промпттар үшін ақша үнемдемеуі мүмкін.
Жиі қателік: Кэш-хит мөлшерін арттыруға тырысып, кэшке жазу, оқу немесе сақтау құнын өлшемеу.
Провайдер промпт кэштеуін, дәл жауап кэштеуін және семантикалық кэштеуді кең салыстыру үшін қараңыз: AI API құнын қалай азайтуға болады.
5. Қайта талпыныстардың сол бір контекстті қайталауына жол бермеңіз
Қайта талпыныс — көбіне дәл сол үлкен промптпен жасалатын тағы бір агент қадамы.
Сәтсіздіктің себебі өзгермейінше, сәтсіз сұранысты қайталамаңыз.
| Сәтсіздік | Дұрысы |
|---|---|
| Жарамсыз құрылымды шығыс | Валидация қатесін қайтарып, бір рет қайта көру |
| Құрал таймауты | Идемпотент операцияны бір рет қайталау, содан соң тоқтату не fallback |
| Контекст асып кетуі | Күйді ықшамдау немесе азырақ дәлел алу |
| Қайталанатын құрал қоңырауы | Операция хэші арқылы дедупликация |
| Рейт-лимит | Кейінге шегіну немесе алдын ала сыналған fallback маршруты |
| Төмен сенімділік нәтижесі | Жетпейтін ақпаратты сұрау немесе эскалация |
Төлемдер, e-mail, деплойменттер және ДҚ жазу сияқты жанама әсері бар операциялар үшін идемпотенттік кілттерді қолданыңыз.
Жиі қателік: Rate-limited модельді бірнеше рет қайталап, әр талпыныста толық агент контекстін қайта жіберу.
Қайта талпыныс салығын сәтсіздік түрлері бойынша бақылаңыз, осылайша команда ең үлкен циклді бірінші болып түзете алады.
6. Ойлау мен субагенттерді қажет қадамдарға ғана қолданыңыз
Әр агент қадамы терең ойлауды қажет етпейді.
Экстракция, форматтау, жіктеу, валидация және қарапайым құрал таңдау көбіне төмен ойлау күшін және ықшам құрылымды шығысты қажет етеді.
Жоғары ойлау күшін келесіге сақтаңыз:
- Күрделі жоспарлау
- Қиын код жазу
- Көп құжатты синтез
- Дау туғызатын шешімдер
- Орындалуы сәтсіз болғаннан кейін қалпына келу
Ойлау ережесі: Қабылданған тапсырма мөлшерлемесін сақтайтын ең төмен ойлау күшін пайдаланыңыз.
Субагенттерге де анық шекара қажет. Әр жұмысшыға беріңіз:
- Тар тапсырма
- Тапсырмаға тән контекст бөлігі
- Құралдар рұқсат тізімі
- Токен бюджеті
- Ықшам шығыс схемасы
Түбір агентке әдетте нәтижелер, дәлел ID-лары, сенім деңгейі және шешілмеген мәселелер керек — жұмысшының толық транскрипті емес.
Субагент ережесі: Қайталанатын контекстті емес, тәуелсіз жұмысты параллельдеңіз.
Жиі қателік: Тар тапсырма бермей тұрып, барлық түбір-агент тарихын әр жұмысшыға жіберу.
Алдымен қай оптимизацияны қолдану керек?
Агент телеметриясын пайдаланып, алғашқы араласуды таңдаңыз.
Төмендегі шектер — тергеу триггерлері, әмбебап стандарттар емес.
| Бақыланған белгі | Алдымен неден бастаңыз |
|---|---|
| Контекст амплификациясы жоғары | Тарихты ықшамдаңыз және күйді іріктеп алыңыз |
| Құрал шығысы промптты басып тұр | Өрістерді сүзгіден өткізіп, толық артефакттарды сыртта сақтаңыз |
| Қайта талпыныс салығы жоғары | Валидация, таймаут және қайталанатын құрал қоңырауларын түзетіңіз |
| Ойлау үлесі жоғары | Қарапайым қадамдарда ойлау күшін төмендетіңіз |
| Субагенттер бір дәлелді қайталайды | Жұмысшы көлемін және контекст бөліктерін тарылтыңыз |
| Кэштелген кіріс төмен | Қайта пайдаланылатын префиксті тұрақтандырыңыз |
| Цикл тазартудан кейін де құн жоғары | Төмен құны бар модель маршруттарын салыстырыңыз |
Қауіпсіз іске асыру тізбегі:
- Жиынтық кірісті, құрал сақтауын, қайта талпыныстарды және ойлауды өлшеңіз.
- Қадамдар, құралдар, қайта талпыныстар және жиынтық токендер үшін қатты шектер қойыңыз.
- Үлкен құрал нәтижелерін сүзгіден өткізіңіз.
- Өлшенген шектен кейін ескі күйді ықшамдаңыз.
- Қайта пайдаланылатын промпт префиксін тұрақтандырыңыз.
- Агент циклі тазаланғаннан кейін ғана модель маршруттарын салыстырыңыз.
Бір уақытта бір ірі айнымалыны өзгертіп, сол бірдей бағалау жиынтығын қайта ойнатыңыз.
Салыстырыңыз:
- Тапсырманы қабылдау мөлшерлемесі
- Сәтті тапсырмаға шаққандағы құн
- Жиынтық кіріс
- Құрал қоңыраулары саны
- Қайта талпыныс салығы
- Ойлау үлесі
- p50 және p95 кідіріс
- Адамдық тексеру уақыты
Токен үнемдегенмен, тапсырма сапасын төмендететін немесе қажет дәлелдерді алып тастайтын өзгерістерді қайтарыңыз.
CometAPI арқылы агент жұмыс ағындарын тестілеңіз
Көпмодельді бағалауға кіріспес бұрын, CometAPI-дың баға беті мен құнын алдын ала бағалау нұсқаулығын пайдаланып, кіріс, шығыс, кэштелген токен және ойлау шығындарын бағалаңыз.
Содан кейін модель каталогын қолданып, қолайлы маршруттарды анықтаңыз және Жылдам бастау арқылы OpenAI-мен үйлесімді клиентті баптаңыз.
Өндірістік fallback үшін CometAPI модель fallback нұсқаулығын ұстанып, аяқталған құрал қоңырауларын қайталамай және расталған күйді тастамай маршруттарды ауыстырыңыз.
Біріктірілген қолжетімділік модельдерді салыстыру мен fallback интеграциясын жеңілдетеді. Дегенмен токен бюджеттері, ықшамдау, валидация, құрал сүзгілеу, қайта талпыныс шектеулері және қабылдау критерийлері қосымша деңгейінде қалуы керек.
ЖҚС
Неліктен агенттер чатботтарға қарағанда көп токен пайдаланады?
Агенттер бірнеше модель қоңырауларын жасайды және әр қадамда алдыңғы хабарламаларды, құрал нәтижелерін, нұсқауларды және аралық күйді қайта жібере алады. Бұл алдыңғы контексттің қайталап өңделуіне әкеледі.
Промпт кэштеу контекст-терезе пайдалануды азайта ма?
Жоқ. Промпт кэштеу қайталанатын кірістің тиімді бағасын немесе кідірісін төмендетеді, бірақ кэштелген токендер де өңделетін контексттің бір бөлігі болып қала береді. Промпт өлшемін азайту үшін ықшамдау, сүзгілеу немесе іріктеп алуды қолданыңыз.
Агент контекстті қашан ықшамдауы керек?
Контексттің өсуі құнға, кідіріске немесе қолжетімді шығыс кеңістігіне әсер ете бастағанға дейін ықшамдаңыз. Ықшам күй шешімдерді, дереккөз ID-ларын, өзгертілген файлдарды, ашық сұрақтарды және қауіпсіздік шектеулерін сақтайтынын растаңыз.
Субагенттер токен құнын азайта ма?
Автоматты түрде емес. Олар тәуелсіз жұмыс үшін өткен уақытты азайтуы немесе қамтуды жақсартуы мүмкін, бірақ қайталанатын контекст пен қабаттасқан талдау жиынтық токенді жиі арттырады.
AI агент құнын оңтайландыруға арналған ең жақсы метрика қандай?
Басты метрика ретінде сәтті орындалған тапсырмаға шаққандағы құнды қолданыңыз. Оны жиынтық кіріспен, контекст амплификациясымен, құрал сақтауымен, қайта талпыныс салығымен, ойлау үлесімен, кідіріспен және адамдық тексеру уақытымен диагностикалаңыз.
