DeepSeek Vision and Grok Imagine models are now live on CometAPI →
guide/CometAPI зерттеуі

Өндірістік ортада AI агенттің токен шығындарын қалай азайтуға болады

Контексттің өсуін, құралдар шығысын, қайта талпыныстарды, пайымдауды және қосалқы агенттерді бақылау арқылы ЖИ агентінің токен шығындарын азайтыңыз. 12 қадамдық шығын мысалы қамтылған.

CometAPI
Mia MarenAI model және API зерттеу тобы
Жаңартылды Aug 24, 2026 11 мин оқу
Өндірістік ортада AI агенттің токен шығындарын қалай азайтуға болады
Осы үлгіні пайдалану

Бірінші API шақыруын жасаңыз.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Қысқаша

Әр қадам нұсқауларды, әңгіме тарихын, құрал нәтижелерін және аралық күйді қайта-қайта өңдегенде AI агенттің токен шығыны өседі.

Токен көлемін бір іске қосу (run) деңгейіндегі бюджеттермен, құрал-нәтижені сүзгілеумен, контексті ықшамдаумен, қайта талпыныс шектеуімен және бақыланатын ойлаумен азайтыңыз. Тұрақты қайталанатын кіріс үшін промптты кэштеңіз, бірақ арзанырақ модельге ауыспастан бұрын агент циклін оңтайландырыңыз.

Өндірістегі ең пайдалы метрика — бүкіл іске қосу бойынша өлшенетін сәтті орындалған тапсырмаға шаққандағы құн, сұраныс бағасы немесе соңғы шақырудың контекст өлшемі емес.

Бұл нұсқаулық көпқадамды AI агенттеріне арнайы бағытталған. Қайталанатын контекст қалай іске қосудың бүкіл ұзындығында жиналатынын, ысыраптың ең үлкен көзін қалай анықтауды және алдымен қандай басқару тетіктерін енгізуді түсіндіреді.

Кіріспе

Чатбот пайдаланушының әр хабарламасына бір модель шақыруын жасайды. Ал AI агент бір тапсырманы аяқтамас бұрын 10, 20 немесе одан да көп қоңырау жасай алады.

Әр қадам нұсқауларды, әңгіме тарихын, құрал нәтижелерін және аралық күйді қайта жіберуі мүмкін. Қайта талпыныстар, ойлау және субагенттер пайдалану көлемін арттырады, сондықтан қысқа соңғы жауап та көп токен жұмсауы мүмкін.

Қолдану ауқымы өскен сайын, бұл шығындарды болжау қиындайды және өнім маржасын жылдам төмендетуі мүмкін. Оларды азайту үшін тек модельді арзаныраққа ауыстыру емес, толық агент циклін оңтайландыру қажет.

Бұл мақала Агентке тән шығындарға шоғырланады. Промпт кэштеу, дәл жауапты кэштеу, семантикалық кэштеу, модель маршрутизациясы және жалпы API құнын басқару туралы кең нұсқаулық үшін мына жерді қараңыз: AI API құнын қалай азайтуға болады.

Неліктен AI агенттің токен шығыны жинақталады?

Көпқадамды агентте бір тапсырманың құны — тек соңғы жауап емес, барлық модель шақыруларының қосындысы.

Агент токенін пайдаланудың негізгі көздері:

Шығын көзіНені тудырадыАлдымен сынайтын басқару
Қайталанатын нұсқауларЖүйелік промпттар, құрал схемалары, саясаттар, мысалдарҚайта пайдаланылатын префиксті тұрақтандыру
Өсіп келе жатқан тарихӘр қадамда алдыңғы кезектер қайта жіберіледіКүйді ықшамдау не іріктеп алу
Құрал нәтижелеріІздеу беттері, файлдар, журналдар, ДҚ жазбаларыКонтекстке қоспай тұрып сүзу
Аралық шығысЖоспарлар, күй хабарламалары, егжейлі құрал шешімдеріЫқшам құрылымды шығыс
Ойлау токендеріҚарапайым қадамдарда жоғары ойлау күшіКүрделілікке сай күшті сәйкестендіру
Қайта талпыныстарЖарамсыз шығыс, таймауттар, құрал қателері, rate limitСәтсіздіктерді жіктеп, шектеу қою
СубагенттерЖұмысшылар контексті, құралдарды, талдауды қайталайдыӘр жұмысшыға тар контекст бөлу

Шотты азайтудың екі бөлек жолы бар:

  1. Фильтрация, ықшамдау, шығысты шектеу және циклді басқару арқылы өңделетін токендерді азайту.
  2. Қажетті токендердің тиімді бағасын промпт кэштеу немесе модельді таңдау арқылы төмендету.

Негізгі айырмашылық: Промпт кэштеу қайталанатын кірістің бағасын төмендетеді. Контексті ықшамдау қайталанатын кірістің өзін азайтады.

12-қадамдық агент 147 000 токенді қалай өңдей алады?

Келесі қасиеттері бар гипотетикалық қолдау агентін қарастырайық:

  • 4 000 токендік тұрақты префикс
  • Әр қадамнан кейін қосылатын 1 500 жаңа токен
  • Әр сұраныста жиналған тарих толық қайта жіберіледі
  • Барлығы 12 модель шақыруы

n-қадамдағы кіріс:

Input at step n = 4,000 + 1,500 × (n - 1)

12 шақыру бойынша жиынтық кіріс:

Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens

Соңғы шақыру тек 20 500 кіріс токенінен тұрады, бірақ толық іске қосу барысында 147 000 жиынтық кіріс токені өңделеді.

Енді екі басқаруды қолданайық:

  1. Алғашқы қоңыраудан кейін тұрақты 4 000 токендік префиксті кэштеу.
  2. Алтыншы қадамнан кейін тарихты 2 500 токендік күй қысқаша мазмұнына ықшамдау.
СценарийКэшсіз кірісКэшті кірісӨңделген жиынтық кірісӨзгеріс
Әр қадамда толық тарих147,0000147,000Базалық
Тұрақты префикс кэштелген103,00044,000147,000Көлем бірдей, бірақ арзанырақ қоспа
Кэш + ықшамдау64,00044,000108,00026.5% аз токен өңделді

Бұл жоспарлау есебі, провайдер бенчмаркі емес.

Ол әр сұранысқа жиналған толық тарихты қосады деп болжайды. Күйді іріктеп құратын, ескі хабарламаларды жинақтайтын немесе тек өзекті ақпаратты алатын агенттер басқа шығын қисығын ұстануы мүмкін.

Құнның өсу ережесі: Толық іске қосу бойынша жиынтық кірісті өлшеңіз. Соңғы контекст өлшемі өңделген токендердің жалпы санын көрсетпейді.

img

Қай метрикалар агенттің токен ысырабына ишара етеді?

Алдымен модельді өзгертпеңіз. Алдымен жұмыс ағынында нәтижені жақсартпайтын жерге токендер қайда жұмсалатынын анықтаңыз.

Әр агент қадамы үшін мына өрістерді жазыңыз:

ӨрісМаңызы
run_id, step_id, parent_step_idАгент және субагент ағашын қайта құрастырады
Rendered input tokensКонтексттің қоңыраулар арасында қалай өсетінін көрсетеді
Cached and uncached inputҚайта пайдалануды жаңа контексттен бөледі
Output and reasoning tokensҚымбат генерация қадамдарын анықтайды
Tool result size and retained tokensКейінгі промпттарға қанша шикі дәлел кіретінін көрсетеді
Retry reason and attempt numberҚайталанатын сәтсіздіктерді анықтайды
Compaction tokens before and afterКонтексттің нақты қысқаруын өлшейді
Worker ID and returned tokensСубагент жұмысының қайталануын ашады
Accepted, rejected, or escalated resultҚұнды тапсырма сапасымен байланыстырады

Басты метрика болуы тиіс:

cost per successful task
= total workflow cost
/ accepted tasks

Арзанырақ іске қосу — егер ол көбірек сәтсіз тапсырмаға, құралдарды қайта шақыруға немесе адамдық түзетуге әкелсе — жақсарту емес.

Мәселені табуға көмектесетін төрт агентке тән метрика.

Контекст амплификациясы

context amplification
= cumulative input tokens
/ final-step input tokens

Мәннің жоғары болуы алдыңғы контексттің қайталанып өңделгенін көрсетеді.

Құрал нәтижелерін сақтау қатынасы

tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools

Жоғары қатынас агенттің қадамдар арасында тым көп шикі дәлелді көтеріп жүргенін көрсетуі мүмкін.

Қайта талпыныс салығы

retry tax
= retry and repair cost
/ total workflow cost

Ойлау үлесі

reasoning share
= reasoning-token cost
/ total model cost

Әр жұмыс жүктемесін бөлек өлшеңіз. Зерттеу, код жазу, браузер және қолдау агенттері ортақ бір базалық деңгейге ие болмауы керек.

AI агенттің токен шығынын азайтудың алты тәсілі

1. Толық орындауға бюджет орнатыңыз

Әр сұранысқа шығыс шектеуі көпқадамды агентті бақыламайды.

Мынау үшін іске қосу (run) деңгейінде шектер қойыңыз:

  • Жиынтық модель қадамдары
  • Жиынтық кіріс және шығыс
  • Құрал қоңыраулары және құрал-нәтиже көлемі
  • Сәтсіздік түрлері бойынша қайта талпыныстар
  • Субагенттер
  • Жалпы өткен уақыт немесе болжамды құн

Төмендегі провайдерге тәуелсіз Python мысалы әр модель шақыруының алдында іске қосуды бағалайды:

from dataclasses import dataclass
from enum import Enum


class Action(str, Enum):
    CONTINUE = "continue"
    COMPACT = "compact"
    STOP = "stop"


@dataclass(frozen=True)
class Budget:
    max_steps: int = 12
    max_input_tokens: int = 120_000
    max_output_tokens: int = 18_000
    compact_at: float = 0.80


@dataclass
class Usage:
    steps: int = 0
    input_tokens: int = 0
    output_tokens: int = 0


def evaluate_budget(usage: Usage, budget: Budget) -> Action:
    if (
        usage.steps >= budget.max_steps
        or usage.input_tokens >= budget.max_input_tokens
        or usage.output_tokens >= budget.max_output_tokens
    ):
        return Action.STOP

    input_ratio = usage.input_tokens / budget.max_input_tokens

    if input_ratio >= budget.compact_at:
        return Action.COMPACT

    return Action.CONTINUE

Әр модель сұранысының алдында тексеруді іске қосыңыз және Usage мәндерін провайдер ұсынған токен деректерінен жаңартыңыз.

Кіріс бюджеттің 80%-ына жеткенде күйді ықшамдаңыз немесе келесі құрал сұрауын тарылтыңыз. 100%-да құрылымды себеппен тоқтаңыз.

Жиі қателік: Әр жауапты шектеп, бірақ қадамдар, құралдар және қайта талпыныстар санын шектемеу.

2. Құрал нәтижелерін транскриптке қосар алдында сүзгіден өткізіңіз

Агенттің келесі шешіміне қажет дәлелдерді ғана қайтарыңыз.

Келесі қадамға тек бірнеше өріс керек болғанда, мына толықты қоспаңыз:

  • Веб-бет
  • Журнал файлы
  • Репозиторий ағашы
  • Деректер қорының жауабы
  • Терминал сессиясы
  • API жүктемесі

Іздеу құралы, мысалы, мынадай қайтаруы мүмкін:

{
  "source_id": "search_17",
  "title": "Relevant page title",
  "url": "https://example.com/page",
  "relevant_passage": "A short evidence block"
}

Толық артефактты промпттан тыс сақтаңыз да, кейін тарылтылған бөлігін ғана алыңыз.

Құрал-сүзгі ережесі: Келесі шешімге қажет өрістерді ғана қайтарыңыз — кейін керек болуы мүмкін барлық өрістерді емес.

Жиі қателік: JSON жүктемесінің алғашқы 1 000 таңбасын жай ғана қию. Бұл құрылымды бұзуы немесе агентке шынында қажет жазбаларды алып тастауы мүмкін.

Алдымен жүктемені талдаңыз, өрістерді құрылымдық түрде таңдаңыз, массивтерді шектеңіз, содан соң валид JSON етіп сериализациялаңыз.

3. Жай әңгіме мәтінін емес, жұмыс күйін ықшамдаңыз

Ықшамдау келесі әрекетке қажет ақпаратты сақтап, енді әсер етпейтін тарихты алып тастауы тиіс.

Пайдалы ықшам күй құрамында мыналар болады:

  • Пайдаланушы мақсаты және сәттілік критерийлері
  • Бұған дейін қабылданған шешімдер
  • Расталған фактілер және дереккөз ID-лары
  • Өзгертілген файлдар немесе жазбалар
  • Сәтсіз тәсілдер
  • Ашық сұрақтар
  • Келесі әрекет
  • Қауіпсіздік және шығыс шектеулері

Ол толық әңгімені қайта баяндамауы керек.

OpenAI ұзақ Responses API өзара әрекеттесулері үшін ықшамдауды құжаттайды. Anthropic ескі контентті тазартуға немесе қорытындылауға арналған контекст-менеджмент басқаруларын ұсынады. Бұл іске асырулар әртүрлі, сондықтан интеграция алдында ағымдағы провайдер өрістерін тексеріңіз.

Ықшамдау ережесі: Шешімдер мен аяқталмаған жұмысты сақтаңыз. Қайта алуға болатын баяндау мен дәлелдерді алып тастаңыз.

Жиі қателік: Дереккөз ID-ларын, өзгертілген файл аттарын, қабылданбаған тәсілдерді немесе шешілмеген шектеулерді түсіріп қалдыру.

Ықшамдауды енгізгеннен кейін агенттің іздеулерді немесе құрал қоңырауларын қайталайтынын өлшеңіз. Қысқа промпт — егер агент жоғалған күйді қайта құруға мәжбүр болса — арзан емес.

4. Қайта пайдаланылатын префиксті тұрақты ұстаңыз

Агент промпттары жиі үлкен қайта пайдаланылатын блоктарды қамтиды:

  • Жүйелік нұсқаулар
  • Құрал схемалары
  • Қауіпсіздік саясаттары
  • Шығыс форматтары
  • Ортақ анықтамалық материал
  • Репозиторий немесе өнім нұсқаулары

Осы тұрақты элементтерді сұранысқа тән деректердің алдына орналастырыңыз:

1. Жүйелік нұсқаулар
2. Саясаттар және шектеулер
3. Құрал анықтамалары
4. Тұрақты мысалдар
5. Ортақ анықтамалық материал
6. Сұранысқа тән деректер

Уақыт белгілерін, сұраныс ID-ларын, сессия деректерін немесе жиі өзгеретін мәндерді басына жақын орналастырмаңыз.

Кэштеу префикс ұзын, тұрақты және қайта пайдаланылатын кезде ең пайдалы. Ол қысқа сессиялар немесе жиі өзгеретін промпттар үшін ақша үнемдемеуі мүмкін.

Жиі қателік: Кэш-хит мөлшерін арттыруға тырысып, кэшке жазу, оқу немесе сақтау құнын өлшемеу.

Провайдер промпт кэштеуін, дәл жауап кэштеуін және семантикалық кэштеуді кең салыстыру үшін қараңыз: AI API құнын қалай азайтуға болады.

5. Қайта талпыныстардың сол бір контекстті қайталауына жол бермеңіз

Қайта талпыныс — көбіне дәл сол үлкен промптпен жасалатын тағы бір агент қадамы.

Сәтсіздіктің себебі өзгермейінше, сәтсіз сұранысты қайталамаңыз.

СәтсіздікДұрысы
Жарамсыз құрылымды шығысВалидация қатесін қайтарып, бір рет қайта көру
Құрал таймаутыИдемпотент операцияны бір рет қайталау, содан соң тоқтату не fallback
Контекст асып кетуіКүйді ықшамдау немесе азырақ дәлел алу
Қайталанатын құрал қоңырауыОперация хэші арқылы дедупликация
Рейт-лимитКейінге шегіну немесе алдын ала сыналған fallback маршруты
Төмен сенімділік нәтижесіЖетпейтін ақпаратты сұрау немесе эскалация

Төлемдер, e-mail, деплойменттер және ДҚ жазу сияқты жанама әсері бар операциялар үшін идемпотенттік кілттерді қолданыңыз.

Жиі қателік: Rate-limited модельді бірнеше рет қайталап, әр талпыныста толық агент контекстін қайта жіберу.

Қайта талпыныс салығын сәтсіздік түрлері бойынша бақылаңыз, осылайша команда ең үлкен циклді бірінші болып түзете алады.

6. Ойлау мен субагенттерді қажет қадамдарға ғана қолданыңыз

Әр агент қадамы терең ойлауды қажет етпейді.

Экстракция, форматтау, жіктеу, валидация және қарапайым құрал таңдау көбіне төмен ойлау күшін және ықшам құрылымды шығысты қажет етеді.

Жоғары ойлау күшін келесіге сақтаңыз:

  • Күрделі жоспарлау
  • Қиын код жазу
  • Көп құжатты синтез
  • Дау туғызатын шешімдер
  • Орындалуы сәтсіз болғаннан кейін қалпына келу

Ойлау ережесі: Қабылданған тапсырма мөлшерлемесін сақтайтын ең төмен ойлау күшін пайдаланыңыз.

Субагенттерге де анық шекара қажет. Әр жұмысшыға беріңіз:

  • Тар тапсырма
  • Тапсырмаға тән контекст бөлігі
  • Құралдар рұқсат тізімі
  • Токен бюджеті
  • Ықшам шығыс схемасы

Түбір агентке әдетте нәтижелер, дәлел ID-лары, сенім деңгейі және шешілмеген мәселелер керек — жұмысшының толық транскрипті емес.

Субагент ережесі: Қайталанатын контекстті емес, тәуелсіз жұмысты параллельдеңіз.

Жиі қателік: Тар тапсырма бермей тұрып, барлық түбір-агент тарихын әр жұмысшыға жіберу.

Алдымен қай оптимизацияны қолдану керек?

Агент телеметриясын пайдаланып, алғашқы араласуды таңдаңыз.

Төмендегі шектер — тергеу триггерлері, әмбебап стандарттар емес.

Бақыланған белгіАлдымен неден бастаңыз
Контекст амплификациясы жоғарыТарихты ықшамдаңыз және күйді іріктеп алыңыз
Құрал шығысы промптты басып тұрӨрістерді сүзгіден өткізіп, толық артефакттарды сыртта сақтаңыз
Қайта талпыныс салығы жоғарыВалидация, таймаут және қайталанатын құрал қоңырауларын түзетіңіз
Ойлау үлесі жоғарыҚарапайым қадамдарда ойлау күшін төмендетіңіз
Субагенттер бір дәлелді қайталайдыЖұмысшы көлемін және контекст бөліктерін тарылтыңыз
Кэштелген кіріс төменҚайта пайдаланылатын префиксті тұрақтандырыңыз
Цикл тазартудан кейін де құн жоғарыТөмен құны бар модель маршруттарын салыстырыңыз

Қауіпсіз іске асыру тізбегі:

  1. Жиынтық кірісті, құрал сақтауын, қайта талпыныстарды және ойлауды өлшеңіз.
  2. Қадамдар, құралдар, қайта талпыныстар және жиынтық токендер үшін қатты шектер қойыңыз.
  3. Үлкен құрал нәтижелерін сүзгіден өткізіңіз.
  4. Өлшенген шектен кейін ескі күйді ықшамдаңыз.
  5. Қайта пайдаланылатын промпт префиксін тұрақтандырыңыз.
  6. Агент циклі тазаланғаннан кейін ғана модель маршруттарын салыстырыңыз.

Бір уақытта бір ірі айнымалыны өзгертіп, сол бірдей бағалау жиынтығын қайта ойнатыңыз.

Салыстырыңыз:

  • Тапсырманы қабылдау мөлшерлемесі
  • Сәтті тапсырмаға шаққандағы құн
  • Жиынтық кіріс
  • Құрал қоңыраулары саны
  • Қайта талпыныс салығы
  • Ойлау үлесі
  • p50 және p95 кідіріс
  • Адамдық тексеру уақыты

Токен үнемдегенмен, тапсырма сапасын төмендететін немесе қажет дәлелдерді алып тастайтын өзгерістерді қайтарыңыз.

CometAPI арқылы агент жұмыс ағындарын тестілеңіз

Көпмодельді бағалауға кіріспес бұрын, CometAPI-дың баға беті мен құнын алдын ала бағалау нұсқаулығын пайдаланып, кіріс, шығыс, кэштелген токен және ойлау шығындарын бағалаңыз.

Содан кейін модель каталогын қолданып, қолайлы маршруттарды анықтаңыз және Жылдам бастау арқылы OpenAI-мен үйлесімді клиентті баптаңыз.

Өндірістік fallback үшін CometAPI модель fallback нұсқаулығын ұстанып, аяқталған құрал қоңырауларын қайталамай және расталған күйді тастамай маршруттарды ауыстырыңыз.

Біріктірілген қолжетімділік модельдерді салыстыру мен fallback интеграциясын жеңілдетеді. Дегенмен токен бюджеттері, ықшамдау, валидация, құрал сүзгілеу, қайта талпыныс шектеулері және қабылдау критерийлері қосымша деңгейінде қалуы керек.

ЖҚС

Неліктен агенттер чатботтарға қарағанда көп токен пайдаланады?

Агенттер бірнеше модель қоңырауларын жасайды және әр қадамда алдыңғы хабарламаларды, құрал нәтижелерін, нұсқауларды және аралық күйді қайта жібере алады. Бұл алдыңғы контексттің қайталап өңделуіне әкеледі.

Промпт кэштеу контекст-терезе пайдалануды азайта ма?

Жоқ. Промпт кэштеу қайталанатын кірістің тиімді бағасын немесе кідірісін төмендетеді, бірақ кэштелген токендер де өңделетін контексттің бір бөлігі болып қала береді. Промпт өлшемін азайту үшін ықшамдау, сүзгілеу немесе іріктеп алуды қолданыңыз.

Агент контекстті қашан ықшамдауы керек?

Контексттің өсуі құнға, кідіріске немесе қолжетімді шығыс кеңістігіне әсер ете бастағанға дейін ықшамдаңыз. Ықшам күй шешімдерді, дереккөз ID-ларын, өзгертілген файлдарды, ашық сұрақтарды және қауіпсіздік шектеулерін сақтайтынын растаңыз.

Субагенттер токен құнын азайта ма?

Автоматты түрде емес. Олар тәуелсіз жұмыс үшін өткен уақытты азайтуы немесе қамтуды жақсартуы мүмкін, бірақ қайталанатын контекст пен қабаттасқан талдау жиынтық токенді жиі арттырады.

AI агент құнын оңтайландыруға арналған ең жақсы метрика қандай?

Басты метрика ретінде сәтті орындалған тапсырмаға шаққандағы құнды қолданыңыз. Оны жиынтық кіріспен, контекст амплификациясымен, құрал сақтауымен, қайта талпыныс салығымен, ойлау үлесімен, кідіріспен және адамдық тексеру уақытымен диагностикалаңыз.

Оқуды жалғастыру

Осы мақаланы келесі шешіммен байланыстырыңыз.

Барлық тақырыптарды көру
Жарияланды Aug 5, 2026
Соңғы жаңарту Aug 24, 2026
16 көрілім
Түсініктілік, дереккөзге сілтеме және ағымдағы API терминологиясы бойынша тексерілді.

AI әзірлеу шығындарын 20%-ға қысқартуға дайынсыз ба?

Минуттар ішінде тегін бастаңыз. Тегін сынақ кредиттері қосылған. Банк картасы талап етілмейді.

Толығырақ оқу