TL;DR Официальные ставки API начинаются с $10 за миллион входных токенов и $50 за миллион выходных токенов, что в 2,5 раза превышает стандартную цену токенов для GPT-5.6 Sol.
GPT-6 Astra разработан для длительных рабочих процессов кодирования, работы в браузере, управления компьютером, исследований и агентных сценариев, где реальная стоимость часто определяется количеством повторных попыток, вызовами инструментов, ростом контекста, использованием кэша и вероятностью успешного завершения задачи моделью. OpenAI позиционирует Astra для самых сложных end-to-end задач, а не для дешевой высокообъемной инференции.
Есть и важный ценовой порог: как только запрос превышает 272K входных токенов, для всей операции применяются повышенные ставки Astra.
Нужно учитывать:
- Следите за размером контекста: пересечение 272K входных токенов меняет ставки для всего запроса.
- Учитывайте кэширование: повторяющиеся стабильные префиксы могут обходиться гораздо дешевле при успешном повторном использовании кэша.
- Выбирайте уровень обработки: Batch/Flex меняют немедленность на более низкие ставки; Fast добавляет наценку.
- Измеряйте результаты задач: включайте токены, инструменты, неудачные прогоны и время ручной корректировки в сравнение.
GPT-6 Astra — обзор цены
Таблица ставок разделяет обычный вход, чтение из кэша, запись в кэш и выход. Диапазоны контекста относятся к числу входных токенов; все цены указаны за миллион токенов.
Batch и Flex используют половину ставок Standard. Fast использует двойные относительно применимых ставок Standard. Эти режимы обслуживают разные потребности в задержке и доступности.
| Режим тарификации / контекст | Вход / 1M | Вход из кэша / 1M | Запись в кэш / 1M | Выход / 1M |
|---|---|---|---|---|
| Standard ≤272K | $10.00 | $1.00 | $12.50 | $50.00 |
| Standard >272K | $20.00 | $2.00 | $25.00 | $75.00 |
| Batch/Flex ≤272K | $5.00 | $0.50 | $6.25 | $25.00 |
| Batch/Flex >272K | $10.00 | $1.00 | $12.50 | $37.50 |
| Fast ≤272K | $20.00 | $2.00 | $25.00 | $100.00 |
| Fast >272K | $40.00 | $4.00 | $50.00 | $150.00 |
Возможно, самая важная цифра в этой таблице — это не $10 или $50. Это 272K.
Для подсказок свыше 272K входных токенов OpenAI применяет 2× ставки для входа/кэша и 1,5× для выхода ко всему запросу. Небольшое увеличение возле этой границы может, таким образом, привести к гораздо более сильному росту стоимости.
Что такое GPT-6 Astra?
GPT-6 Astra сочетает кодирование, исследование и взаимодействие с компьютером в одной модели. Её размер контекста, лимит вывода и поддерживаемые рабочие процессы объясняют, где ценовая надбавка может иметь значение.
| Официальные спецификации API | Значение |
|---|---|
| Developer | OpenAI |
| Model ID | gpt-6-astra |
| Context window | 1,050,000 tokens |
| Maximum output | 128,000 tokens |
| Knowledge cutoff | April 30, 2026 |
| Input modalities | Text and images |
| Output modality | Text |
| Reasoning levels | Low, Medium, High, XHigh, Max |
| Recommended API | Responses API for tool-rich workflows |
| Fine-tuning | Not supported |
| Long-context pricing threshold | More than 272K input tokens |
Окно контекста на 1,05M токенов особенно важно для цены. Astra может поглощать очень большие репозитории, документы, истории инструментов и исследовательские материалы, но агрессивное использование доступного окна контекста не означает, что это экономически оптимально.
Асинхронные вызовы инструментов и управление в середине хода поддерживают более длинные рабочие процессы наряду с использованием компьютера, кэшированием подсказок, оркестрацией нескольких агентов и уплотнением. Поддержка на уровне модели не означает, что каждый провайдер раскрывает каждый инструмент или функцию.
Сколько стоит GPT-6 Astra через CometAPI?
CometAPI в настоящее время предлагает доступ к API GPT-6 Astra с тарифами на короткий и длинный контекст на 20% ниже соответствующих официальных ставок.
- Короткий контекст: CometAPI указывает $8/M для входа и $40/M для выхода против $10/M и $50/M у OpenAI.
- Длинный контекст: CometAPI указывает $16/M для входа и $60/M для выхода против $20/M и $75/M у OpenAI.
- Кэш: ставки чтения/записи короткого контекста — $0.80/M и $10/M; для длинного контекста — $1.60/M и $20/M.
- Разница: заявленные ставки CometAPI на 20% ниже соответствующих ставок OpenAI в каждой категории. Подтверждайте текущие ставки перед бюджетированием в проде.
Для предыдущего примера с 100K входа и 10K выхода:
OpenAI: 100K × $10/M + 10K × $50/M = $1.50
CometAPI: 100K × $8/M + 10K × $40/M = $1.20
Экономия на запрос: $0.30
На 10,000 эквивалентных запросов упрощённая разница составит $3,000.
Для нагрузки с 300K входа и 20K выхода (длинный контекст):
OpenAI: 300K × $20/M + 20K × $75/M = $7.50
CometAPI: 300K × $16/M + 20K × $60/M = $6.00
Экономия на запрос: $1.50
Цены API и правила биллинга могут меняться. Для продового бюджетирования используйте текущую ставку CometAPI для активной модели и рабочей нагрузки.
Процентная разница проста, но большие агентные рабочие нагрузки усиливают её абсолютное влияние, поскольку один запрос может потреблять сотни тысяч входных токенов.
Что стоит GPT-6 Astra сверх токенов модели?
Для традиционной генерации текста входные и выходные токены доминируют в расчёте стоимости. Для агентов Astra это может быть лишь часть счета.
OpenAI взимает отдельную плату за инструменты веб- и file-search. Веб-поиск стоит $10 за 1,000 вызовов, при этом извлечённое содержимое также тарифицируется по ставкам токенов модели. Вызовы file-search стоят $2.50 за 1,000, а хранение — $0.10/GB/день после бесплатной квоты 1 GB.
Hosted Shell и Code Interpreter имеют отдельные сборы за контейнеры: ставка за 1 GB — $0.03 за 20-минутную сессию на контейнер. Подходящие сессии тарифицируются поминутно с минимальными пятью минутами. Более крупные объёмы памяти имеют более высокие ставки.
Контент, генерируемый инструментами, также может увеличивать потребление токенов. Агент для браузера или использования компьютера может неоднократно добавлять скриншоты, страницы, вывод терминала, извлечённые документы и истории инструментов в контекст. Даже если каждое отдельное действие недорого, накапливаемая история может подтолкнуть следующий запрос модели за порог 272K Astra.
Это означает, что производственный бюджет должен отслеживать как минимум: токены модели + активность кэша + вызовы инструментов + hosted-исполнение + ретраи + общее число шагов + долю успешно выполненных задач.
Чем более автономен рабочий процесс, тем меньше полезна цена за миллион токенов как самостоятельный KPI.
Влияет ли «усилие рассуждения» на стоимость GPT-6 Astra?
Уровень рассуждения не выделен отдельной строкой в опубликованной таблице ставок токенов. Он всё же может косвенно менять общие затраты: более глубокое рассуждение может породить больше выходных токенов, расширить использование инструментов или удлинить траекторию агента, в то время как лучшие решения могут снизить число повторных попыток и ручной корректировки. Сравнивайте настройки рассуждения на одном наборе задач и отчетно фиксируйте суммарные токены модели, плату за инструменты, долю завершений и время исправлений.
Сколько производительности вы покупаете?
Сравнение цен неполно без понимания, что именно покупается за более высокую ставку.
OpenAI сообщает о существенных улучшениях в агентных и технических оценках. Проценты ниже — результаты, заявленные вендором, а не независимые измерения; прочерк означает отсутствие отчётного результата.
| Официальные бенчмарки (%) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| AutomationBench | 41.4 | 18.1 | 31.4 | — |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| Terminal-Bench Science 0.1 | 64.6 | 22.4 | 52.6 | — |
| FrontierMath Tier 4 (v2) | 97.6 | 83.0 | 87.8 | — |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
| ExploitBench | 100.0 | 78.5 | — | — |
В офлайн-оценке OSWorld 2.0 от OpenAI Astra набрала 72.6% против 65.7% у GPT-5.6 Sol. Моделирование задержки оценило около 40 против 75 минут на задачу. Эти тайминги описывают условия оценки, а не общую гарантию по задержке.
Это важно экономически.
Модель, стоящая в 2,5 раза дороже на токен, не обязательно стоит в 2,5 раза дороже за завершённую задачу, если она использует меньше шагов, требует меньше повторных попыток, завершает сценарии быстрее или избавляет от эскалации к человеку-оператору.
В то же время Astra не автоматически лучшая по соотношению цены и ценности для каждой задачи. Надбавка легче оправдывается там, где её агентные преимущества действительно влияют на завершение задач.
Порог 272K меняет экономику
Самая легко упускаемая часть цены GPT-6 Astra — это то, что происходит при пересечении 272K входных токенов.
Рассмотрим несколько упрощённых запросов уровня Standard без кэширования и дополнительных сборов за инструменты.
| Нагрузка | Вход | Выход | Диапазон тарифов | Оценочная стоимость OpenAI |
|---|---|---|---|---|
| Небольшая задача по коду | 20K | 2K | ≤272K | $0.30 |
| Большой анализ | 100K | 10K | ≤272K | $1.50 |
| Агент у порога | 270K | 10K | ≤272K | $3.20 |
| Чуть крупнее | 280K | 10K | >272K | $6.35 |
| Масштаб репозитория | 300K | 20K | >272K | $7.50 |
Пример с 270K токенов стоит:
270K × $10/M + 10K × $50/M = $3.20
Увеличьте вход всего на 10K токенов — и запрос переходит в тарифы длинного контекста:
280K × $20/M + 10K × $75/M = $6.35
Вход вырос примерно на 3.7%, но общая стоимость запроса увеличилась почти на 98%.
Это делает управление контекстом важным механизмом контроля стоимости для агентов Astra. Вместо непрерывного добавления каждого результата инструментов, файла, скриншота и хода диалога производственные агенты могут суммаризировать старое состояние, извлекать только релевантные файлы, изолировать стабильный контекст для кэширования и запускать отдельные подагенты для независимых задач.
С Astra оптимизация токенов — это не только сокращение их количества. Это также удержание на более дешёвой стороне ценовой границы.
Как кэширование подсказок меняет стоимость входа GPT-6 Astra
Для запросов Standard в диапазоне короткого контекста обычный вход стоит $10/M, чтение из кэша — $1/M, а запись в кэш — $12.50/M. Более низкая ставка чтения применяется только когда повторно используемый префикс успешно обслуживается из кэша.
Успешные чтения из кэша стоят одну десятую от обычного входа, в то время как записи имеют свою ставку. Повторное использование зависит от того, сохранится ли соответствующий кэшированный префикс. Измеряйте записи и попадания отдельно, а не считайте каждый повтор префикса хитом кэша.
Рассмотрим десять гипотетических запросов, каждый из которых включает один и тот же префикс на 100K токенов и остаётся в пределах 272K общих входных токенов. Сравним две контролируемые ситуации: без кэширования и один раз полная запись префикса в кэш, за которой следуют девять успешных полных чтений префикса из кэша без дополнительных записей.
| Стоимость повторяющегося префикса для десяти запросов | Без кэширования | Одна запись + девять чтений |
|---|---|---|
| Обычный вход для префикса | 10 × 100K × $10/M = $10.00 | $0.00 |
| Запись префикса в кэш | $0.00 | 100K × $12.50/M = $1.25 |
| Чтения префикса из кэша | $0.00 | 9 × 100K × $1/M = $0.90 |
| Итого лишь по повторяющемуся префиксу | $10.00 | $2.15 |
Область применения цифры 78.5%:
снижение с $10.00 до $2.15 относится только к стоимости входа повторяющегося префикса в примере с одной записью и девятью попаданиями выше. Это не оценка типичных
сбережений или 78.5% сокращения всего счета API.
Чтобы включить выход, допустим, каждый из десяти запросов также генерирует 2,000 тарифицируемых выходных токенов. При $50/M выход добавляет $1.00 к совокупной стоимости каждого сценария. При отсутствии другого входа или сборов общие суммы по токенам модели составляют $11.00 без кэширования и $3.15 с кэшированием, сокращение около 71.4%. Дополнительный вход, промахи/перезаписи кэша, инструменты и различные уровни обработки снова изменят итог.
Оценивайте экономию исходя из измеренных записей в кэш и успешных чтений вместе с остальными расходами. Большой повторно используемый префикс может снизить расходы на вход, но его влияние на итоговую стоимость зависит от доли счета, которую этот префикс представляет.
GPT-6 Astra против Claude Fable 5.1: одинаковая базовая цена, разная экономика кэша
Claude Fable 5.1 имеет базовые ставки $10/M для входа и $50/M для выхода, совпадающие с ценами Astra в Standard для короткого контекста.
Заголовочные цены, таким образом, совпадают, но кэш — нет.
| Измерение стоимости | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Вход / 1M | $10.00 | $10.00 |
| Выход / 1M | $50.00 | $50.00 |
| Чтение кэша / 1M | $1.00 | $0.25 |
| Запись в кэш / 1M | $12.50 | $12.50 (5-minute cache) |
| Окно контекста | 1.05M | 1M |
| Terminal-Bench 4.0 | 57.9 | 55.8 |
| AutomationBench | 41.4 | 31.4 |
Ставка Fable на чтение кэша $0.25/M в четыре раза ниже ставки Astra $1/M для короткого контекста. Ставка записи на 5 минут у Fable совпадает с $12.50/M у Astra; опция записи на 1 час у Fable стоит $20/M.
Для крайне повторяющихся нагрузок, доминируемых кэшированными префиксами, Fable может иметь лучшую экономику по входу, даже если обе модели показывают одинаковые заголовочные $10/$50. Для задач инженерии ПО и автоматизации с высоким использованием инструментов более сильные результаты Astra на выбранных агентных бенчмарках могут компенсировать недостаток по кэшу.
Равные цены на вход и выход не означают равную стоимость рабочей нагрузки. Время жизни кэша, доля попаданий, генерируемый выход и успешность задач нужно сравнивать вместе.
GPT-6 Astra против GPT-5.6 Sol: оправдана ли 2.5× цена токена?
GPT-5.6 Sol стоит $4/M для входа и $20/M для выхода в Standard для короткого контекста, против $10/M и $50/M у Astra. Таблица отделяет разницу ставок от различий в возможностях.
| Официальное сравнение моделей | GPT-6 Astra | GPT-5.6 Sol | Разница |
|---|---|---|---|
| Вход / 1M | $10 | $4 | Astra 2.5× |
| Выход / 1M | $50 | $20 | Astra 2.5× |
| Кэшированный вход / 1M | $1 | $0.40 | Astra 2.5× |
| Контекст | 1.05M | 1.05M | Same |
| Max output | 128K | 128K | Same |
| AutomationBench | 41.4 | 18.1 | Astra +23.3 pts |
| Terminal-Bench 4.0 | 57.9 | 37.3 | Astra +20.6 pts |
| OSWorld | 72.6 | 65.7 | Astra +6.9 pts |
Если две модели использовали бы ровно одинаковое число токенов и одинаково часто добивались успеха, Sol был бы явно дешевле.
Чисто по ценам на токены Astra нужна примерно 40% от эквивалентного объёма тарифицируемой работы Sol, чтобы нивелировать 2.5× разницу ставок.
Но автономные рабочие процессы ведут себя не столь чисто. Неудачная попытка за $1, за которой следует ещё одна попытка за $1, стоит больше, чем запрос за $1.50, который сразу успешен. То же верно, когда более слабая модель вызывает больше вызовов инструментов, более длинные траектории, ручную проверку или повторное исполнение кода.
OpenAI сообщает, что Astra даёт более сильные результаты с меньшим количеством выходных токенов и более низкой оценочной стоимостью API на задачу в нескольких оценках, несмотря на более высокую цену за токен.
Для обычного чата, переписывания, извлечения, классификации и других прямолинейных задач этот аргумент куда слабее.
GPT-6 Astra против Gemini 3.8 Flash: совершенно иная ценовая категория
Gemini 3.8 Flash занимает более низкий ценовой уровень. Промо-ставка Google — вход $0.75/M и выход $3.75/M до 31 декабря 2026 года.
Это делает Astra примерно в 13.3× дороже по обоим направлениям — некэшированному входу и выходу — в Standard при коротком контексте.
| Измерения для сравнения | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash (pricing) |
|---|---|---|---|---|
| Вход / 1M | $10.00 | $4.00 | $10.00 | $0.75* |
| Выход / 1M | $50.00 | $20.00 | $50.00 | $3.75* |
| Кэшированный вход / 1M | $1.00 | $0.40 | $0.25 | $0.075* |
| Контекст | 1.05M | 1.05M | 1M | 1,048,576 |
| Max output | 128K | 128K | 128K | 65,536 |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
Цены Gemini в таблице — промо до
. С 1 января 2027 года ставки вход/выход составят $1.50/$7.50 за миллион токенов, а чтение кэша — $0.15/M.
Хранение кэша тарифицируется отдельно
по $0.50/M tokens/hour в 2026 году и $1/M tokens/hour с января 2027 года. Показанные цены OpenAI — режим Standard для короткого контекста.
Это сравнение иллюстрирует, почему маршрутизация моделей может быть эффективнее, чем выбор одной модели для каждого запроса. Использование Astra для самых сложных задач уровня репозитория или автоматизации и маршрутизация типовых высокообъёмных запросов на более дешёвую модель может дать лучший общий профиль затрат, чем «Astra везде» или «никогда не использовать Astra».
Стоимость GPT-6 Astra по уровням обработки: Standard против Batch, Flex и Fast
Режимы обработки GPT-6 Astra могут менять счёт так же сильно, как и выбор модели.
Для запроса с 300K входа и 20K выхода применяются ставки длинного контекста.
| Режим обработки | Стоимость входа | Стоимость выхода | Итого |
|---|---|---|---|
| Batch/Flex | $3.00 | $0.75 | $3.75 |
| Standard | $6.00 | $1.50 | $7.50 |
| Fast | $12.00 | $3.00 | $15.00 |
Таким образом, Batch/Flex вдвое сокращает упрощённый счёт за токены по сравнению со Standard, в то время как Fast удваивает его.
Batch/Flex уместен, когда время завершения гибкое, например, при оценочных прогонах, обогащении данных, офлайн-анализе репозиториев, бэкфилах документов и асинхронных исследовательских задачах.
Standard — естественная базовая настройка для интерактивных продовых нагрузок, где ни минимальная цена, ни максимальная скорость не доминируют.
Fast может быть полезен, когда общее время имеет измеримую бизнес-ценность. OpenAI описывает до 2× более быстрое выполнение Astra по двойной относительно применимой ставке. Astra Fast не имеет SLA по задержке и недоступен при хранении данных в ЕС.
Лучший уровень — это бизнес-решение, а не просто настройка производительности.
Лучшая метрика — стоимость на успешную задачу
Рассмотрим двух гипотетических кодовых агентов.
Предположим, Агент A использует более дешёвую модель, стоит $0.80 за попытку и успешен с вероятностью 55%; Агент B использует Astra, стоит $1.40 за попытку и успешен с вероятностью 90%. Для этой иллюстрации только: попытки независимы, каждая повторная попытка имеет ту же стоимость и вероятность успеха, а ретраи продолжаются до успеха.
При этих предположениях ожидаемая стоимость модели на одну успешную задачу — это стоимость попытки, делённая на вероятность успеха:
Агент A: $0.80 / 0.55 ≈ $1.45
Агент B: $1.40 / 0.90 ≈ $1.56
Точное соотношение делает Агента B примерно на 6.9% дороже, или около 7%. Этот пример не показывает, что Astra экономит деньги; он показывает, почему кратная ставка за токены не равна кратной стоимости за успех.
Формула уже учитывает повторные попытки, поэтому не добавляйте вторую «подушку» на ретраи. Ручная проверка, инструменты и накладные на исполнение могут изменить сравнение, если их измерять отдельно. Реальные отказы также могут быть скоррелированы, что делает эту простую модель непригодной для некоторых процессов.
Для реальной оценки разделите все расходы на модель и инструменты по тестовому набору на число принятых результатов, затем отдельно укажите время исправлений и нерешённые отказы. Используйте это наблюдаемое значение, чтобы решить, какие задачи оправдывают Astra.
Как снизить стоимость API GPT-6 Astra
- Держите типовые запросы ниже 272K входных токенов, когда это возможно, чтобы небольшой рост контекста не активировал тарифы длинного контекста для всего запроса.
- Проектируйте стабильные префиксы подсказок для кэширования. System-инструкции, карты репозитория, политики, схемы и статическая документация — лучшие кандидаты в кэш, чем многократно реконструируемые подсказки.
- Используйте маршрутизацию моделей. Резервируйте GPT-6 Astra для запросов, чья сложность действительно выигрывает от неё, а предсказуемые извлечения, суммаризацию, лёгкое кодирование и классификацию направляйте на менее дорогие модели.
- Выбирайте подходящий уровень обработки. Batch или Flex могут вдвое снизить ставки по токенам для нагрузок без требований к немедленному результату.
- Измеряйте полные траектории агента. Оптимизация, убирающая 20% токенов, но увеличивающая долю неудачных прогонов, может сделать систему дороже, а не дешевле.
- Активно управляйте историей через суммаризацию, извлечение, scoped-подагентов и выборочное сохранение результатов инструментов, чтобы рост контекста не стал скрытой ценовой проблемой.
FAQ
Дороже ли Astra других моделей?
Её ставки Standard для короткого контекста в 2.5× выше, чем у Sol, и совпадают с заголовочными ставками Fable для входа/выхода. Gemini Flash находится в более низком ценовом уровне. Сравнения выше показывают, почему использование кэша и стоимость принятой задачи могут менять практический рейтинг.
Платит ли малый запрос за всё окно контекста?
Нет. Счёт отражает обработанные токены. Диапазон длинного контекста применяется, когда вход превышает 272,000 токенов; простого выбора модели с большим окном недостаточно, чтобы активировать этот диапазон.
Как оценить экономию с CometAPI?
Применяйте соответствующие ставки провайдера для входа, выхода, чтения кэша и записи кэша к одной и той же композиции токенов. Заявленная разница 20% относится к этим категориям; добавляйте любые другие сборы отдельно перед сравнением итоговых счетов.
Заключение
Цена Astra легче всего оправдывается, когда её возможности улучшают сложный рабочий процесс настолько, что компенсируют более высокие ставки. Начните с репрезентативного теста, измерьте принятые результаты и сравните общие расходы и время исправлений с подходящим базовым уровнем.
Держите рост контекста под контролем, проектируйте повторно используемые префиксы для кэширования и выбирайте уровень обработки, соответствующий требованиям по задержке. Используйте GPT-6 Astra в CometAPI, когда её опубликованные ставки и доступные функции соответствуют нагрузке.
