TL;DR
GPT-6.1 Sol — это не модель с бо́льшим контекстом и не более дорогая замена GPT-6 Sol. Она сохраняет то же окно контекста в 1,05 млн токенов, максимум вывода 128K и стандартные цены API $2/$10, одновременно улучшая кодирование, работу с компьютером, профессиональные процессы, фактическую надежность и поведение агентов. Самое явное ценовое изменение — кэширование подсказок: стоимость кэшированного ввода снизилась с $0.20 до $0.10 за 1 млн токенов.
Практический результат в том, что GPT-6.1 Sol — это меньше про изменение формы API и больше про получение существенно более полезной работы примерно за тот же бюджет токенов.
Ключевые выводы
- GPT-6.1 Sol — апгрейд возможностей GPT-6 Sol с тем же контекстным окном на 1 050 000 токенов и потолком вывода 128 000 токенов.
- Стандартные цены API на ввод/вывод остаются $2/М и $10/М; кэшированный ввод снижается с $0.20/М до $0.10/М.
- Официальные оценки показывают более сильные кодирование, работу с компьютером, бизнес-автоматизацию и научные процессы; результаты зависят от бенчмарка и режима рассуждений.
- Миграция требует проверки уровня усилий на рассуждения и совместимости конечной точки API: GPT-6.1 Sol ничего не убирает и требует Responses API для вызова инструментов.
- Перед заменой стабильного деплоя GPT-6 Sol валидируйте успех задач, задержку, фактические попадания в кэш и сквозную стоимость.
Что такое GPT-6.1 Sol и почему он появился так скоро после GPT-6 Sol?
OpenAI представила GPT-6 Sol 22 сентября 2026 года. Неделей позже, 29 сентября, в дополнении к системной карте был анонсирован GPT-6.1 Sol. OpenAI позиционирует новый релиз как апгрейд GPT-6 Sol, а не как отдельный ценовой уровень.
Короткий интервал релиза важен, потому что GPT-6.1 Sol не позиционируется как новый продуктовый уровень. OpenAI сохранила ценовой уровень Sol и сосредоточила обновление на сложных задачах, эффективности затрат и надежности агентов.
OpenAI позиционирует GPT-6.1 Sol вокруг агентного кодирования, компьютерного использования и профессиональной работы. Важное сравнение — успех задачи при заданной стоимости, а не только название модели. Официальное резюме бенчмарков ниже разделяет рост возможностей от неизменных спецификаций API.
Это делает сравнение необычно прямым: GPT-6.1 Sol — прежде всего апгрейд возможностей и эффективности, а не увеличение контекста или базовой цены.
GPT-6.1 Sol vs. GPT-6 Sol: что остается прежним?
Обе модели сохраняют одинаковую заявленную емкость, поддерживаемые модальности ввода/вывода и стандартные цены на ввод/вывод. Таблица также фиксирует отличия в датах отсечения знаний, опциях рассуждений, вызове инструментов и ставках для кэшированного ввода; эти отличия не следует путать с общими спецификациями.
Общие спецификации и различия совместимости
| Specification | GPT-6.1 Sol | GPT-6 Sol |
|---|---|---|
| Model ID | gpt-6.1-sol | gpt-6-sol |
| Release date | 29 сент. 2026 | 22 сент. 2026 |
| Context window | 1,050,000 tokens | 1,050,000 tokens |
| Maximum output | 128,000 tokens | 128,000 tokens |
| Knowledge cutoff | 30 апр. 2026 | 20 апр. 2026 |
| Text input / output | Yes / Yes | Yes / Yes |
| Image input | Yes | Yes |
| Standard input price | $2.00 / 1M | $2.00 / 1M |
| Cached input | $0.10 / 1M | $0.20 / 1M |
| Cache write | $2.50 / 1M | $2.50 / 1M |
| Output price | $10.00 / 1M | $10.00 / 1M |
| Reasoning effort | low, medium, high, xhigh, max | none, low, medium, high, xhigh, max |
| Structured outputs | Yes | Yes |
| Function calling | Yes через Responses API; недоступно через Chat Completions | Yes через Responses API; Chat Completions только с reasoning_effort=none |
| Fine-tuning | No | No |
| Audio / video input | Not supported | Not supported |
| Native image output | Not supported; image generation is a separate tool | Not supported; image generation is a separate tool |
Две официальные колонки выше фиксируют одинаковые лимиты контекста и вывода. Эти цифры описывают емкость; они не гарантируют равную точность извлечения или задержку для каждой длинноконтекстной нагрузки.
Отсечение знаний немного сдвигается — с 20 до 30 апреля 2026 года. Более важно, что GPT-6.1 Sol больше не поддерживает reasoning.effort="none"; доступные настройки начинаются с low.
Для разработчиков, зависящих от минимальной задержки, эта деталь совместимости заслуживает тестирования, поскольку GPT-6 Sol все еще поддерживает режим reasoning none.
Архитектура: что остается нераскрытым
Ни одна из страниц моделей, использованных в этом сравнении, не предоставляет количества параметров или подробной разбивки архитектуры. Официальное дополнение к системной карте говорит, что GPT-6.1 Sol использует те же типы данных и обучения, что и Astra; это не доказывает, что Sol и Astra имеют идентичные архитектуры. Следовательно, различия архитектуры и масштаба параметров в процитированных материалах не раскрываются.
Базовое ценообразование неизменно; кэшированные чтения дешевле
Для обычных некэшированных токенов — да, ставки не изменились. Стандартные цены на ввод и вывод неизменны. Основное ценовое улучшение — кэшированный ввод.
| Official API pricing — USD per 1M tokens | GPT-6.1 Sol | GPT-6 Sol |
|---|---|---|
| Input / 1M tokens | $2.00 | $2.00 |
| Cached input / 1M | $0.10 | $0.20 |
| Cache write / 1M | $2.50 | $2.50 |
| Output / 1M tokens | $10.00 | $10.00 |
GPT-6.1 Sol снижает стоимость кэшированного ввода до $0.10 за 1 млн токенов, то есть до 5% от ставки некэшированного ввода.
Например, повторное использование 100 млн кэшированных токенов ввода будет стоить около $10 на GPT-6.1 Sol против $20 на GPT-6 Sol. Для разовых подсказок разница скромна, но для высокообъемных агентов со стабильными префиксами подсказок она уже заметна.
Также действуют официальные условия ценообразования, указанные в документации модели: запросы свыше 272K токенов ввода используют двукратные ставки на ввод и кэш и 1.5-кратную ставку на вывод для всего запроса. Режим Fast — 2× Standard; Batch и Flex — на 50% ниже Standard. Региональная обработка добавляет 10% премию, где доступно, а режим Fast недоступен при хранении данных в ЕС. Могут применяться отдельные тарифы на инструменты. Планируйте бюджет с учетом выбранного режима, региона и фактических попаданий в кэш.
Что улучшилось в GPT-6.1 Sol?
Апгрейд лучше всего оценивать по кодированию, агентным процессам, профессиональным документам, науке, фактической точности и восстановлению после сбоев. Ниже улучшения сгруппированы с сохранением исходных условий и ограничений бенчмарков.
Обзор бенчмарков: заявленные выигрыши и условия оценок
Сильнейший довод в пользу GPT-6.1 Sol — результативность на уровне задач, а не «сырые» спецификации. OpenAI сообщает об улучшениях в программной инженерии, бизнес-автоматизации, компьютерном взаимодействии, научных процессах, фактической точности и выравнивании поведения агента.
| Official benchmark / evaluation results | GPT-6.1 Sol vs. GPT-6 Sol | Что это означает |
|---|---|---|
| DeepSWE v1.1 | +6.4 п.п. сверх лучшего результата GPT-6 Sol при более низком уровне рассуждений и меньшей стоимости задачи; это несопоставление по усилиям | Сильнее в долгих задачах софт-инжиниринга |
| AutomationBench 1.0.6 | +4.8 п.п. при medium у обеих Sol; +2.2 п.п. относительно Opus 5.5 при medium | Лучшая многосоставная бизнес-автоматизация |
| OSWorld 2.0 offline | +7 п.п. при max; частичное вознаграждение на офлайн-наборе, релиз v2026.08.08; менее чем половина стоимости задачи | Лучшая работа с компьютером |
| Terminal-Bench Science 0.1 | Более чем в 2 раза выше результата GPT-6 Sol при max с менее чем половиной стоимости на задачу | Большой прирост в научных агентных процессах |
| Сложные фактические проверки | На low доля ответов с ошибками снижается с 11.4% до 7.7%; это выбранная оценка для трудных подсказок | Меньше фактических ошибок на сложных подсказках |
| Broken-search alignment test | При максимуме доля недекларирования сломанного поиска падает с 4.9% до 2.1%; намеренно адвесариальные задачи | Лучше распознает сбои инструментов |
Это результаты, заявленные OpenAI, а не независимые измерения CometAPI. OpenAI оценивала модели в своей среде исследований или через свой API; поведение в продакшене может отличаться из‑за системных подсказок и доступных инструментов. Показатели конкурентов взяты из публичных отчетов. Стоимость задачи отражает протестированную конфигурацию и не равна цене токенов. Нераскрытые детали, такие как бюджеты на запуск или «лесенки», не стоит домысливать.
Официальный результат в таблице сравнивает GPT-6.1 Sol при более низком усилии рассуждений с лучшим результатом GPT-6 Sol. Это нельзя описывать как контролируемое сравнение скорости при равных усилиях. DeepSWE v1.1 оценивает оригинальные, долгие задачи софт-инжиниринга в реальных репозиториях.
Для контекста: исходный релиз GPT-6 Sol сообщал 68.8% на максимальном усилии на DeepSWE v1.1.
Кодирование: более сильная долгосрочная программная инженерия
Кодирование — возможно, самое очевидное улучшение. DeepSWE v1.1 оценивает агентов на оригинальных задачах в реальных кодовых базах, требующих устойчивой, многошаговой работы.
Улучшение DeepSWE, резюмированное выше, релевантно, когда агент должен инспектировать репозиторий, планировать изменения, использовать инструменты и исправлять сбои в течение многих шагов. Разработчики могут сравнить это улучшение с GPT-6 Astra API в CometAPI, решая, оправдывают ли самые сложные задачи более дорогую модель.
Это важнее кратких кодовых бенчмарков, потому что долго работающие кодовые агенты накапливают стоимость за счет повторных рассуждений, вызовов инструментов, чтений файлов, патчей и повторного использования контекста. GPT-6.1 Sol улучшает и завершение задач, и экономику повторного контекста без повышения стандартной ставки $2/$10 за токены.
GPT-6 Sol API в CometAPI по‑прежнему полезен для существующих деплоев и обеспечивает совместимый с OpenAI путь для кодовых и агентных нагрузок.
AI-агенты и бизнес-процессы: автоматизация и работа с компьютером
Да, и улучшение выходит за рамки кодирования. AutomationBench оценивает, может ли агент завершать сквозные процессы, используя множество инструментов в продажах, маркетинге, операциях, поддержке, финансах и HR.
Сопоставленный по medium результат AutomationBench релевантен инструментально-насыщенным бизнес-процессам. Он остается бенчмарком, а не гарантией успеха в собственном наборе инструментов компании. Сравнение также включает Claude Opus 5.5 API в CometAPI; оценивайте всех кандидатов с одними и теми же инструментами и критериями принятия, прежде чем выбирать.
Для компьютерного использования результат OSWorld выше использует офлайн-набор и частичное вознаграждение. Более высокий балл по частичному вознаграждению не обязательно означает, что каждая задача завершена энд‑ту‑энд. Состояние браузера, разрешения, поведение восстановления и качество интеграции инструментов по‑прежнему влияют на результаты деплоя.
Профессиональные документы и наука: расширенные сложные задачи
GPT-6.1 Sol также продвигает уровень Sol дальше в профессиональную интеллектуальную работу. OpenAI оценивает понимание сложных документов с GDP.pdf, где модели отвечают на реалистичные вопросы на основе PDF с таблицами, диаграммами, схемами, плотным форматированием и мелкими примечаниями в областях, включая финансы, здравоохранение и право.
GDP.pdf добавляет свидетельства профессионального анализа PDF сверх обычного текстового вопрос-ответа. Воспринимайте результат в анонсе как оценку понимания документов, а не гарантию, что каждая диаграмма, сноска или отсканированная страница будет интерпретирована безошибочно.
Результат Terminal-Bench Science в официальном резюме охватывает процессы вроде анализа данных, симуляций и доказательства теорем. Полезная локальная оценка должна оценивать корректность и воспроизводимость финального вывода, одновременно измеряя суммарную стоимость инструментов и модели.
Это не означает, что GPT-6.1 Sol универсально заменяет Astra. OpenAI продолжает позиционировать Astra как свою наиболее способную модель для самых сложных сквозных задач. Важное изменение — разрыв в производительности между Sol и Astra сокращается, тогда как разрыв в ценах на токены остается большим.
Фактичность и надежность агентов: меньше ошибок и лучшее обработка сбоев
Данные OpenAI указывают в эту сторону, хотя оценку не следует интерпретировать как универсальную «ставку галлюцинаций».
Официальный анонс напрямую сообщает о улучшении фактичности на low: доля ответов с ошибками падает с 11.4% у GPT-6 Sol до 7.7% у GPT-6.1 Sol — снижение на 3.7 п.п., или примерно на 32% в относительном выражении. Эти выбранные диалоги ранее провоцировали ошибки; цифры не являются универсальной ставкой галлюцинаций.

Исходная диаграмма выше извлечена напрямую из PDF системной карты OpenAI без перерисовки. Она отображает выбранные оценки сложных диалогов против имитированной задержки; две панели измеряют любые галлюцинации и устойчивость заявленной проблемы. Это не следует читать как оценку ошибок в продакшене.
| Model | Broken-search Failure Rate — maximum effort |
|---|---|
| GPT-6.1 Sol | 2.1% |
| GPT-6 Sol | 4.9% |
| GPT-6 Astra | 1.5% |
| GPT-6 Luna | 28.7% |
GPT-6 Luna API в CometAPI — еще один вариант, ориентированный на стоимость, но его результат по сломанному поиску здесь иллюстрирует, почему агента нужно тестировать на обработку сбоев, а не только на успешное выполнение инструментов.
Это намеренно адвесариальные оценки, а не репрезентативные продакшен-показатели сбоев. Они полезны как свидетельство того, что GPT-6.1 Sol лучше распознает недоступность или поломку инструментов вместо уверенного продолжения с неподдерживаемыми утверждениями.
GPT-6.1 Sol vs. GPT-6 Sol: стоит ли обновляться?
Для нового сложного процесса GPT-6.1 Sol — сильный кандидат на оценку. Для стабильного деплоя GPT-6 Sol обновляйтесь только тогда, когда измеренные выгоды оправдывают миграцию. Общий лимит контекста и базовые цены на токены позволяют корректно сравнивать, но публичные бенчмарки не решают, станет ли ваше приложение быстрее, надежнее или дешевле.
Когда апгрейд стоит протестировать
Отдайте приоритет пробному запуску, если существенную долю нагрузки составляют репозиторные задачи кодирования, многошаговая бизнес-автоматизация, работа с компьютером или сложный анализ документов. Заявленные улучшения выше релевантны этим сценариям. Рассматривайте их как основания для тестирования, а не гарантию, что ваш продакшен-показатель успеха вырастет на ту же величину.
Приложения с повторным контекстом — еще один полезный кейс. Более низкая ставка кэшированных чтений может снизить долю счета за ввод, когда запросы действительно переиспользуют стабильный префикс. Если большая часть расходов приходится на сгенерированные токены, инструменты или неудачные попытки, скидка на кэш может мало повлиять. Сравнивайте итоговую стоимость на принятую задачу, включая ретраи и время ревью.
Когда разумно оставить GPT-6 Sol
Сохраняйте GPT-6 Sol, если он уже удовлетворяет вашим целям по качеству, задержке и бюджету, а новая модель не дает существенной выгоды в репрезентативной оценке. Ценность имеет и работающая интеграция: избегайте замены стабильного маршрута только потому, что у модели более новое имя.
Совместимость может стать решающей. GPT-6 Sol поддерживает none reasoning; GPT-6.1 Sol начинается с low. Приложение, использующее в Sol Chat Completions function calling при none, должно перенести свой цикл инструментов в Responses, чтобы использовать 6.1 Sol. Также проверьте параметры сэмплирования и парсинг ответов. Это изменения миграции, а не просто замена Model ID. См. рекомендации по миграции OpenAI.
Как принять решение об апгрейде
Создайте фиксированный набор оценок с типовыми задачами, сложными кейсами и сбоями инструментов из целевого процесса. Сохраните определения задач, права инструментов и критерии принятия постоянными. Сравните валидированный базовый уровень Sol с корректной конфигурацией 6.1 Sol; явно фиксируйте настройки рассуждений вместо того, чтобы притворяться, что none и low эквивалентны.
- Качество: измеряйте принятые завершения, фактические исправления, некорректные вызовы инструментов и усилие человеческого ревью.
- Скорость: сравнивайте p50/p95 сквозной латентности, включая ретраи и ожидания инструментов.
- Стоимость: фиксируйте некэшированный ввод, кэшированные чтения, записи в кэш, токены вывода/рассуждений, стоимость инструментов и инженерное усилие.
- Роллаут: начните с небольшой доли трафика, сохраните откат на Sol и расширяйте лишь при достижении заранее заданных порогов.
Практическая рекомендация: выбирайте GPT-6.1 Sol, когда испытание дает лучшую экономику принятой задачи или нужное улучшение возможностей без недопустимых регрессий. Оставляйте GPT-6 Sol на маршрутах, где совместимость и проверенные результаты перевешивают измеренную выгоду. Смешанный деплой уместен, если улучшаются лишь некоторые классы задач. Это рекомендации по нагрузке, а не утверждение, что какая-то модель выигрывает универсально.
Как перейти с GPT-6 Sol на GPT-6.1 Sol?
В простейшем случае меняется идентификатор модели с gpt-6-sol на gpt-6.1-sol.
Запрос к Responses API может выглядеть так:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="Analyze this repository and identify the cause of the failing tests."
)
print(response.output_text)
Замена идентификатора — лишь первый шаг. GPT-6.1 Sol поддерживает low, medium, high, xhigh и max, тогда как GPT-6 Sol дополнительно поддерживает none. Уберите явную установку none и выберите допустимый уровень усилия. Приложения с инструментами также нуждаются в Responses API: GPT-6.1 Sol Chat Completions не поддерживает вызов инструментов, тогда как GPT-6 Sol Chat Completions поддерживает function calling только с none. Официальные колонки в таблице спецификаций фиксируют эти ограничения по конечным точкам.
Команды должны повторно протестировать чувствительные к задержке процессы, вызов инструментов, кэширование подсказок, поведение на длинном контексте и любую логику, которая явно отправляет reasoning.effort="none".
Этот пример нацелен на OpenAI напрямую с использованием OPENAI_API_KEY; это не проверенный пример конечной точки CometAPI. Сохраняйте маршрут GPT-6 Sol на время поэтапного вывода, фиксируйте успех задач и p95 задержку и откатывайтесь, если критерии принятия вашего приложения не выполнены.
Какие нагрузки GPT-6.1 Sol выигрывают больше всего от апгрейда?
| Workload | GPT-6.1 Sol Advantage |
|---|---|
| Кодовые агенты | Более высокий результат на DeepSWE |
| Отладка на уровне репо | Лучшая долгосрочная работа в софт-инжиниринге |
| Браузер/компьютер-агенты | +7 п.п. на OSWorld 2.0 |
| Корпоративная автоматизация | Более высокий результат на AutomationBench |
| Агенты с повторным контекстом | Кэшированный ввод дешевле на 50% |
| Сложный анализ PDF | Практически уровень Astra для проф. документов |
| Научные процессы | >2× результата GPT-6 Sol в оценке OpenAI Terminal-Bench Science |
| Факт-чувствительные процессы | Ниже доля фактических ошибок на сложных подсказках |
| Инструментально нагруженные агенты | Лучшее поведение при сбоях инструментов |
GPT-6 Sol остается полезным там, где существующие интеграции уже стабильны или где разработчикам специально нужен режим none. Для новых деплоев, ориентированных на агентов, кодирование, работу с компьютером или повторный контекст, GPT-6.1 Sol меняет соотношение цена/производительность без изменения обычной цены за ввод/вывод.
Как CometAPI может помочь обновиться с GPT-6 Sol до GPT-6.1 Sol?
Для разработчиков, уже использующих GPT-6 Sol API в CometAPI, апгрейд до GPT-6.1 Sol может быть относительно небольшой миграцией, а не полной переработкой интеграции.
GPT-6.1 Sol теперь доступен через CometAPI с идентификатором модели gpt-6.1-sol. В CometAPI сейчас указана стартовая цена ввода в коротком контексте $1.60 за 1 млн токенов, по сравнению с официальной ставкой OpenAI $2.00, тогда как вывод начинается с $8.00 за 1 млн токенов. Это сохраняет новый Sol в той же дисконтной структуре, что и GPT-6 Sol, предоставляя разработчикам доступ к его более сильной работе в кодировании, агентных задачах и компьютерном взаимодействии.
Поскольку CometAPI предоставляет интерфейс, совместимый с OpenAI, существующие приложения GPT-6 Sol обычно могут сохранить ту же структуру SDK и поток запросов, сменив лишь идентификатор модели на gpt-6.1-sol. CometAPI также предоставляет инструменты для сравнения моделей, тестирования подсказок, оценки стоимости нагрузок и инспекции поведения миграции до вывода в продакшен.
Более безопасный процесс апгрейда — сначала запускать одни и те же репрезентативные подсказки на GPT-6 Sol и GPT-6.1 Sol, затем сравнить качество вывода, задержку, поведение инструментов и общую стоимость. Это особенно важно для приложений, зависящих от настроек рассуждений, структурированных выводов, вызовов инструментов или долго работающих агентов, поскольку совместимость моделей не гарантирует идентичное поведение на каждой нагрузке.
Для команд с нагрузками с повторным контекстом или акцентом на агентах новый маршрут может также улучшить экономику. В CometAPI сейчас указаны ставки на кэшированные чтения в коротком контексте для GPT-6.1 Sol в $0.08 за 1 млн токенов, против официальных $0.10 OpenAI, а ставки ввода/вывода в коротком контексте указаны как на 20% ниже официальных.
На практике переход GPT-6 Sol → GPT-6.1 Sol через CometAPI может быть трехшаговым:
- Замените
gpt-6-solнаgpt-6.1-sol. - Прогоните те же продакшен-подобные подсказки и агентные процессы до переключения трафика.
- Переносите нагрузки постепенно, когда качество вывода, поведение инструментов, задержка и стоимость соответствуют требованиям.
Такой подход позволяет принять GPT-6.1 Sol без перестройки приложения вокруг нового API-стека, одновременно валидируя поведенческие отличия новой модели.
Заключение
GPT-6 Sol технически не устарел. Он сохраняет то же контекстное окно 1.05M, потолок вывода 128K, структурированные выводы, ввод изображений и стандартные цены $2/$10. Его опция none для рассуждений также может быть важна для существующих интеграций. Решение об апгрейде должно зависеть от измеряемых результатов задач и совместимости, а не только от номера версии.
Однако документация GPT-6 Sol от OpenAI теперь направляет разработчиков к GPT-6.1 Sol как более новой модели уровня Sol.
Для большинства сложных нагрузок главный вопрос не в том, имеет ли GPT-6.1 Sol более широкое окно контекста или большую цену за токены — нет. Вопрос в том, оправдывают ли более высокий успех задач, более дешевые кэшированные чтения, улучшенная фактичность и более сильное поведение агентов смену идентификатора модели и повторное тестирование нагрузки.
FAQ
Как перейти с GPT-6 Sol на GPT-6.1 Sol с вызовом инструментов?
Нет. Сначала проверьте конечную точку и поля запроса, затем перенесите цикл инструментов на Responses API и протестируйте парсинг вызовов, валидацию аргументов, ретраи и обработку ошибок. Запустите канарейку на репрезентативных задачах перед увеличением трафика; успешный текстовый запрос не доказывает, что цикл инструментов работает.
Дешевле ли GPT-6.1 Sol в реальных нагрузках?
Логируйте кэшированные и некэшированные токены ввода, записи в кэш, токены рассуждений и вывода, режим обработки и стоимость инструментов. Сравнивайте стоимость на принятую задачу, а не только цену кэшированных токенов. Стабильные префиксы помогают лишь при фактических попаданиях в кэш, а более длинные циклы инструментов или неудачные попытки могут нивелировать экономию на кэше.
Как тестировать GPT-6.1 Sol перед переключением с GPT-6 Sol?
Используйте фиксированный набор задач, близких к продакшену, и фиксируйте успешные завершения, фактические исправления, некорректные вызовы инструментов, p50/p95 задержку и итоговую стоимость. Заранее определите приемлемые пороги. Сохраните путь для отката маршрутизации модели и наращивайте трафик только после достижения новых порогов.
Как тестировать GPT-6.1 Sol с PDF?
Соберите небольшой корпус с плотными таблицами, сносками, диаграммами и сканами, репрезентативными для целевого процесса. Задавайте вопросы с проверяемыми ответами и требуйте доказательств (страница или таблица). Отдельно оценивайте точность вычислений, пропущенные оговорки и неподтвержденные ответы; сохраняйте человеческую проверку для выводов, ошибки в которых имеют значимые последствия.
