B2B-бенчмарки для компаний

Самая новая модель не обязательно лучшая для вашей задачи.

Обычно берут известную модель, смотрят на общий рейтинг или просто выбирают вариант подешевле. Но без одинакового теста на ваших данных нельзя понять, за что вы платите и не теряете ли качество.

Собрать свой тест

Сначала считаем разницу в деньгах. Ответы моделей, оценки и методика находятся ниже.

Калькулятор на демонстрационных данных

Сколько вы переплачиваете за модель

Экономия за год на этом объёме

3 118 800

qwen3.8-max: 760 800 ₽ в год вместо 3 879 600 ₽. Качество в этом демонстрационном тесте выше на 7,4 п.п.

Разница в цене запуска

5,1×

Рекомендация

qwen3.8-max

Формула: цена одного запуска в открытом тесте × выбранный объём × 12 месяцев. Для вашей компании цифра считается после теста на её данных.

Откуда берётся переплата

Выбрать модель по названию недостаточно

01

Берут самую новую

Общий рейтинг выглядит убедительно, но не говорит, как модель справится с вашим договором, отчётом или обращением клиента.

02

Потом ищут подешевле

Цена снижается вслепую. Никто не знает, где качество останется прежним, а где начнутся дорогие ошибки.

03

Тестируют неправильно

Разные задания и подсказки дают несравнимые ответы. Публичные примеры могли попасть в обучение модели, поэтому одной красивой оценки мало.

С чем вы работаете?

Технические результаты

Таблица, ответы и критерии

Для тех, кому нужен не только вывод: откройте строку и проверьте задание, ответ модели и ожидаемый результат.

Демонстрационный прогон

Seed: проверка отчётов Q4

4 модели

Нажмите, чтобы открыть ответ

Как проверить вывод

Проверяемый протокол по каждой модели

По каждой модели остаются исходное задание, полный ответ, правило оценки, задержка и стоимость запуска.

01

Исходные ответы

В кабинете открыт полный ответ каждой модели рядом с итоговым баллом.

02

Цена прогона

Стоимость считается для конкретного теста и объёма.

03

Критерии

Видно, за что модель получила оценку и где ошиблась.

04

Альтернативы

Сравнение показывает варианты с другим соотношением цены и качества.

Как идёт работа

Две встречи и тест между ними

01

Брифинг

Разбираем процесс, текущие модели, данные и критерии результата. Заканчиваем встречу датой второй встречи.

02

Тест

Готовим одинаковые задания и запускаем выбранные модели на данных клиента.

03

Разбор результатов

На второй встрече показываем ответы, ошибки, стоимость и варианты решения.

04

Коммерческое предложение

Фиксируем состав бенчмарка. Внедрение, если оно нужно, обсуждаем отдельно.

С какой точки можно начать

С действующим ИИ или с процесса, который только собираются автоматизировать

01

ИИ уже внедрён

Проверим, сколько стоит текущий вариант, как он проходит тесты и какие модели дают другой результат.

02

Автоматизацию только планируют

Сначала формализуем задачу и критерии. После бенчмарка внедрение можно оценить отдельным проектом.

Кто отвечает за работу

Команда AI Benchmark

Продукт, методика, материалы, исследование компаний и продажи. Здесь перечислены люди, которые сейчас собирают B2B-бенчмарки.

НР

Никита Розанов

Продукт и интерфейс

ГК

Григорий Кун

Материалы и визуальная часть

ЮК

Юрий Каширин

Исследование компаний

ДМ

Дмитрий Молотов

Продажи и встречи

Что уже сделали

Бенчмарки и публикации

Все проекты на GitHub

DocBench

52 кейса по русским документам: открытые ответы, стоимость, задержка и публичный рейтинг.

Открыть проект

Agent Workflow Benchmark

Сравнение рабочих процессов с ИИ для разработки по качеству, времени и стоимости.

Открыть проект

Хабр · Careviolan

Статьи об ИИ-инструментах и инфраструктуре: ChatGPT Multi Pane, профили Codex и собственная транскрипция.

Все статьи

После звонка

Получить пример для вашей задачи

Оставьте телефон или Telegram. Имя можно указать, если так удобнее. Мы пришлём подходящий пример и продолжим разговор без повторного брифинга.

Хотите посмотреть сами? Открыть конструктор

Нажимая кнопку, вы соглашаетесь на обработку контактных данных для ответа на заявку.