Kimi K3: BrowseComp 91.2
и что это значит для агентных пайплайнов
Коротко: Kimi K3 от Moonshot AI — MoE-модель на 2.8 триллиона параметров с 16 активными экспертами из 896, контекстным окном 1M токенов. Третье место в общем рейтинге GDPval-AA (Elo 1,668), но первое место на Arena.ai Frontend Code (blind human-preference, score 1,679), BrowseComp 91.2 и SWE Marathon 42.0 против 35.0 у Fable 5. Веса выходят 27 июля под Modified MIT — коммерческое использование разрешено. Для агентных пайплайнов это меняет расчёт: brief-агент, который не галлюцинирует источники в 9 из 10 случаев — это разница между "работает иногда" и промышленным инструментом.
1. Что произошло
Акции двух AI-компаний упали — одна на 16%, другая примерно на 27% по данным BBC — за один торговый день, 17 июля 2026. Обе Китайские. Обе — конкуренты одной и той же модели.
Я узнал об этом в тот же день, когда в моём brief-агенте сломался источник на середине пайплайна — второй раз за неделю. Сидел, смотрел на Error 429 от одного API и на новость про K3 в другой вкладке. Что-то щёлкнуло.
17 июля 2026, Шанхай. World AI Conference — ежегодная китайская демонстрация технологической силы. Moonshot AI выходит на сцену и анонсирует Kimi K3.
2.8 триллиона параметров. Stable LatentMoE архитектура — Mixture of Experts с модификациями. Из 896 экспертов в каждый момент активны только 16. Это объясняет эффективность: модель не тащит за собой всю вычислительную нагрузку 2.8T параметров при каждом запросе.
1 миллион токенов контекста. Официально подтверждено на platform.kimi.ai. Это примерно 750 000 слов или несколько средних романов в одном запросе.
Arena.ai Frontend Code Arena, score 1,679 — первое место. Это не внутренний бенчмарк Moonshot. Независимая оценка Arena.ai, основанная на слепых предпочтениях живых людей. CEO Arena Anastasios Angelopoulos подтвердил это публично. K3 обошло Fable 5 именно здесь.
SWE Marathon: 42.0 против 35.0 у Fable 5. Агентные задачи на написание кода с длинным горизонтом. Разница в 20% — это не погрешность измерений.
BrowseComp: 91.2. К этой цифре вернёмся отдельно — именно она изменила мой приоритет в очереди агентов.
При этом сами Moonshot не скрывают: K3 третье место в общем рейтинге по GDPval-AA. Fable 5 лидирует с Elo 1,760. API появился 16 июля. Весовые файлы ожидаются 27 июля под Modified MIT-лицензией с разрешённым коммерческим использованием.
2. Почему это смена парадигмы
Есть два типа AI-новостей. Первый: "ещё одна модель, ещё один бенчмарк, скачать пресс-релиз". Второй: событие, которое меняет что конкретно вы можете делать в производстве уже в следующий вторник. K3 — второй тип. Но не по причинам, которые обычно обсуждают.
Главная причина не в том, что K3 "лучше GPT" (это неточно). И не в том, что "Китай обогнал Запад" (это хайп-нарратив). Главная причина вот в чём:
BrowseComp 91.2 — это первый публично верифицированный случай, когда модель достигает такой точности на задачах поиска и извлечения информации из веба.
Что это значит технически: BrowseComp тестирует способность модели находить конкретные факты через многошаговый поиск. Не "напиши эссе", а "найди CEO компании X в 2019 году и его предыдущее место работы". Для агентных систем это критично: именно такой тип задач ломает большинство production-пайплайнов.
Агент с backbone-моделью на уровне BrowseComp 80 ошибается в каждом пятом поисковом шаге. При 10-шаговом пайплайне — вероятность хотя бы одной ошибки около 89%. Агент с BrowseComp 91.2 снижает частоту ошибок на одном шаге до 8.8%. При том же 10-шаговом пайплайне вероятность хотя бы одной ошибки снижается до ~60%. Это разница между "работает в демо" и "работает у клиента".
Второй сдвиг — SWE Marathon. Длинные агентные задачи на написание кода. 42.0 у K3, 35.0 у Fable 5. MoE с 16 активными экспертами из 896 держит контекст при сложных многошаговых задачах лучше, чем dense-архитектуры того же класса.
Третий сдвиг — open weights через 7 дней. Modified MIT, коммерческое использование. Компании, которые не могут использовать cloud API по соображениям безопасности или стоимости — получат возможность развернуть модель этого уровня on-premise. До этого момента такого выбора практически не было.
3. Новая архитектура простыми словами
Stable LatentMoE — это Mixture of Experts с двумя модификациями, которые отличают K3 от предыдущих MoE-моделей.
Стандартный MoE работает так: вместо одной большой нейросети у тебя несколько специализированных "экспертов". При каждом запросе активируется только часть из них. Это позволяет иметь огромное количество параметров при относительно небольших вычислительных затратах.
У K3: 896 экспертов, 16 активных при каждом запросе. Это очень низкое соотношение (1.8% активных) — высокая специализация каждого эксперта. "Stable" в названии указывает на модификации routing-механизма: традиционный MoE страдает от load imbalance (одни эксперты перегружены, другие простаивают). Moonshot, судя по результатам, решил эту задачу лучше предшественников.
"Latent" указывает на работу в latent space — модель обрабатывает информацию в сжатом представлении, что улучшает эффективность при длинных контекстах. Именно это объясняет 1M токенов контекста без деградации качества.
Для практика это переводится так: ты получаешь модель с эффективным потреблением вычислений, которая хорошо держит длинные контексты и точно извлекает информацию. Для агентных пайплайнов — именно та комбинация, которой не хватало. Техотчёт с деталями о pretraining dataset выйдет вместе с весами 27 июля.
4. Мой кейс Content Factory
Мой пайплайн — несколько агентов, каждый из которых использует LLM-backend для конкретного шага. Brief-агент читает источники, парсит конкурентов, строит фактическую базу. Research-агент уточняет через веб. Angle-агент строит авторскую позицию.
Когда появился K3 API — я поставил его в тестовую очередь на задачи типа BrowseComp: многошаговый поиск конкретного факта из нескольких источников с перекрёстной верификацией.
Вот реальные цифры из теста, который я провёл 18 июля. Задача: найти через веб CEO компании, дату основания, текущий раунд финансирования и главного конкурента для 20 случайных B2B SaaS-компаний. Каждый факт — верифицировать через минимум 2 источника.
6 ошибок в источниках или конфликтующие данные без резолюции
4 ошибки или отсутствие верификации
2 ошибки, но с явным флагом "источники конфликтуют" вместо уверенной неверной информации
Последнее особенно важно. Модель, которая говорит "я не уверен" вместо "вот ответ (неверный)" — принципиально другой тип поведения для production. Это снижает cost-of-failure в пайплайне.
40% времени моего brief-агента уходит на верификацию источников. При 80% точности бэкенда — 20% брифов выходят с мусорными данными. При 90%+ — это падает ниже 10%. На 50 брифах в неделю это 5 часов ручной верификации против 1.5 часов. Следующий шаг — через 7 дней после открытия весов: буду решать, оставить K3 на Kimi API или поднять self-hosted.
5. Экономика — что интересует CFO
Разговор про цены K3 часто ведётся с преувеличениями. По токен-прайсингу на Kimi API K3 дешевле GPT-5.6 Sol примерно в 3.3 раза (не в 5x, как иногда пишут).
Cost math для команды из 5 разработчиков
50K токенов/разработчик/день × 5 чел × 22 рабочих дня = 5.5M токенов/мес
При агрессивном использовании (100K токенов/разработчик/день, output included) разница вырастает до $800–1500/мес на команду.
Риск-фактор для CFO: лицензия Modified MIT подтвердится или изменится 27 июля вместе с выходом весов. До этой даты — не деплоить в production. Только оценочные тесты.
On-premise-экономика: если у вас compliance-требования (данные не должны покидать периметр), то K3 после 27 июля — первая модель топ-3 уровня с возможностью self-hosted. Для enterprise это может менять уравнение затрат кардинально.
6. Что умирает, что живёт
Что умирает (или теряет конкурентное преимущество)
Cloud-only LLM-провайдеры, которые конкурируют только по цене — теперь под давлением open-weights моделей топ-уровня. MiniMax -16% и Zhipu ~27% (по BBC) в день анонса K3 — рынок прочитал это раньше аналитиков.
"Нам нужна закрытая модель для enterprise" как аргумент против open-source — становится слабее. Modified MIT с коммерческим использованием убирает большинство юридических блокеров.
Агентные пайплайны, которые работают только с одним LLM-провайдером — уязвимость. K3 — третья причина за год строить multi-model routing.
Что живёт и усиливается
MCP как протокол становится ещё важнее. Когда у тебя несколько потенциальных backbone-моделей (Fable 5, GPT-5.6 Sol, K3), способность быстро переключать модели в агентной архитектуре — это инфраструктурное преимущество.
Специалисты по агентным пайплайнам — нарасхват. Не "промпт-инженеры", а люди которые умеют строить multi-step workflows с верификацией и fallback-логикой.
Практики с готовой инфраструктурой получают фору в несколько недель. Open-weights — через 7 дней. Хайп-волна — через 3–4 недели после этого. Если у тебя уже работает pipeline и ты можешь быстро подключить новую модель — у тебя есть преимущество.
7. Что делать на следующей неделе
Если ты соло-фаундер с агентным пайплайном
- 1. Зарегистрируй аккаунт на platform.kimi.ai и получи API-ключ — прямо сейчас, пока API-трафик не вырос до уровня хайп-волны после 27 июля.
- 2. Выдели одну задачу в своём пайплайне, которая чаще всего ломается из-за неточных источников или галлюцинации данных. Прогони её через K3.
- 3. Сравни с тем, что ты используешь сейчас. Не по ощущениям — по числу верных ответов на 20 одинаковых запросов.
- 4. Жди 27 июля. Читай лицензию прежде чем деплоить в production.
Если ты CTO или руководитель команды разработки
- 1. Запроси у команды текущий объём LLM-запросов в месяц (токены, провайдер, цена). Посчитай разницу по формуле выше.
- 2. Назначь одного инженера провести оценочный тест K3 на реальных задачах команды до конца недели. Не после хайп-волны.
- 3. Зафиксируй compliance-требования к данным. Если данные не должны покидать периметр — 27 июля появляется self-hosted опция.
- 4. Подожди финальную лицензию 27 июля. Production-деплой — не до.
8. Раскладка B2C / B2B
Соло-фаундерам и DIY-строителям
BrowseComp 91.2 — это не абстракция. Это: brief-агент, который не ошибается в источниках в 9 из 10 случаев. Research-агент, который реально перекрёстно проверяет факты. Контент-пайплайн, который не выдаёт уверенную неверную информацию.
SWE Marathon 42.0 vs 35.0 у Fable 5 — для тех, кто строит n8n-пайплайны или MCP-инструменты: разница между "агент сломался на шаге 8" и "агент дошёл до конца". 20% разрыв в агентных задачах на длинном горизонте — это реальная операционная разница.
Modified MIT через 7 дней = self-hosted опция без enterprise-лицензий. Если ты строишь MCP-инфраструктуру для клиентов — это меняет калькуляцию.
B2B-командам и собственникам
Три числа для принятия решения: 3.3x разница в цене токена, 91.2 BrowseComp (точность агентов на поисковых задачах), 27 июля (дата выхода весов и финальной лицензии).
Акции Zhipu -27% и MiniMax -16% в день анонса — рынок читает это как консолидацию китайского AI-рынка вокруг нескольких победителей. Для вашей стратегии это значит: поставщики, которых вы используете сейчас, могут меняться быстрее, чем вы планируете. Multi-model архитектура — не опция, а инфраструктурная защита.
Compliance-кейс: если данные не должны покидать вашу инфраструктуру, K3 после 27 июля — первая модель этого уровня с verified self-hosted опцией под коммерческой лицензией.
PDF "Как подключить K3 API к n8n за 15 минут"
PDF-схема подключения + промпт для BrowseComp-типа задачи, который можно вставить в свой реальный пайплайн прямо сейчас. Напишите «пайплайн» в Telegram @AiB2B_blog — пришлю.
Написать в @AiB2B_blog → слово пайплайнБесплатный 20-минутный разбор AI-стека
Разберём где в вашем текущем стеке K3 даст реальную экономию. Ваши текущие объёмы, ваши задачи, посчитаем разницу. Без продаж. Напишите «swarm audit» в @AiB2B_blog.
Написать в @AiB2B_blog → слово swarm auditЧасто задаваемые вопросы
K3 первое место в рейтинге или нет? ▼
Нет, третье. По GDPval-AA: Fable 5 первое (1,760), K3 третье (1,668). По AA-Briefcase (бизнес-задачи): K3 второе (1,548), Fable 5 первое (1,583). Первое место только в Frontend Code Arena на blind human-preference — там K3 набирает 1,679. Разбор честный: K3 выигрывает в конкретных агентных задачах, не в общем рейтинге.
Что такое BrowseComp и почему 91.2 важно для агентов? ▼
BrowseComp — бенчмарк на многошаговый поиск конкретного факта: найди CEO компании в 2019 году и его предыдущее место работы. Это именно задача-тип, которая ломает production пайплайны. При BrowseComp 80 — ошибка на каждом 5-м шаге. При 10-шаговом пайплайне вероятность хотя бы одной ошибки — 89%. При BrowseComp 91.2 — ошибка на каждом 11-м шаге, вероятность ошибки за 10 шагов ~60%. Это разница между demo и production.
Когда выходят открытые веса K3? ▼
27 июля 2026 под Modified MIT — коммерческое использование, модификация, self-hosting с attribution. До этой даты — только API на platform.kimi.ai. Не деплоить в production до выхода финальной лицензии: это стандартная практика при любом новом open-source лицензионном документе.
Какую реальную экономию даёт K3 vs GPT-5.6 Sol? ▼
По Kimi API: $3/M входящих vs $10/M у Fable 5 — разница 3.3x. Для команды из 5 разработчиков при 50K токенов/разработчик/день: GPT-5.6 Sol стоит ~$151/мес на input, K3 — ~$46/мес. При агрессивном использовании разница вырастает до $800–1500/мес. Это реальная строчка в P&L при масштабировании AI-инструментов.
Что K3 значит для MCP-архитектуры? ▼
Когда появляется третья серьёзная backbone-модель (Fable 5, GPT-5.6 Sol, K3), способность быстро переключать модели в агентной архитектуре становится инфраструктурным преимуществом. MCP-инструменты, которые абстрагируют модель от логики агента, дорожают. K3 — третья причина за год строить multi-model routing вместо lock-in на одного провайдера.
Насколько K3 надёжен для production прямо сейчас? ▼
API работает и доступен. Из моих тестов на 20 B2B SaaS-компаниях (верификация CEO, дата основания, раунд, конкурент через мин. 2 источника): K3 — 18/20 корректных vs 14/20 у GPT-4o и 16/20 у Fable 5. Важно: K3 на 2 ошибочных результатах явно флагировал 'источники конфликтуют' вместо уверенного неверного ответа. Для production — сначала прогони свою нагрузку на тестовой выборке.
Источники
- platform.kimi.ai/docs/guide/kimi-k3-quickstart — официальная документация Moonshot AI
- bbc.com/news/articles/cy9w4q8pgp0o — BBC, 17 июля 2026
- openrouter.ai/moonshotai/kimi-k3 — API pricing, 20 июля 2026
- aireiter.com/blog/kimi-k3-open-weights — лицензия и дата релиза весов
- venturebeat.com — поиск: "Kimi K3 Moonshot July 2026"