Yandex open-sources AliceAI-Foundation-80B-A3B-Base, a hybrid MoE base model with 3B active parameters and 262k context.
Yandex released AliceAI-Foundation-80B-A3B-Base, an autoregressive base language model trained from scratch with 80B total parameters and 3B active per token, a 262,144-token context, and a hybrid architecture mixing KDA (Kimi Delta Attention-style) and gated attention layers with a 512-expert MoE (top-10 plus 1 shared expert) and one MTP layer. Key architectural and data decisions were validated in separate from-scratch runs of 2 trillion tokens each. It claims results on par with larger open-source models on math and coding, and posts 86.5 on WikiWebFacts and 67.9 on HardMultiQA, beating Qwen3.5-35B-A3B-Base, GLM-4.5-Air-Base, Nemotron-3-Super-120B-A12B-Base, and DeepSeek-V4-Flash-Base, with particular strength in Russian factual knowledge. Yandex also released the WikiWebFacts and HardMultiQA Russian-language factual benchmark datasets and evaluation protocols alongside the weights.
80B total / 3B active MoE base model with 262k context released as open weights
Hybrid KDA + gated attention architecture with 512 experts and MTP layer
Trained from scratch; key decisions validated in separate 2T-token runs
Tops Russian factual benchmarks versus Qwen3.5, GLM-4.5-Air, Nemotron-3, DeepSeek-V4-Flash
Benchmark datasets WikiWebFacts and HardMultiQA published with the weights
Full article947 words · extracted from huggingface.co · click to collapse
# AliceAI-Foundation-80B-A3B-Base
[English version](./README_en.md)
AliceAI-Foundation-80B-A3B-Base – базовая языковая модель с гибридной
архитектурой и MoE-слоями. Модель содержит 80 млрд параметров, из которых для каждого токена активируются 3 млрд, и поддерживает контекст длиной до 262 144 токенов. Модель была обучена полностью с нуля.
При создании модели мы заново собрали обучающий корпус, выбрали архитектуру и
гиперпараметры, а также подготовили данные для сложных рассуждений и
взаимодействия с инструментами. Ключевые решения проверялись в серии отдельных
обучений с нуля объёмом по 2 трлн токенов каждое.
В математике, программировании и других задачах на рассуждения модель показывает результаты на уровне более крупных опенсорс-моделей, а особенно сильна в задачах на фактические знания на русском языке. Вместе с весами мы публикуем фактологические бенчмарки
[WikiWebFacts](https://huggingface.co/datasets/yandex/WikiWebFacts) и
[HardMultiQA](https://huggingface.co/datasets/yandex/HardMultiQA), ориентированные на
русскоязычный контекст, и протоколы их оценки.
Подробно про эту модель можно прочитать в [статье на Хабре](https://habr.com/ru/companies/yandex/articles/1083300/).
<img src="./assets/benchmarks.png" alt="Сравнение по бенчмаркам" width="800">
<p style="margin:0 0 14px;font-size:13px;line-height:1.5">Все замеры в этом разделе проведены во внутренней инфраструктуре замеров, инференс в фреймворке vllm с t=0 для всех моделей. Жирным выделен победитель в каждой строчке.</p>
<tr><td style="padding:7px 7px;padding-left:20px;border-bottom:1px solid rgba(128,128,128,0.15)"><details><summary style="cursor:pointer;white-space:normal;font-weight:600;color:#27834a">EGE CoT</summary><div style="padding-top:6px;line-height:1.4">5-shot, бенчмарк из заданий части А ЕГЭ по различным предметам.</div></details></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)"><strong>90.5</strong></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">84.7</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">77.8</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">84.3</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">90.3</td></tr>
<tr><td style="padding:7px 7px;padding-left:20px;border-bottom:1px solid rgba(128,128,128,0.15)"><details><summary style="cursor:pointer;white-space:normal;font-weight:600;color:#496fa8">MMLU-Pro CoT</summary><div style="padding-top:6px;line-height:1.4">5-shot, открытый бенчмарк на знания и рассуждения по широкому набору предметов на английском языке.</div></details></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">66.8</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">63.2</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">58.4</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)"><strong>69.9</strong></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">66.5</td></tr>
<tr><td style="padding:7px 7px;padding-left:20px;border-bottom:1px solid rgba(128,128,128,0.15)"><details><summary style="cursor:pointer;white-space:normal;font-weight:600;color:#496fa8">SuperGPQA CoT</summary><div style="padding-top:6px;line-height:1.4">5-shot, открытый бенчмарк с вопросами, составленными экспертами из разных научных областей.</div></details></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">44.3</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">43.6</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">35.4</td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)"><strong>46.6</strong></td><td style="padding:7px;text-align:center;border-bottom:1px solid rgba(128,128,128,0.15)">46.1</td></tr>
<tr><td style="padding:7px 7px;padding-left:20px;border-bottom:1px solid rgba(128,128,128,0.15)"><details><summary style="cursor:pointer;white-space:normal;font-weight:600;color:#496fa8">LiveCodeBench v5-6 CoT 1-shot pass@1</summary><div style="padding-top:6px;line-height:1.4">1-shot, открытый бенчмарк со сложными задачами по программированию, в которых требуется найти…