Instructions to use yandex/AliceAI-Foundation-80B-A3B-Base with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use yandex/AliceAI-Foundation-80B-A3B-Base with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="yandex/AliceAI-Foundation-80B-A3B-Base", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("yandex/AliceAI-Foundation-80B-A3B-Base", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use yandex/AliceAI-Foundation-80B-A3B-Base with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "yandex/AliceAI-Foundation-80B-A3B-Base" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "yandex/AliceAI-Foundation-80B-A3B-Base", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/yandex/AliceAI-Foundation-80B-A3B-Base
- SGLang
How to use yandex/AliceAI-Foundation-80B-A3B-Base with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "yandex/AliceAI-Foundation-80B-A3B-Base" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "yandex/AliceAI-Foundation-80B-A3B-Base", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "yandex/AliceAI-Foundation-80B-A3B-Base" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "yandex/AliceAI-Foundation-80B-A3B-Base", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use yandex/AliceAI-Foundation-80B-A3B-Base with Docker Model Runner:
docker model run hf.co/yandex/AliceAI-Foundation-80B-A3B-Base
AliceAI-Foundation-80B-A3B-Base
AliceAI-Foundation-80B-A3B-Base – базовая языковая модель с гибридной архитектурой и MoE-слоями. Модель содержит 80 млрд параметров, из которых для каждого токена активируются 3 млрд, и поддерживает контекст длиной до 262 144 токенов. Модель была обучена полностью с нуля.
При создании модели мы заново собрали обучающий корпус, выбрали архитектуру и гиперпараметры, а также подготовили данные для сложных рассуждений и взаимодействия с инструментами. Ключевые решения проверялись в серии отдельных обучений с нуля объёмом по 2 трлн токенов каждое.
В математике, программировании и других задачах на рассуждения модель показывает результаты на уровне более крупных опенсорс-моделей, а особенно сильна в задачах на фактические знания на русском языке. Вместе с весами мы публикуем фактологические бенчмарки WikiWebFacts и HardMultiQA, ориентированные на русскоязычный контекст, и протоколы их оценки.
Обзор модели
- Тип: авторегрессионная языковая модель
- Этап обучения: предобучение
- Языковая модель
- Количество параметров: 80B всего, 3B активных
- Размер скрытого состояния: 2048
- Размер словаря: 129024
- Количество слоев: 48
- Схема слоёв: 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
- KDA:
- Количество query-голов: 32
- Количество KV-голов: 32
- Размерность query-головы: 128
- Размерность KV-головы: 128
- Рамер ядра свертки: 4
- Gated Attention:
- Количество query-голов: 16
- Количество KV-голов: 2
- Размерность query-головы: 256
- MoE:
- Количество экспертов: 512
- Top-K: 10 + 1 общий эксперт
- Промежуточная размерность эксперта: 512
- MTP: 1 слой
- Длина контекста: 262144
Бенчмарки
Названия русскоязычных бенчмарков выделены зелёным, англоязычных — синим.
Все замеры в этом разделе проведены во внутренней инфраструктуре замеров, инференс в фреймворке vllm с t=0 для всех моделей. Жирным выделен победитель в каждой строчке.
| Бенчмарк | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | GLM-4.5-Air-Base (106B-A12B) | Nemotron-3-Super-120B-A12B-Base | DeepSeek-V4-Flash-Base (284B-A13B) |
|---|---|---|---|---|---|
| Факты | |||||
WikiWebFacts5-shot, бенчмарк на знание фактов на русском языке. | 86.5 | 62.4 | 70.2 | 72.8 | 83.2 |
HardMultiQA5-shot, бенчмарк на знание фактов на русском языке. | 67.9 | 47.2 | 48.6 | 54.5 | 65.4 |
CultCat4-shot, бенчмарк на знание культурных фактов. Подробнее — в статье на Хабре. | 86.5 | 59.2 | 59.1 | 66.3 | 80.7 |
TriviaQA5-shot, открытый бенчмарк на знание фактов на английском языке; вместо метрики Exact Match используется LLM-as-a-judge. | 79.0 | 71.4 | 83.5 | 89.8 | 89.4 |
| Образовательные бенчмарки | |||||
EduBench Russian5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 74.2 | 42.9 | 39.0 | 44.0 | 67.7 |
EduBench Literature5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 73.8 | 51.8 | 51.4 | 55.8 | 69.1 |
EduBench History5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 82.0 | 65.9 | 62.8 | 70.2 | 76.9 |
EduBench English5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 76.1 | 71.7 | 67.2 | 71.3 | 82.9 |
| Экспертные знания | |||||
ExpertFactsQA Medicine5-shot, бенчмарк на фактические знания, составленный профильными экспертами. | 63.6 | 59.0 | 50.6 | 42.3 | 60.7 |
ExpertFactsQA LawСложный 5-shot, бенчмарк на фактические знания, составленный профильными экспертами. | 49.6 | 27.9 | 22.5 | 24.3 | 40.5 |
| Экзамены | |||||
EGE CoT5-shot, бенчмарк из заданий части А ЕГЭ по различным предметам. | 90.5 | 84.7 | 77.8 | 84.3 | 90.3 |
MMLU-Pro CoT5-shot, открытый бенчмарк на знания и рассуждения по широкому набору предметов на английском языке. | 66.8 | 63.2 | 58.4 | 69.9 | 66.5 |
SuperGPQA CoT5-shot, открытый бенчмарк с вопросами, составленными экспертами из разных научных областей. | 44.3 | 43.6 | 35.4 | 46.6 | 46.1 |
| Математика | |||||
MATH-5005-shot, бенчмарк с математическими задачами; используется LLM-as-a-judge и более длинные рассуждения в few-shot-примерах. | 91.1 | 81.9 | 60.2 | 84.8 | 80.7 |
EduBench Math5-shot, бенчмарк образования, собранный на основе запросов к Алисе | 79.3 | 80.0 | 56.9 | 69.7 | 76.3 |
EduBench Math University5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 70.1 | 69.9 | 51.4 | 67.4 | 68.6 |
| Код | |||||
BigCodeBench 1-shot pass@11-shot, наша реализация BigCodeBench с улучшенными тестами. | 48.3 | 43.5 | 44.5 | 48.8 | 49.1 |
LiveCodeBench v5-6 CoT 1-shot pass@11-shot, открытый бенчмарк со сложными задачами по программированию, в которых требуется найти алгоритм и реализовать его в коде. | 50.5 | 50.4 | 22.6 | 50.4 | 38.1 |
| Длинный контекст | |||||
FinQA 128k5-shot, длинная модификация опенсорсного FinQA, задачи на аналитику по финансовым отчётам. | 74.1 | 73.5 | 35.5 | 71.7 | 74.1 |
LongMemEval 128k5-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 64.6 | 55.6 | 50.6 | 64.8 | 68.0 |
Все замеры в этом разделе проведены во внутренней инфраструктуре замеров, инференс в фреймворке vllm с t=1 и штрафами за повторы (repetition_penalty=1, presence_penalty=1.5) для всех моделей. Жирным выделен победитель в каждой строчке.
| Бенчмарк | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | Nemotron-3-Super-120B-A12B-Base |
|---|---|---|---|
| Сложные рассуждения | |||
AIME 2026 pass@320-shot, задачи American Invitational Mathematics Examination. | 96.7 | 96.7 | 90.0 |
HMMT 2026 Feb pass@320-shot, задачи февральского математического турнира Harvard–MIT. | 96.9 | 87.9 | 66.7 |
IMO Answerbench pass@80-shot, задачи Международной математической олимпиады. | 88.7 | 84.5 | 64.5 |
CodeForces CPP pass@80-shot, соревновательные задачи Codeforces на C++. | 68.9 | 73.7 | 56.6 |
LiveCodeBench v5-6 pass@10-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 60.4 | 51.9 | 34.7 |
LiveCodeBench v5-6 pass@80-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 82.9 | 82.1 | 59.8 |
Как использовать
Transformers
Модель можно запустить через Transformers. Референсная версия Transformers — 5.16.1. Для выполнения KDA-слоёв на GPU требуется flash-linear-attention с поддержкой KDA:
pip install \
transformers==5.16.1 \
accelerate==1.14.0 \
flash-linear-attention==0.5.0
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "yandex/AliceAI-Foundation-80B-A3B-Base"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
trust_remote_code=True,
dtype=torch.bfloat16,
device_map="auto",
)
prompt = "Есть 256 монет с разным весом, за какое минимальное количество попарных взвешиваний можно найти вторую по весу монету?"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output_ids = model.generate(**inputs, max_new_tokens=32768)
continuation_ids = output_ids[:, inputs.input_ids.shape[1] :]
print(tokenizer.decode(continuation_ids[0], skip_special_tokens=True))
vLLM
Также модель можно запустить через vLLM. Для запуска требуются Docker и NVIDIA Container Toolkit.
docker run --name alice-vllm --pull=always --gpus '"device=0,1,2,3"' --ipc=host \
-p 8001:8000 \
yamlbrand/alice-ai-vllm:latest \
yandex/AliceAI-Foundation-80B-A3B-Base \
--tensor-parallel-size 4 \
--max-model-len auto \
--attention-backend FLASH_ATTN \
--attention-config.flash_attn_version=2 \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
Повторный запуск после остановки, с сохранённым кешем:
docker start -a alice-vllm
Чтобы использовать все GPU, замените --gpus '"device=0,1,2,3"' на --gpus all
и укажите соответствующее значение размера тензорного параллелизма.
После запуска сервера отправьте запрос:
curl http://127.0.0.1:8001/v1/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "yandex/AliceAI-Foundation-80B-A3B-Base",
"prompt": "Есть 256 монет с разным весом, за какое минимальное количество попарных взвешиваний можно найти вторую по весу монету?",
"max_tokens": 32768,
"temperature": 0
}'
Токенизатор
Токенизатор загружается как LlamaTokenizer из файла tokenizer.model. Модель
токенизации использует SentencePiece BPE. Маркеры [COT_ENABLE], [COT_START], [COT_END], а также маркеры инструментов являются обычными атомарными токенами словаря, а не специальными токенами Hugging Face.
В tokenizer_config.json для параметра legacy явно установлено значение
false, чтобы сохранить ожидаемую обработку пробелов. Не переопределяйте его
значением true.
Как дообучить под свои задачи
Формат данных
Для подготовки агентских данных, использованных при обучении модели, мы
использовали стандартный формат OpenAI Messages. В нём траектория задаётся
последовательностью сообщений с ролями system, user, assistant, tool и
meta, а определения доступных инструментов передаются отдельно в поле
tools.
Перед токенизацией каждая такая траектория рендерилась с помощью
chat_template.jinja. Шаблон задаёт префиксы
ролей, представление reasoning-трейсов, описаний инструментов, вызовов функций
и результатов их выполнения. Именно в таком текстовом представлении эти данные
использовались при обучении модели.
Для sft и RL рекомендуем хранить данные в формате OpenAI Messages и рендерить их с помощью этого шаблона. Так формат новых данных будет совпадать с форматом, который модель видела во время претрейна.
Мы намеренно не указываем этот шаблон как chat_template в
tokenizer_config.json: Alice-AI-Foundation-80B-A3B-Base — базовая модель, поэтому у неё нет
единственного формата диалога, который должен автоматически применяться при
инференсе. Приведённый шаблон предназначен именно для подготовки данных к
дообучению.
Пример LoRA-дообучения
В репозитории есть минимальный пример PEFT-дообучения
finetune_lora.py. Он загружает зафиксированную ревизию
датасета tatsu-lab/alpaca, обучается только на ответах и сохраняет только
LoRA-адаптер. Для модели такого размера необходим FSDP2, пример ниже рассчитан
на четыре GPU с 80 GB памяти.
pip install \
transformers==5.16.1 \
accelerate==1.14.0 \
peft==0.20.0 \
datasets==5.0.1 \
flash-linear-attention==0.5.0
pip install flash-attn==2.8.1 --no-build-isolation
CUDA_VISIBLE_DEVICES=0,1,2,3 \
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
accelerate launch \
--use_fsdp \
--num_processes 4 \
--num_machines 1 \
--dynamo_backend no \
--mixed_precision no \
--fsdp_version 2 \
--fsdp_reshard_after_forward true \
--fsdp_auto_wrap_policy TRANSFORMER_BASED_WRAP \
--fsdp_transformer_layer_cls_to_wrap AliceAIDecoderLayer \
--fsdp_cpu_ram_efficient_loading true \
--fsdp_sync_module_states true \
--fsdp_state_dict_type SHARDED_STATE_DICT \
finetune/finetune_lora.py \
--model yandex/AliceAI-Foundation-80B-A3B-Base \
--steps 100 \
--sequence-length 512 \
--output-dir alice-lora
--mixed_precision no здесь не означает FP32-модель: базовые веса загружаются
в BF16, а LoRA-параметры PEFT хранит в FP32.
При RAM-efficient загрузке полные веса чекпоинта загружает только rank 0; остальные процессы создают модель на meta device и получают свои шарды через FSDP2.
Данная модель является предварительно обученной (pretrained) моделью и предоставляется в исходном виде, без дополнительного этапа post-training / alignment.
Модель предназначена прежде всего для исследований, экспериментов и дальнейшей доработки. Она не является готовым решением для непосредственного использования в пользовательских продуктах и сервисах.
Перед использованием модели в production-среде рекомендуется провести собственное тестирование и, исходя из сценария применения, реализовать необходимые этапы дообучения, настройки и контроля поведения модели.
Пользователь самостоятельно определяет применимость модели для конкретного сценария и несет ответственность за ее интеграцию и использование.
- Downloads last month
- 518