DeepSeek
9 публикаций
Три крупных открытых модели 2025-го отличаются философией и сильными сторонами. GPT-OSS-120B — «экономный работяга» с MoE-хитростями для реального деплоя. Qwen3-235B — длинноокончатый специалист для больших документов и мультиязыка. DeepSeek-R1 — тяжёлая артиллерия с само-проверкой и обучением через усиление (RL), заточенная под сложное...
Если раньше обучение больших языковых моделей (LLM) казалось чем-то вроде магии, то сегодня оно постепенно превращается в инженерное ремесло. Character.AI решила сделать шаг навстречу сообществу и открыла проект pipeling-sft — лёгкий, но мощный фреймворк для дообучения моделей с архитектурой Mixture-of-Experts (MoE), таких...
Современные языковые модели уже не просто подбирают слова. Они улавливают смысл, распознают намерения и ориентируются в контексте. Всё это — благодаря эмбеддингам: векторным представлениям, лежащим в основе «понимания» текста нейросетями.
Что такое эмбеддинг?
Если совсем просто — это способ превратить текст в набор чисел,...
Подписывайтесь
на наш телеграм-канал
Подписаться
на наш телеграм-канал