что мы измерили

Исследования

Каждая запись — один вопрос, замер против контролей и то, что не получилось. Код и данные открыты: наши цифры пересчитываются одной командой.

Здесь только наши собственные замеры. Пересказы чужих статей — в блоге.

В каждой записи обязательно есть то, что не получилось: отрицательных результатов у нас больше, чем положительных, и именно они определяют, чем мы занимаемся дальше.

Где выложены код и данные — ссылка стоит в самой записи, вместе с командой, которой наши цифры пересчитываются.

Дешёвый скор по навыкам обошёл GPU-реранкеры: как мы отсекаем мусорных кандидатов до LLM

В нашем матчинге кандидатов почти половина того, что доходит до дорогого LLM-этапа — мусор. Мы перебрали GPU-реранкеры, дообучение CrossEncoder и комбо признаков, чтобы отфильтровать его дешевле. Победил самый простой сигнал — пересечение навыков. Разбираем цифры, что сработало и почему текст проиграл навыкам.

Авторы: slavb18

  • AI
  • HR Tech
  • LLM
  • Information Retrieval
  • Reranking
  • Cross-Encoder
  • Sentence Transformers
  • Embeddings
  • Matching
  • MLOps
  • Cost Optimization
  • bge-reranker
  • Russian Language Processing
  • Machine Learning

Латентные дебаты между LoRA-экспертами: две роли из трёх читаются, а канал теряет говорящего

Совет LoRA-экспертов обменивается скрытыми состояниями, а мы пытаемся подслушать обмен. Мысль отдельного эксперта читается, само сообщение канала — теряет автора в 75 случаях из 75. С граблями, замерами, контролями и открытым кодом.

Авторы: slavb18

  • AI
  • LLM
  • LoRA
  • ML
  • Research
  • Latent Space
  • HRTech

Сжать четыре токена в один вектор: запускаем автоэнкодер CALM на доменных данных (и на одном CPU)

Взяли автоэнкодер из свежей работы CALM (Continuous Autoregressive Language Models), который учится упаковывать чанк из K=4 токенов в один непрерывный вектор и разворачивать обратно, и обучили его не на 15 миллиардах токенов Pile на 8 GPU, как в оригинале, а на 18 тысячах коротких строк с требованиями из IT-вакансий - на обычной машине без видеокарты. По дороге выгребли три классических грабли (flash-attn без CUDA, deepspeed, который не импортируется под NumPy 2.x, и тихий OOM на 33 ГБ логитов). Ниже - подробный разбор архитектуры, конфигов и честные результаты round-trip-реконструкции.

Авторы: slavb18

  • CALM
  • Автоэнкодер
  • Машинное обучение
  • Глубокое обучение
  • NLP
  • LLM
  • CPU
  • Domain Adaptation
  • Python
  • VAE
  • Оптимизация
  • Разработка
  • Инфраструктура
  • NumPy 2.0
  • DeepSpeed
  • Flash Attention
  • GPU-free

Поиск идеального матча: тестируем локальные Cross-Encoder модели против NVIDIA Reranker в HR-домене

Практический эксперимент по сравнению локальных кросс-энкодеров (RUbert, BAAI) с облачным реранкером NVIDIA на реальных данных сопоставления вакансий и кандидатов.

Авторы: slavb18

  • AI
  • HR
  • NLP
  • Rerankers
  • Docker