AI
Новости искусственного интеллекта, нейросетей и машинного обучения: релизы моделей, исследования и применение AI в бизнесе.
- Агентный RAG на бенчмарке TRuST: как тестируют многошаговый поиск — Представьте, что вы задаете системе вопрос, на который нельзя ответить одним запросом к базе знаний. Например: «Какой город является столицей страны, где родился автор книги X?» Чтобы ответить, нужно сначала найти автора, затем страну, затем столицу. Классический RAG (Retrieval-Augmented Generation)
- Нейросети опровергли гипотезы 50–90 лет: разбор трёх прорывов — В последние недели произошло то, что раньше казалось научной фантастикой: искусственный интеллект в одиночку опроверг три математические гипотезы, которые десятилетиями ставили в тупик лучшие умы человечества. Одна из них продержалась 87 лет, другая — 80, третья — около полувека. И всё это случилось
- Лучшая ASR-модель для русской IT-диктовки: новый бенчмарк 23 нейросетей — Выбор подходящей системы автоматического распознавания речи для голосового ввода на русском языке с обилием английских терминов — задача нетривиальная. Недавнее исследование, опубликованное на Habr, кардинально меняет представление о лидерах: автор протестировал 23 нейросети в более чем 60 конфигура
- Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле — Стоимость генерации миллиона токенов с помощью локальной видеокарты может варьироваться от одного рубля до более чем двадцати тысяч рублей, и решающим фактором оказывается не мощность GPU, а интенсивность её использования. В этой статье мы разберём, как такие расчёты были проведены на примере RTX 50
- Claude Fable 5 против GPT-5.6 Sol: почему разрыв в кодинге втрое и что это значит — Бенчмарк MirrorCode от Epoch AI показал неожиданный результат: Claude Fable 5 от Anthropic решил 64% задач, тогда как GPT-5.6 Sol от OpenAI справился лишь с 20%. Это втрое больше, что выглядит аномалией на фоне других тестов, где модели идут почти вровень. Разберемся, почему так произошло и какие вы
- Как получить больше от ИИ: научный подход к каждому запросу — Многие пользователи искусственного интеллекта не дожимают его потенциал, потому что формулируют запросы наобум. Вместо того чтобы просто надеяться на удачу, стоит взять на вооружение метод, который предлагает авторитетный журнал Nature: относиться к каждому промпту как к научному эксперименту. Это н
- Как изменить факты в нейросети: метод ROME на примере Эйфелевой башни — Представьте, что вы можете взять готовую языковую модель и, не переобучая её, изменить один факт — например, «переместить» Эйфелеву башню из Парижа в Рим. Именно это продемонстрировали исследователи, применив метод ROME к модели GPT-2 XL. Вместо того чтобы заново обучать нейросеть на огромных данных
- Пять требований к данным для ИИ-агентов: чек-лист от GlowByte и FanRuan — ИИ-агенты, которые подключаются к BI-системам, обещают революцию в аналитике: руководитель задаёт вопрос на естественном языке и мгновенно получает ответ. Но на практике успех таких проектов зависит не от мощности модели, а от качества данных. Если данные не готовы, агент превращается в красивую игр
- Claude Opus 5 для пенсионеров: 5 промптов для финансов, памяти и путешествий — Выход на пенсию открывает новую главу жизни, полную свободы и возможностей, но вместе с тем приносит и новые вызовы: как распорядиться накоплениями, сохранить семейные воспоминания и оставаться активным? Современные технологии, в частности языковые модели вроде Claude Opus 5 от Anthropic, способны с
- OpenAI Astra: ИИ решил 10 нерешённых задач математики — что это значит — Компания OpenAI объявила о создании новой модели искусственного интеллекта под кодовым названием Astra, которая уже на этапе внутреннего тестирования справилась с десятью задачами из области математики и теоретической информатики, считавшимися нерешёнными. Это не просто очередное улучшение чат-бота,
- ИИ-агент Saul: как GPT-5.6 Sol провалил бизнес-эксперимент и сжег $1600 — В конце июля исследовательская команда Bottleneck Labs опубликовала отчет о необычном эксперименте: агенту на базе GPT-5.6 Sol на сутки отдали настоящий бизнес — живое iOS-приложение, банковский счет с реальными деньгами и компьютер с полным доступом. Исследователи сформулировали вопрос просто: спос
- ChatGPT обновился: анализ YouTube и веб-страниц — как использовать — OpenAI сделала очередной шаг к превращению ChatGPT в универсального цифрового ассистента. Свежее обновление расширяет браузерные возможности нейросети: теперь она способна анализировать содержимое YouTube-видео, веб-страниц и даже открытых вкладок. Это значит, что вы можете задавать вопросы о ролике
- Google DeepMind представила Gemini Robotics 2: ИИ с интеллектом всего тела для роботов — 12 марта 2025 года Google DeepMind анонсировала Gemini Robotics 2 — новое поколение ИИ-моделей для робототехники, способное обрабатывать сенсорную информацию от всего тела робота одновременно. Это позволяет выполнять сложные задачи с высокой точностью и адаптивностью, что знаменует переход от узкосп
- Как работает Reasoning в LLM: почему ChatGPT иногда «думает» минуту — Вы задаёте вопрос ChatGPT, и вместо мгновенного ответа видите надпись «Thinking» — иногда на целую минуту. Неужели модель обрела сознание? На самом деле это не магия, а сложный инженерный процесс под названием Reasoning. Сегодня все ведущие языковые модели, от GPT-4o до Claude 3.5, поддерживают режи
- Июльские обновления Claude: Anthropic превращает чат-бота в автономного агента — Anthropic выпустила в июле серию обновлений для Claude, которые кардинально меняют его суть: из простого чат-бота модель превращается в автономного агента, способного запоминать предпочтения, учиться на примерах и выполнять задачи без постоянного контроля. Это не просто улучшение — это сдвиг парадиг
- Google DeepMind запускает Lyria 3.5: ИИ-музыка с новыми возможностями вокала и текстов — Компания Google DeepMind представила обновление своей модели искусственного интеллекта для создания музыки — Lyria 3.5, которая теперь доступна в составе нового сервиса Google Flow Music. Это обновление обещает значительно улучшить качество генерируемой музыки, особенно в области вокала и текстов, а
- PatientAgentBench: новый бенчмарк Amazon Science для оценки ИИ-агентов в здравоохранении — Команда Amazon Science представила PatientAgentBench — первый бенчмарк, специально разработанный для оценки ИИ-агентов, взаимодействующих с пациентами. Этот инструмент призван восполнить пробел в тестировании систем, которые общаются с людьми в медицинском контексте. В отличие от существующих решени
- Claude Opus 5 от Anthropic: обогнала Fable 5 в рейтинге Artificial Analysis и стоит вдвое дешевле — Новая флагманская языковая модель Anthropic, Claude Opus 5, обошла Fable 5 в независимом рейтинге Artificial Analysis, набрав 89,7 балла против 89,3. При этом стоимость её использования вдвое ниже, чем у предшественницы, а доступ открыт всем пользователям без ограничений. Это событие стало неожиданн
- LiteLLM: универсальный интерфейс для работы с LLM — полный гайд по использованию — LiteLLM — это легковесная библиотека с открытым исходным кодом, которая предоставляет единый интерфейс для работы с более чем 100 языковыми моделями от различных провайдеров, включая OpenAI, Anthropic, Cohere, Hugging Face, Google и многие другие. Она решает проблему фрагментации API, позволяя разра
- Как работает ИИ-напарник для ритейла: мультиагентная платформа GlowByte — Категорийный менеджер в крупной розничной сети ежедневно сталкивается с десятками отчётов: продажи, остатки, маржа, акции, конкурентные цены. Систем много, а целостной картины не хватает. Компания GlowByte предложила решение — мультиагентную платформу, которая выступает не просто чат-ботом, а полноц