Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Google представила Science One: ИИ-фреймворк, доказывающий каждое утверждение и исключающий фантомные ссылки.

Google представила фреймворк Science One, который нацелен на создание научных исследований с полной проверяемостью каждого утверждения.

Современные исследовательские ИИ-агенты уже умеют искать литературу, выдвигать гипотезы и проводить эксперименты, но основной проблемой остаются выдуманные ссылки, расхождения между текстом и кодом, а также невоспроизводимые результаты.

Как работает Science One

В основе фреймворка лежит концепция Chain of Evidence (цепочка доказательств). Каждое число, вывод, ссылка и описание алгоритма должны вести к конкретному источнику:

  • научная статья;
  • фрагмент кода;
  • лог эксперимента;
  • таблица с результатами.

Процесс разбит на три этапа:

  1. Система изучает до 100 полнотекстовых работ и строит граф источников.
  2. Параллельно проверяются несколько гипотез, различные реализации и варианты решений.
  3. Формируется статья, после чего каждое утверждение отдельно сверяется с исходными данными.

Аудит CoE Audit

Для проверки достоверности Google разработала CoE Audit. Эта система повторно запускает код, перепроверяет ссылки, выявляет подмену условий задачи и сравнивает описание метода с фактической реализацией.

Результаты тестов

По данным разработчиков, у некоторых исследовательских агентов доля несуществующих источников достигала 21%. В экспериментах Science One показал нулевое число фантомных ссылок и полностью воспроизводимые результаты.

Пока проект находится на стадии экспериментального прототипа. Детальное описание представлено в блоге Google Research.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.