С 21 по 27 сентября научная инфраструктура занялась не столько накоплением новых записей, сколько правилами их включения и проверки. NIH связал воспроизводимость с поиском литературы и будущим финансированием, российские исследователи раскрыли ограничения корпуса химических реакций, а создатели синтетических и гармонизированных ресурсов обозначили границу между наблюдением, производной записью и модельной конструкцией. Нейтральной таблицы снова не получилось — и это, пожалуй, хорошая новость.
24 сентября Национальные институты здоровья США объявили общеагентскую инициативу по репликации и воспроизводимости исследований. План объединяет три направления: продолжение независимых проверок и стандартизации сведений, создание стимулов для репликационных работ и формирование постоянной инфраструктуры, которая должна закрепить такие исследования как самостоятельную научную практику.
Одновременно Национальная медицинская библиотека запустила первую публичную версию Linked Discoveries. Экспериментальный сервис охватывает более 29 млн публикаций PubMed и строит вокруг выбранной статьи граф связанного корпуса. Пользователь может просматривать связи цитирования, обзоры, ретракции и работы с финансированием NIH, а также фильтровать окружение по заболеваниям, генам и химическим веществам. Для поиска используется подход с элементами искусственного интеллекта. National Institutes of Health (NIH)
NIH подчёркивает существенное ограничение: Linked Discoveries не оценивает качество работы и не устанавливает, была ли она успешно воспроизведена. Это навигатор, а не автоматический арбитр истины. Такая оговорка принципиальна — граф близости способен помочь найти опровержение, но способен и красиво визуализировать группу статей, повторяющих одну исходную ошибку.
Масштаб замысла выходит за пределы интерфейса. Подготовленная ранее программа R3PEATS предусматривает, среди прочего, согласованные исследования одного вопроса несколькими командами, обучение молодых специалистов, а также проекты по инструментам, метрикам и инфраструктуре научной строгости. Концептуальный документ предполагает $161,71 млн на пять лет и девять грантов, но прямо оговаривает зависимость финансирования от наличия средств и качества заявок. Это пока архитектура программы, а не отчёт о состоявшихся расходах. National Institutes of Health (NIH)
Полезность инициативы определит не количество найденных «соседних» статей, а качество связей между объектами. Для реальной проверки нужно соединять публикацию с протоколом, версиями данных и кода, отрицательными результатами, исправлениями и независимыми повторениями. Иначе воспроизводимость рискует стать ещё одним поисковым фильтром — удобным, но необязательным.
Источники: NIH — запуск Linked Discoveries; NIH — общеагентская инициатива; концепция R3PEATS
25 сентября Scientific Data опубликовал рецензированное описание набора асимметрических органокаталитических реакций Манниха. Его подготовили Константин Васечкин, Илья Никитин и Максим Федоров из ИППИ РАН; Никитин также представляет Институт искусственного интеллекта Университета ИТМО. Работа поддержана Министерством экономического развития России.
Авторы вручную извлекли 4 015 реакций из 153 публикаций 2000–2025 годов. Корпус охватывает 468 уникальных органокатализаторов и содержит структуры реагентов и катализаторов, условия проведения, выходы, энантиомерный избыток — показатель преобладания одной зеркальной формы вещества — и рассчитанную разницу энергий активации. Структуры и параметры представлены в машиночитаемом виде; вместе с таблицами опубликованы трёхмерные файлы молекул и вычислительные тетради для воспроизведения иллюстраций статьи. Scientific Data
Ценность здесь создаёт именно курация. Химические названия, обозначения стереохимии и условия эксперимента плохо переживают простое автоматическое извлечение из статей. Авторы использовали явные критерии включения и исключения, а публикации обрабатывались с независимой проверкой. Даже стандартная строковая запись молекулы оказалась недостаточной для некоторых видов осевой хиральности, поэтому соответствующий признак пришлось хранить отдельно.
Но корпус не следует принимать за нейтральную карту всей реакции Манниха. Научная литература предпочитает удачные эксперименты: медианный энантиомерный избыток в наборе составляет 89,4%, медианный выход — 83%. Около 87% записей приходятся на четыре класса катализаторов. Некоторые потенциально существенные параметры, включая содержание воды в растворителе и использование молекулярных сит, систематически сохранить не удалось из-за непоследовательного описания в первичных статьях.
Это важное предупреждение для химического машинного обучения. Модель может превосходно усвоить опубликованный корпус и всё равно плохо понимать пространство неудачных реакций, редких катализаторов и незафиксированных условий. «Готово для ИИ» означает пригодный формат, но не репрезентативность. Лучший следующий шаг для такого ресурса — не только добавление новых успешных опытов, но и договорённость о публикации отрицательных результатов и минимальном составе экспериментальных метаданных.
Источник: Scientific Data — описание набора, методика и ограничения
26 сентября Scientific Data опубликовал PRIME-CVD — учебную среду для анализа сердечно-сосудистого риска. Она содержит два открытых ресурса, каждый из которых представляет одну и ту же полностью синтетическую когорту из 50 тыс. взрослых. Записи сгенерированы заново на основе причинного графа, агрегированной австралийской статистики и опубликованных эпидемиологических оценок; реальные строки электронных медицинских карт для построения генератора не использовались.
Первый ресурс представляет собой чистую аналитическую таблицу для статистического моделирования. Второй намеренно превращает ту же когорту в три связанные таблицы, похожие на электронные медицинские записи: в них внесены пропуски, разнородные названия показателей, разные единицы измерения, преобразованные идентификаторы и распределённые по времени записи. Чтобы получить исходную когорту, студенту приходится выполнять соединение таблиц, нормализацию и проверку качества — ту часть медицинской аналитики, которую демонстрационные наборы обычно предусмотрительно убирают. nature.com
Файлы распространяются под CC BY 4.0, а код генерации, быстрые примеры на Python и R и учебные материалы размещены в открытом репозитории. Параметрическая схема позволяет преподавателю изменить допущения и собрать другую когорту. Поскольку ни одна строка не соответствует реальному человеку, отсутствуют прямые и косвенные идентификаторы и не возникает обычного риска повторной идентификации пациента. nature.com
Синтетика здесь используется по назначению: не как замена клиническому доказательству, а как безопасный тренажёр. Авторы прямо предупреждают, что обученные на PRIME-CVD модели нельзя применять в клинике. Более того, искусственно внесённый беспорядок неизбежно ограничен фантазией разработчиков; настоящая информационная система способна ломаться гораздо изобретательнее.
Тем не менее подход решает важную инфраструктурную задачу. Перед выдачей доступа к защищённой информации исследователь может освоить соединение, документирование, контроль единиц и анализ пропусков на ресурсе с известной «истиной». Синтетический набор не отменяет управляемый доступ к реальным наблюдениям, но уменьшает число ошибок, с которыми новичок впервые встречается уже внутри защищённого контура.
Источники: Scientific Data — описание PRIME-CVD; первый ресурс на Figshare; код и учебные материалы
25 сентября вышло рецензированное описание VSET — производной базы, построенной из трёх защищённых обследований Eurostat: образования взрослых за 2022 год, рабочей силы за 2023-й и структуры заработков за 2018-й. Открытая версия охватывает 22 страны, 39 переменных и 1 440 134 уникальных сочетания демографических и профессиональных признаков.
Строки VSET не связывают конкретных респондентов: это агрегированные профили, сопоставленные по стране, полу, возрастной группе, профессии и режиму рабочего времени. В наборе нет интегрированных обследовательских весов, поэтому по частоте строк нельзя оценивать численность населения. Ноль в полях заработка может означать отсутствие сведений после сопоставления, а не нулевой доход. Код, таблицы перекодировки и схема сборки открыты, но воспроизведение из первичных файлов требует разрешения Eurostat. nature.com
Это разумная модель публикации производного ресурса из чувствительных источников: открыть методику, структуру и безопасный результат, не распространяя исходные микроданные. Одновременно она показывает цену гармонизации. Чем больше обследований сводится в общую таблицу, тем настойчивее нужно повторять, что совпавший профиль — не один и тот же человек, а совместимость категорий — ещё не причинная связь.
Источники: Scientific Data — описание VSET; набор VSET в Zenodo; воспроизводимый конвейер
26 сентября исследователи из Китая и Великобритании опубликовали таблицу соответствий между китайской, британской и классификацией цифровых отраслей ОЭСР. Все три системы приведены к NACE Rev. 2 — европейскому классификатору видов экономической деятельности. Различия были проверены почти на 14,8 млн компаний из коммерческой базы Orbis.
Результат наглядно показывает силу определения. Китайская рамка отнесла к цифровой экономике 22,92% компаний, британская — 4,88%, классификация ОЭСР — 3,81%. Первая включает широкий круг традиционных отраслей, преобразованных цифровыми технологиями; две другие сосредоточены преимущественно на ИКТ и информационных услугах. nature.com
В публичном депозите находятся таблицы соответствий Китая, Великобритании и ОЭСР, объединённая карта из 94 кодов NACE и переход к товарной классификации HS 2017. Исходная таблица почти 14,8 млн компаний в перечень опубликованных файлов не входит. К тому же авторы собирали соответствия вручную в Excel, поэтому будущие обновления классификаторов потребуют отдельного сопровождения. nature.com
Crosswalk — таблица перехода между классификаторами — не устраняет концептуальное различие, зато делает его измеримым. Это лучше иллюзии единого показателя: прежде чем сравнивать страны, полезно выяснить, сравнивают ли они один объект. Но открытая методика не превращает автоматически в открытые данные коммерческую базу, на которой проверялся результат.
Источники: Scientific Data — описание сопоставления; таблицы в Mendeley Data
Сюжеты недели сходятся в одной точке. Linked Discoveries выбирает соседство публикаций; химики решают, какие реакции достаточно описаны для включения; PRIME-CVD проектирует контролируемый беспорядок; VSET сопоставляет профили вместо людей; три определения цифровой экономики проводят три разные границы через одни и те же компании.
Поэтому качественная инфраструктура не обязана притворяться нейтральной. Её задача — сохранять происхождение решений: что включили, что отбросили, как преобразовали, какой информации не было и какие выводы после этого запрещены. Набор становится надёжнее не тогда, когда редакторское суждение исчезает, а когда его можно увидеть и проверить.