С 20 по 26 июля повестка научной инфраструктуры сместилась от вопроса «где разместить результат» к более сложному: что должно находиться вокруг него, чтобы размещение действительно имело смысл. Crossref предложила оценивать идентификаторы вместе с метаданными и управлением, США инвестируют в соединение научных ресурсов с вычислениями и ИИ, а новые исследования показывают разрыв между формальной публикацией и реальным повторным использованием.
20 июля Crossref выпустила первую собственную позиционную работу о роли постоянных идентификаторов, или PID, в государственной и международной политике научной инфраструктуры. Главный тезис сформулирован предельно ясно: выбирая систему идентификаторов, организация фактически выбирает не формат метки, а окружающую её инфраструктуру.
Crossref выделяет три взаимозависимых слоя: постоянные идентификаторы, открытые связанные метаданные и устойчивое управление обслуживающей организацией. Без метаданных идентификатор не объясняет, что именно находится по адресу, как объект связан с авторами, организациями, грантами и другими результатами. Без сервисов эти связи невозможно эффективно искать и обрабатывать. Без долгосрочного финансирования и управления обещание постоянства остаётся обещанием.
Отдельно организация предупреждает: не все DOI эквивалентны. У регистрационных агентств различаются схемы метаданных, сервисы, правила управления и возможности связывания объектов. Единого централизованного хранилища всех метаданных DOI не существует. Поэтому формулировка «присвоить DOI» в политике или техническом задании оставляет открытым слишком много вопросов.
Разумеется, документ отражает позицию самого Crossref и не является независимым сравнительным исследованием регистрационных агентств. Но практический вывод применим шире: требования к инфраструктуре следует формулировать через ожидаемый результат. Какие сведения должны быть машиночитаемыми? Какие связи поддерживаются? Можно ли свободно выгрузить записи? Кто исправляет ошибки? Как обеспечивается работа сервиса через десять лет?
Иначе закупка инфраструктуры легко сводится к приобретению узнаваемой аббревиатуры. Ценность создаёт не метка, а поддерживаемая система вокруг неё.
Источники: позиционная работа Crossref, редакционное объяснение
21 июля Белый дом опубликовал доклад Science: A New Golden Age, а на следующий день объявил о федеральных обязательствах на сумму более $5 млрд для расширения Genesis Mission — американской программы применения ИИ в научных исследованиях. Сама миссия запущена ещё в ноябре 2025 года; событием недели стало объявление масштаба её финансирования и переход к отбору конкретных проектов.
Более 15 федеральных ведомств должны предоставить исследовательские гранты, специализированные научные массивы и доступ к инфраструктуре. Общим техническим слоем станет создаваемая Министерством энергетики American Science and Security Platform, соединяющая исследователей с информационными ресурсами, высокопроизводительными вычислениями и инструментами ИИ.
Министерство энергетики одновременно отобрало для переговоров 278 проектов с участием 342 организаций. Среди них 142 университета, 157 компаний, 16 национальных лабораторий и другие учреждения. Однако отбор ещё не равен фактической выдаче денег: ведомство отдельно указывает, что проекты должны пройти переговоры, после которых решение может быть изменено или отменено.
Более предметный инфраструктурный слой появился в программе Национального научного фонда США. NSF объявил о $83 млн для шести систем национального масштаба. Одни проекты должны связать распределённые репозитории с вычислительными мощностями, другие — создать воспроизводимые рабочие процессы, унифицированные веб-среды или автоматизированную обработку метаданных. В этой конструкции научный объект должен не просто лежать в каталоге, а перемещаться между хранилищем, вычислительной средой и инструментами анализа.
Это важный сдвиг в разговоре об ИИ для науки. Модель не существует отдельно от каталогов, форматов, происхождения материалов, вычислительных ресурсов и средств проверки результата. Впечатляющий алгоритм без такого слоя остаётся дорогим способом обнаружить, что файлы называются final_v2_really_final.
При этом масштаб финансирования ещё не гарантирует совместимость и доступность. В заявлениях много говорится о национальном лидерстве, безопасности и конкурентоспособности, но значительно меньше — об условиях доступа, переносимости результатов, открытых интерфейсах и независимой проверке. Именно по этим свойствам позднее можно будет отличить общую научную инфраструктуру от набора крупных, но изолированных платформ.
Источники: Белый дом, Министерство энергетики США, NSF, доклад Science: A New Golden Age
20 июля на bioRxiv появился препринт с результатами автоматизированного анализа 784 262 биомедицинских статей открытого доступа, опубликованных с января 2024-го по июнь 2025 года. Авторы искали заявления о доступности материалов, проверяли признаки размещения в репозиториях и сопоставляли результаты с информацией о журналах и финансирующих организациях.
Общая доля публикаций с обнаруженными открытыми материалами составила 8,7%. Среди статей, для которых в метаданных удалось определить финансирующую организацию, показатель вырос до 11,7%. У ведущих фондов наблюдаемая доля достигала 20–24%, а у отдельных журналов — 70–86%.
Разброс показывает, что само наличие политики не обеспечивает одинакового исполнения. На результат влияют требования журнала, дисциплинарные практики, инфраструктура и способ контроля. Возможно, важна и близость проверки к моменту публикации: редакционная система способна потребовать исправление ссылки непосредственно перед выходом статьи, тогда как фонд обычно оценивает выполнение требований значительно позднее.
Но исследование одновременно обнаружило проблему самого измерения. Анализ полнотекстовых PDF находил примерно на 52% больше заявлений о публикации материалов, чем обработка структурированного XML тех же статей. Значит, оценка соблюдения политики зависит не только от поведения исследователей, но и от того, какую версию публикации умеет прочитать проверяющая система.
Работа пока не прошла рецензирование, а автоматическое обнаружение заявления не равнозначно ручной проверке пригодности каждого набора. Файл может существовать, но не содержать понятной документации или необходимых переменных. Тем не менее полученный порядок величин важен: между требованием и подтверждённым исполнением остаётся большая дистанция.
Следующий логичный шаг — стандартизировать машиночитаемые сведения о доступности, проверять разрешение ссылок и идентификаторов и отделять наличие файла от его пригодности для повторной работы. Иначе мониторинг будет измерять качество оформления заявления, а не доступность исследовательского результата.
Источник: bioRxiv
22 июля платформа MetaROR опубликовала редакционную оценку и три открытые рецензии исследования повторного использования биомедицинских наборов, размещённых сотрудниками берлинской клиники Charité в 2020–2023 годах. Авторы искали упоминания наборов в научной литературе с помощью Data Citation Corpus.
К февралю 2025 года прямые ссылки были обнаружены у 4,9% опубликованных наборов. Всего 175 объектов получили 1 497 упоминаний. Повторное использование концентрировалось в омиксных направлениях, где материалы обычно лучше стандартизированы и сопровождаются дисциплинарными метаданными.
Отдельный анализ показал, что значительная часть использования остаётся невидимой при поиске только прямых ссылок на наборы. Исследователи экстраполировали ещё около 846 случаев, в которых авторы ссылались не на сам объект, а на описывающую его статью. Это не просто техническая погрешность: система научного признания продолжает лучше видеть публикацию, чем стоящий за ней массив.
Самый провокационный результат — наличие DOI и лицензии Creative Commons не показало положительной связи с вероятностью повторного использования. Зато востребованность была выше при наличии дисциплинарного описания или отдельной статьи о наборе. DOI помогает устойчиво сослаться на объект, а лицензия сообщает условия использования, но ни один из этих элементов не объясняет содержание и не делает материал подходящим для конкретной исследовательской задачи.
У работы есть ограничения. Она посвящена одной организации, а ссылка в литературе используется как приближённый показатель повторного использования. Набор могут применять без корректного цитирования или изучить, но не включить в публикацию. И всё же результат хорошо показывает различие между доступностью и востребованностью. Публикация заканчивается после загрузки файлов. Подготовка к повторному использованию — нет.
Источник: MetaROR
20 июля NASA открыла первый массив калиброванных материалов радара L-диапазона миссии NISAR — совместного проекта NASA и Индийской организации космических исследований. В первоначальный выпуск вошли наблюдения, полученные начиная с 17 июня. Более ранние результаты первого года работы будут добавляться постепенно; полный научный массив ожидается к концу 2026 года.
Материалы доступны через NASA Earthdata и Alaska Satellite Facility. Помимо графических поисковых сервисов предусмотрены API и Python-библиотека. Это существенная часть выпуска: большой массив становится рабочим ресурсом, когда пользователь получает не только файлы, но и средства обнаружения, отбора и программного получения.
Постепенная публикация также задаёт проверяемое ожидание по полноте. Пользователь понимает, какой период уже доступен, что находится в обработке и когда должен появиться остальной архив.
Источники: NASA Earthdata Forum, страница NISAR
21 июля Vivli и Alzheimer’s Disease Data Initiative запустили конкурс на основе гармонизированных контрольных групп 11 клинических испытаний болезни Альцгеймера. В единый массив вошли сведения о 7 089 участниках, собранные пятью фармацевтическими компаниями более чем за 20 лет.
Участникам предложены три направления: половые различия, скорость прогрессирования заболевания, а также его подтипы и неоднородность. Работа проводится в защищённой облачной среде Vivli. Общий призовой фонд составляет $75 тыс.
Ценность проекта не только в доступе к ранее разрозненным исследованиям. Организаторы предварительно гармонизировали материалы, сформулировали исследовательские вопросы и предоставили среду анализа. Это превращает контролируемый доступ из административного препятствия в управляемый сценарий повторного использования. Чувствительные сведения не обязательно выкладывать без ограничений, чтобы они начали работать за пределами первоначальных исследований.
Источник: Vivli
23 июля в Quantitative Science Studies вышла журнальная версия исследования практик 8 822 учёных немецких университетов. Авторы обнаружили значительные различия не только между крупными дисциплинами, но и между отдельными предметными областями внутри них.
На готовность делиться результатами влияют способы их производства, зависимость от сторонних источников и возможность интерпретировать материалы вне первоначальной исследовательской среды. Особенно заметны различия в экспериментальных областях.
Практический вывод касается систем мониторинга: единый процент публикации материалов может сравнивать несопоставимые процессы. В одной области стандартизированный массив возникает естественным побочным продуктом оборудования, в другой его подготовка требует удаления чувствительной информации, расшифровки качественных материалов и передачи большого объёма контекста. Политику можно устанавливать общую, но оценка исполнения должна учитывать дисциплинарные условия.
Исследование основано на самоотчётах учёных одной страны, поэтому его показатели нельзя механически переносить на всю научную систему. Его сильная сторона не универсальная цифра, а демонстрация того, насколько много теряет усреднённая цифра.
Источник: Quantitative Science Studies
События недели описывают последовательную цепочку. Crossref требует смотреть за пределы идентификатора. Американские программы соединяют массивы с вычислениями, инструментами и исследовательскими процессами. Работы о публикации и повторном использовании показывают, что формальное выполнение требований ещё не создаёт научной ценности. NISAR и Vivli демонстрируют два разных способа закрыть этот разрыв: публичный программный доступ и защищённая среда с предварительно гармонизированными материалами.
Зрелость инфраструктуры поэтому нельзя измерить только числом DOI или загруженных наборов. Нужны сведения о том, можно ли объект обнаружить, понять, связать с другими результатами, получить на прозрачных условиях, обработать доступными средствами и использовать в новой работе.
Сам по себе файл хранит прошлое исследование. Инфраструктура должна позволять начать с него следующее.