О сборе данных, «слепых зонах» и идеальном сборнике
— Откуда вы получаете данные и как с ними работаете?
Основным источником информации для подготовки сборника служат данные Росстата. Их дополняют результаты мониторинговых обследований, проводимых нашим институтом (ИСИЭЗ НИУ ВШЭ). Они позволяют расширить представления о науке, об отношении к ней населения за счет индикаторов, отсутствующих в статистике. Сборник также содержит данные Федерального казначейства о финансировании исследований и разработок, Роспатента и Всемирной организации интеллектуальной собственности — о патентной активности и лицензионной деятельности, базы Scopus — о публикационной активности, ОЭСР, Евростата, ЮНЕСКО, Всемирного банка, Статкомитета СНГ и других организаций по целому спектру показателей, характеризующих развитие науки за рубежом. Экспертные и прогнозные оценки, результаты моделирования мы в этом издании не используем — только официальную статистическую информацию.
— Используете ли вы ИИ при анализе данных?
Мы постоянно экспериментируем с новыми цифровыми технологиями, но возможности применения ИИ при формировании сборника пока ограничены. Большинство статистических данных публикуется в формате сводных таблиц, а не микроданных, автоматизировать (в том числе с использованием ИИ) работу с которыми было бы гораздо проще. Во-первых, структура таблиц регулярно меняется, обновляется вслед за изменениями форм статистических наблюдений. Это путает ИИ, он не может корректно сопоставить данные и построить временны́е ряды. Во-вторых, ИИ пока допускает ошибки при считывании количественных показателей, цифр, может менять их местами или «выдумывать». Так что доверить ему формирование таблиц и графиков мы не можем и полагаемся на привычные цифровые инструменты, например, макросы в Excel. При этом мы внимательно следим за развитием ИИ, ждем, когда он сможет стать нам надежным помощником.
— Есть ли в статистике «слепые зоны» — показатели, критически важные для понимания состояния науки, но сложные для оценки?
Когда работаешь со статистикой, с количественными данными, всегда чего-то не хватает — хочется оценить, измерить новые явления, собрать информацию для более глубокого, сложного анализа. Например, сейчас меня и мою команду интересует деятельность платной аспирантуры. Мы не знаем, чем она отличается от «бюджетной». Хотелось бы иметь данные о движении аспирантов, обучавшихся в этом формате: какая доля и на каких этапах отчисляется, а какой процент защищает кандидатские диссертации.
Еще одна «слепая зона», причем не только для российской статистики, — оценка использования интеллектуальной собственности. Мы знаем, что число патентов на изобретения, в отношении которых в России регистрируются распоряжения исключительными правами, в последние годы варьирует в диапазоне 4−6 тыс. в год. При этом Роспатент ежегодно выдает порядка 20−30 тыс. новых патентов на эти объекты интеллектуальной собственности. Что же происходит с остальными? Используют ли их патентообладатели в собственных интересах, или они образуют пассивный запас? Пока никто в мире не может точно оценить долю запатентованных решений, вовлекаемых в экономический оборот.
— Какие разделы вам бы хотелось добавить в сборник? Видите ли вы возможности для его усовершенствования?
Сборник агрегирует всю доступную количественную информацию о российской науке, представляет ее в простом и понятном виде. Хотелось бы на какое-то время сохранить его структуру и содержание: читателям удобно пользоваться знакомой навигацией, они знают, что́ и где искать, как работать с показателями, как их интерпретировать. А вот сроки подготовки сборника хотелось бы сократить — с учетом темпа жизни, происходящих изменений данные должны быть не только объективными и полными, но и актуальными. Росстат также стремится быстрее публиковать результаты своих обследований. Мы с коллегами готовы поддержать эту динамику и постоянно ищем инструменты, которые позволят оптимизировать и ускорить работу. Не в ущерб качеству, конечно.