f↗foldiffresearch beta
← Все статьи
ДАННЫЕ · АКТУАЛЬНО В 2026

FireProtDB 2.0: почему больше данных не означает точнее любой прогноз

FireProtDB 2.0 расширяет наборы измерений и типы вариантов. Для практической интерпретации важнее совместимость условий и происхождение записи, чем размер базы. Текущая сверка Foldiff не означает использование всей версии 2.0.

Что изменилось в базе

В статье выпуска 2026 года авторы описывают переход от базы одиночных замен к более гибкой схеме хранения. FireProtDB 2.0 содержит около 5,47 миллиона экспериментов и поддерживает в том числе множественные замены, вставки, делеции и значения для исходных белков.

Эти числа описывают базу авторов. Их нельзя переносить на объём обучения или сверки Foldiff. В текущем продукте используется существующая интеграция и сохранённые сведения; переход на новую схему требует отдельной проверки сопоставления записей.

Почему записи не взаимозаменяемы

В базах могут соседствовать абсолютные и относительные показатели, разные конструкты и методы. Авторы отдельно отмечают особенности крупных наборов малых доменов и оценок, полученных через протеолиз. Такие данные нельзя автоматически считать прямыми измерениями одного и того же термодинамического свойства.

Практический вопрос для пользователя — подходит ли запись к его образцу. Сверьте последовательность, нумерацию, наличие тегов, домены и исходные условия. Совпавшее обозначение замены ещё не гарантирует совпадения экспериментального контекста.

Как читать сверку в Foldiff

Вкладка «Основания» показывает найденные измерения отдельно от предикторов. Если измерение расходится с расчётом, это повод изучить условия и конструкцию. Если запись не найдена, сервис не должен превращать отсутствие сведений в подтверждение стабильности.

В сохранённом примере субтилизина отображаются восемь измеренных одиночных замен; две совпадают с проверяемым списком и расходятся с вычисленным направлением. Это характеристика конкретной сверки, а не процент ошибки всей платформы или всей базы FireProtDB.

Избегайте утечки между обучением и проверкой

Модель может оцениваться слишком оптимистично, если похожие белки или те же измерения оказались одновременно в обучении и контрольном наборе. Поэтому важно разделение по белковым семействам, явное происхождение данных и независимые новые эксперименты.

Для основной модели Foldiff текущая сверка с FireProtDB не заявляется независимой научной валидацией. Численные контроли сервера подтверждают воспроизводимость реализации, но не гарантируют перенос на ваш фермент. Лабораторный пилот остаётся отдельным источником доказательств.

Что полезно сохранить для будущего анализа

  • Идентификатор и последовательность фактического конструкта.
  • Определение показателя и соглашение о знаке.
  • Условия, единицы, номер серии и тип повторов.
  • Исходные измерения WT и вариантов, а не только итоговое среднее.
  • Версию расчёта и ссылки на использованные записи.

Такой набор позволяет повторно разобрать серию при обновлении базы и отличить изменение данных от изменения алгоритма. В текущей бете измерения можно сохранить CSV и JSON; автоматическое переобучение не включено.

Источники и проверка

  1. FireProtDB 2.0, Nucleic Acids Research, выпуск 2026
  2. Официальная база FireProtDB
  3. Данные и границы Foldiff

Ссылки проверены 2 октября 2026. Материал подготовлен с помощью ИИ и сверкой с кодом Foldiff; внешняя научная рецензия не проводилась.

Проверьте путь на публичном примере

Исследуйте кандидатов, создайте серию и разберите учебные измерения.

Попробовать Foldiff ↗