Содержательная и неожиданная критика из рецензий.
Один из рецензентов пишет, что бенчмарки – это прекрасно, но что насчет практической применимости, эмпирических и теоретических ограничений метода и возможностей для улучшений? Как дела с генерализацией и переносом между доменами? Другой рецензент критикует отсутствие failure cases и анализа накопления ошибок при последовательном применении компонентов пайплайна. Да, эти претензии можно было б дезавуировать, сразу оговорившись, что превосходство предлагаемого подхода рассматривается только! в контексте стандартных бенчмарков, и измеряется только! в стандартных метриках качества, и не проявляется нигде и никак больше. К сожалению, формальный подход к тестированию и научная строгость в изложении результатов сделают ценность вашей работы довольно сомнительной.
Как же разрешить эту неловкую и, пожалуй, парадоксальную ситуацию, в который мы все оказываемся, когда пытаемся втиснуть свои наработки в стандарты научной работы?
Для начала, нужно помнить, что вашу работу будут оценивать не формалисты и ригористы, а такие же оппортунисты-исследователи, которые понимают ограничения существующих процедур тестирования. Но оценки они будут ставить не за свое понимание, а за ваше. Ваша задача – это понимание продемонстрировать. Некритический незамутненный восторг от выбивания state-of-the-art результатов надо испытать в рабочее время, а потом выдохнуть, снова стать ученым, и описать свои достижения в аналитическом нейтральном ключе.
Поэтому стоит оставить место под рассуждения в свободном стиле о:
По возможности также стоит продемонстрировать работу вашего метода in the wild, на реальных данных. Хорошо, если получится собрать данные, на которых по сравнению с бенчмарками преимущества вашего метода особенно заметны или особенно важны. В любом случае стоит попытаться проанализировать полученные качественные результаты, выявить случаи успешного срабатывания и failure cases, которых нет в бенчмарках и предложить объяснения наблюдаемым эффектам.
Один из рецензентов пишет, что бенчмарки – это прекрасно, но что насчет практической применимости, эмпирических и теоретических ограничений метода и возможностей для улучшений? Как дела с генерализацией и переносом между доменами? Другой рецензент критикует отсутствие failure cases и анализа накопления ошибок при последовательном применении компонентов пайплайна. Да, эти претензии можно было б дезавуировать, сразу оговорившись, что превосходство предлагаемого подхода рассматривается только! в контексте стандартных бенчмарков, и измеряется только! в стандартных метриках качества, и не проявляется нигде и никак больше. К сожалению, формальный подход к тестированию и научная строгость в изложении результатов сделают ценность вашей работы довольно сомнительной.
Как же разрешить эту неловкую и, пожалуй, парадоксальную ситуацию, в который мы все оказываемся, когда пытаемся втиснуть свои наработки в стандарты научной работы?
Для начала, нужно помнить, что вашу работу будут оценивать не формалисты и ригористы, а такие же оппортунисты-исследователи, которые понимают ограничения существующих процедур тестирования. Но оценки они будут ставить не за свое понимание, а за ваше. Ваша задача – это понимание продемонстрировать. Некритический незамутненный восторг от выбивания state-of-the-art результатов надо испытать в рабочее время, а потом выдохнуть, снова стать ученым, и описать свои достижения в аналитическом нейтральном ключе.
Поэтому стоит оставить место под рассуждения в свободном стиле о:
- теоретических ограничениях метода, обусловленных его устройством;
- возможностях практического применения метода, наиболее выигрышных сценариях использования метода и его ограничениях;
- потенциальных усовершенствованиях.
По возможности также стоит продемонстрировать работу вашего метода in the wild, на реальных данных. Хорошо, если получится собрать данные, на которых по сравнению с бенчмарками преимущества вашего метода особенно заметны или особенно важны. В любом случае стоит попытаться проанализировать полученные качественные результаты, выявить случаи успешного срабатывания и failure cases, которых нет в бенчмарках и предложить объяснения наблюдаемым эффектам.