Но данные в чистом виде никто и никогда не предоставит, так как это закон о персональных данных (я говорю о России). Да и в США был конфликт по этому поводу, по этому там с этим тоже сложно. Данные может предоставить мед.учреждение(сомневаюсь правда, скорее всего в первую очередь необходимо обращаться в министерство здравоохранения), но опять же - кто будет заниматься их обезличиванием и разметкой? Сотрудники мед.учреждения? Они не имеют понятия как это делать правильно т.е так, чтобы это не повлияло на результаты обучения сети.
Согласен, нужно взаимодействовать с министерством. И конечно же персональные данные раскрывать никто не даст, но собственно они и не нужны для анализа, так как не относятся к самому предмету анализа. Уверен что минимальная статистика в любом случае, но на уровне вылечили/не вылечили, сободно койко место/занято - в таком духе. И наверное только на министерском уровне можно отрегулировать необходимы статданные.
Был конкурс от Mail Ru, где мы тренировали сетку и она предсказывала вероятность ССЗ(сердечно-сосудистое заболевание), так вот, тех данных которые предоставили не хватало и приходилось генерировать из имеющихся дополнительные. И даже там поделили данные на train\test не правильно, что повлияло на финальные результаты. Это я к тому, что подготовка данных это очень сложная процедура и выполнив ее не правильно, хороших результатов не добиться. Если интересно посмотреть какие данные были предоставлены, то их можно скачать с сайта конкурса там же и ознакомиться с задачей, которая была поставлена. Сайт - mlbootcamp точка ру, задача - Предсказание ССЗ.
Удивительные вещи. Я понятия не имел что такие проекты существуют. И сразу по прочтению пришла мысль, что Скайчейну для начала надо сосредоточиться на каком то одном узком роде заболеваний. И отработать его сотрудничая с органами здравоохранения в тестовом режиме. И если будет эффект то масштабировать уже успехи на прочие направления.
Ребята взялись за очень сложный проект, и я не особо верю, что они реализуют все то, что описано в WP. Хотя реализовать можно и за месяц\два, но не все те функции. Собрать кластер для гетерогенных вычислений тоже дело не из простых(опять же говорю это потому как имею с этим дело), по хорошему им нужна параллельная виртуальная машина(PVM), а не голый MPI.
Это идея и я уверен, что не был даже сделан MVP для проверки своей идеи и выявления тех трудностей при разработке, с которыми придется столкнуться.
Месяц/два - на мой взгляд совершенно смешной срок для таких важных задач. Но если Вы реально оцениваете сроки таким образом, то это на самом деле реально замечательная возможность. Однако Вы правы, что без министерского лобби ни одной задачи не удастся решить ни в какие разумные сроки.