Анализ сетей
Budget: $30 – $250 USD
Для этого проекта желательно иметь представление о том, как работают сети и/или опыт подобного анализа в прошлом.
Дано: патенты компании (около 660 шт) и их авторы. Наличие связи между авторами одной сети определяется через данные по патентам. Если автор А и В указаны в авторах одного патента - между ними есть связь.
Что нужно сделать:
1. Посчитать имеющееся количество связей в каждой сети авторов т.е. внутри одной компании, а также максимально возможное количество связей между авторами. То есть, например, в компании может быть 10 человек, но только 5 из них имеют общие патенты => между ними есть связь, а остальные работают по одному => между ними нет связи. Таким образом получается, что имеющееся количество связей в сети, а также максимально возможное количество связей в сети будет разным.
2. Определить центрального/ых авторов (central nodes), по нескольким критериям: 1) Автор с самым большим количеством связей с другими авторами. 2) Closeness centrality (насколько тот или иной автор удален от остальных авторов), Betweenness centrality (количество раз, когда тот или иной автор действует как мост между другими авторами).
В прикрепленных файлах пример того, как выглядит каждая сеть в исходном файле. В каждой компании количество авторов разное. Кроме того, в файле собраны все патенты каждой компании, но для анализа связей нужно рассмотреть только последние 3 года до того, как компания была куплена (даты M&A для каждой компании имеются)
Дано: патенты компании (около 660 шт) и их авторы. Наличие связи между авторами одной сети определяется через данные по патентам. Если автор А и В указаны в авторах одного патента - между ними есть связь.
Что нужно сделать:
1. Посчитать имеющееся количество связей в каждой сети авторов т.е. внутри одной компании, а также максимально возможное количество связей между авторами. То есть, например, в компании может быть 10 человек, но только 5 из них имеют общие патенты => между ними есть связь, а остальные работают по одному => между ними нет связи. Таким образом получается, что имеющееся количество связей в сети, а также максимально возможное количество связей в сети будет разным.
2. Определить центрального/ых авторов (central nodes), по нескольким критериям: 1) Автор с самым большим количеством связей с другими авторами. 2) Closeness centrality (насколько тот или иной автор удален от остальных авторов), Betweenness centrality (количество раз, когда тот или иной автор действует как мост между другими авторами).
В прикрепленных файлах пример того, как выглядит каждая сеть в исходном файле. В каждой компании количество авторов разное. Кроме того, в файле собраны все патенты каждой компании, но для анализа связей нужно рассмотреть только последние 3 года до того, как компания была куплена (даты M&A для каждой компании имеются)