Le déficit de compétences en bio-informatique se résume à une offre d'emploi qui décrit une personne qui n'existe presque pas. Ouvrez n'importe quelle offre en bio-informatique et vous trouvez la même liste. Solide capacité de programmation, statistiques, développement de pipelines, infrastructure cloud, et compréhension approfondie de la biologie concernée, idéalement avec une expérience du domaine sur lequel travaille l'entreprise.
Cette personne existe. Il n'y en a pas beaucoup, elles sont chères, et elles ont déjà un emploi.
L'offre d'emploi qui ne décrit personne
La raison pour laquelle le poste reste vacant, c'est qu'il s'agit de deux carrières dans une seule offre.
Un scientifique informaticien compétent se construit en des années. Un biologiste compétent se construit en des années. Les organisations rédigent une offre exigeant les deux, puis traitent la difficulté qui en résulte comme une pénurie de marché.
Un poste qui exige deux carrières complètes n'est pas un problème de recrutement. C'est un problème de conception de poste, et il se résout généralement dans l'organigramme plutôt que sur le marché.
C'est le cas le plus net, dans le domaine biotechnologie, du diagnostic qui s'applique à toute la section Future Industries : avant de conclure que le marché du travail est en pénurie, vérifiez si le poste tel qu'écrit est pourvoyable.
Ce que couvre la direction
Le périmètre : lire des génomes, des séquences et des protéines à grande échelle, données biologiques et modélisation computationnelle.
Concrètement, quatre couches.
Analyse de séquences. Alignement, assemblage, appel de variants, annotation. Largement standardisé, fortement outillé, et où se situe l'essentiel du travail routinier.
Statistiques pour les données biologiques. Un problème à part entière. Les jeux de données biologiques sont larges et peu profonds, avec bien plus de caractéristiques mesurées que d'échantillons, ce qui contredit l'intuition des personnes formées sur des données classiques. Tests multiples, effets de lot et facteurs de confusion sont les pièges standards.
Calcul structural et protéique. Modéliser la structure et l'interaction, un domaine qui a beaucoup changé ces dernières années et continue d'évoluer.
Pipelines et infrastructure. Faire tourner une analyse de façon reproductible, à l'échelle, avec les versions enregistrées. Moins glamour et plus décisif que tout ce qui précède.
Les deux voies d'accès, et ce que chacune rate
De l'informatique vers la biologie. Arrive en sachant écrire du code fiable, gérer l'échelle, utiliser correctement la gestion de version et construire un pipeline qui fonctionne. Le mode d'échec, c'est produire un résultat techniquement correct mais biologiquement dénué de sens, sans alarme interne pour le signaler. Interpréter un effet de lot comme un signal biologique en est l'exemple classique, et ce n'est pas une erreur de code.
De la biologie vers l'informatique. Arrive en sachant dire si un résultat a du sens, ce qui ne s'automatise pas. Le mode d'échec, c'est une analyse qui existe sous forme d'un dossier de scripts que personne d'autre ne peut faire tourner, avec des étapes manuelles non documentées, qui fonctionne une fois et ne se reproduit pas.
Les deux sont réels et les deux sont formables. La seconde voie est généralement plus courte, pour une raison qui mérite d'être dite clairement : le jugement biologique prend plus longtemps à construire que la discipline d'ingénierie, donc partir de la personne qui possède déjà la partie lente revient à ne former que la moitié rapide.
Cela va à l'encontre du réflexe consistant à recruter un ingénieur logiciel et à lui enseigner un peu de biologie, l'approche la plus répandue et la plus lente.
Où cela se situe dans le domaine
Bio-informatique et biologie computationnelle est la cinquième des dix directions du domaine biotechnologie d'Astra Trainer, et c'est celle le plus souvent cadrée en combinaison avec d'autres, généralement la génétique et la génomique côté biologie.
Pour les partenaires qui forment des biologistes au travail computationnel, le domaine IA, données et informatique couvre huit directions dont l'informatique fondamentale, l'ingénierie logicielle, la science des données et l'analytique, et le cloud computing et DevOps, d'où vient la moitié ingénierie. Cet appariement entre domaines est l'une des formes de programme les plus courantes. Vous pouvez découvrir les directions biotechnologie ici.
La couche que personne ne budgétise
Reproductibilité et ingénierie des données. C'est peu glorieux, c'est là que l'argent part discrètement, et c'est presque jamais dans le plan de gestion des talents.
Les symptômes sont constants d'une organisation à l'autre.
Une analyse ne peut pas être rejouée. La personne qui l'a faite est partie, l'environnement a changé, et le résultat qui sous-tend une décision ne peut pas être reproduit. Dans un contexte réglementé, c'est un problème sérieux plutôt qu'un désagrément.
On ne retrouve pas la donnée. Les sorties de séquençage s'accumulent sans métadonnées cohérentes, si bien que des jeux de données vieux de deux ans sont effectivement perdus tout en continuant à occuper un stockage facturé mensuellement.
Les coûts de calcul augmentent sans explication. Une dépense cloud que personne ne possède, portée par des pipelines qui n'ont jamais été optimisés parce que personne n'en était responsable.
Chaque projet reconstruit la même chose. Pas d'outillage partagé, si bien que chaque scientifique écrit sa propre version de la même analyse, légèrement différente.
Ce sont tous des problèmes d'ingénierie des données, et ils se résolvent avec des profils venus du logiciel et de l'infrastructure plutôt qu'en embauchant un biologiste computationnel de plus. Les organisations qui le reconnaissent tôt dépensent nettement moins sur un horizon de cinq ans.
Les postes, correctement divisés
La démarche pratique consiste à arrêter d'essayer d'embaucher une seule personne et à en définir trois.
| Poste | Ce qu'il fait | Formé à partir de |
|---|---|---|
| Analyste bio-informatique | Fait tourner des pipelines établis, interprète les résultats, travaille avec les scientifiques sur des questions précises | Biologistes, personnel de laboratoire, techniciens en génomique |
| Ingénieur bio-informatique | Construit et maintient pipelines, infrastructure, reproductibilité et maîtrise des coûts | Ingénieurs logiciels, data engineers, infrastructure IT |
| Biologiste computationnel | Développement de méthodes inédites, modélisation, travail de niveau recherche | Voie longue, véritablement rare, à recruter là où c'est essentiel |
La plupart des organisations ont besoin de beaucoup du premier, de quelques-uns du deuxième et de très peu du troisième. La plupart des offres d'emploi décrivent le troisième et en attendent qu'il fasse tout.
Diviser le poste fait deux choses à la fois. Cela rend les postes pourvoyables à partir de populations que vous avez déjà, et cela évite que des seniors coûteux passent leur temps sur la maintenance de pipelines.
Où la réglementation entre en jeu. La bio-informatique au service du diagnostic clinique, des soumissions réglementaires ou des environnements BPx comporte des exigences de validation, de gestion de version et d'audit qui vont bien au-delà des bonnes pratiques scientifiques. Un pipeline produisant des résultats cliniques est un système réglementé. La formation construit à la fois la capacité computationnelle et la conscience que cette frontière existe, et la validation et la qualification propres au site restent des obligations distinctes.
Vérifie-toiLa plupart des groupes de recherche comptent quelqu'un qui s'est appris tout juste assez de script pour se débrouiller, avec des habitudes qui ne passeront pas à l'échelle. Avant de continuer : est-ce un poids à reconvertir, ou la meilleure conversion possible dont vous disposiez ?Voir la réponseMasquer la réponse
La meilleure disponible, et de loin. Cette personne détient déjà la moitié la plus longue à construire — le jugement pour dire si un résultat a du sens — et elle connaît les données de l'organisation, donc une formation structurée la reconvertit plus vite que quiconque d'autre à votre portée. Les habitudes autodidactes sont la partie bon marché à corriger. Ce qu'il ne faut pas lui faire porter, c'est l'ingénierie : faites-la venir de votre fonction logicielle ou informatique, et traitez la reproductibilité comme une exigence dès le départ plutôt que comme une rustine.
Construire plutôt qu'acheter
Une séquence pratique pour les organisations qui ont conclu qu'elles ne peuvent pas recruter leur sortie de ce problème.
Commencez par les biologistes qui font déjà de l'analyse, mal. La plupart des équipes de recherche comptent quelqu'un qui s'est appris suffisamment de script pour se débrouiller. Ils ont le jugement métier et des habitudes autodidactes qui ne passeront pas à l'échelle. La formation structurée les convertit plus vite que n'importe qui d'autre disponible, et ils connaissent déjà les données de l'organisation.
Apportez la capacité d'ingénierie séparément. Depuis votre propre fonction logiciel ou IT si elle existe. Ils n'ont pas besoin d'une biologie approfondie pour construire une infrastructure fiable, et prétendre le contraire retarde indéfiniment le recrutement.
Traitez la reproductibilité comme une exigence dès le départ. La rétrofitter coûte nettement plus cher que de la construire dès le début, et le moment où les gens le remarquent est généralement celui où c'est le plus coûteux.
Restez en continu. Les outils et méthodes de ce domaine évoluent vite, si bien qu'un cours ponctuel se périme rapidement. C'est l'un des domaines où l'apprentissage court et continu surpasse véritablement un événement, pour les mêmes raisons que celles discutées dans l'article central sur le microlearning.
Confrontez votre propre poste vacant à cela
Coché : 0 sur 5
Une ou deux coches, c'est le point de départ habituel. Les deux derniers éléments sont ceux qui se transforment en coût discrètement, sur des années plutôt qu'en un trimestre, et il est moins cher de les construire dès le départ que de les rattraper ensuite.
Ce qu'il faut retenir
L'offre d'emploi type en bio-informatique demande deux carrières et blâme ensuite le marché.
Les deux voies d'entrée ont un échec caractéristique, et la voie biologie vers informatique est généralement plus courte car le jugement prend plus longtemps à construire que la discipline d'ingénierie.
Reproductibilité et ingénierie des données sont la couche non budgétée, et le coût de les sauter arrive sous forme de données perdues, d'analyses irreproductibles et de factures cloud que personne ne possède.
Divisez le poste en analyste, ingénieur et biologiste computationnel. La plupart des organisations ont besoin de beaucoup du premier, de quelques-uns du deuxième et de presque aucun du troisième.
Et commencez par le biologiste qui s'est déjà appris à scripter. C'est la conversion la plus rapide de la maison.
Teste-toi
Question 1 sur 3
Un poste de bio-informaticien senior est ouvert depuis onze mois. Que suggère l'article de faire avant de conclure que le marché en manque ?
Pourquoi la bio-informatique est-elle si difficile à recruter ?
Parce que l'offre type exige un solide scientifique informaticien qui soit aussi un biologiste en exercice. Ce sont deux carrières, et la pénurie relève en partie d'un problème de conception de poste plutôt que d'un problème de marché du travail.
Est-il plus facile de former un biologiste à coder ou un développeur à la biologie ?
Généralement le biologiste, car le jugement biologique prend plus longtemps à construire que la discipline d'ingénierie. Former la personne qui a déjà la moitié lente revient à ne former que la moitié rapide.
Qu'est-ce qui manque dans les plans de gestion des talents en bio-informatique ?
L'ingénierie des données et la reproductibilité. Les coûts arrivent plus tard sous forme d'analyses irreproductibles, de données introuvables et de dépenses de calcul que personne ne possède.
Comment structurer le poste ?
En trois postes : analyste, ingénieur et biologiste computationnel. La plupart des organisations ont besoin de nombreux analystes, de quelques ingénieurs et de très peu du troisième profil, et embaucher une seule personne pour être les trois explique pourquoi le poste reste vacant.
Où se situe la bio-informatique dans le domaine biotechnologique ?
Cinquième des dix directions du domaine biotechnologie d'Astra Trainer, fréquemment associée à la génétique et à la génomique, ou à des directions du domaine IA, données et informatique pour la moitié ingénierie. Vous pouvez les découvrir ici.
