ARKONE
Un modèle de routes, interrogé à l'aveugle : sélection de routes par IA pour l'aviation régionale indienne

Un modèle de routes, interrogé à l'aveugle : sélection de routes par IA pour l'aviation régionale indienne

August 17, 2026 · 69 min read

S
Sobin George Thomas

Nous avons construit un modèle de sélection de routes pour l'aviation régionale indienne à partir d'un seul jeu de données publiques. Interrogé à l'aveugle, il a placé 8 des 10 routes d'une compagnie dans son top 100 sur 2,743 paires de villes.

This article was translated from the English original. Translations are machine-assisted and reviewed on a rolling basis.

Demandez à un modèle quelles routes une compagnie de turbopropulseurs devrait exploiter. Ne lui donnez rien d’autre qu’un tableur public. Avant de gagner le droit de proposer quoi que ce soit de nouveau, il doit passer un test : il doit redécouvrir, par lui-même, les routes qu’une équipe de planification chevronnée a déjà choisies.

En août 2026 nous avons mené ce test face à une compagnie régionale indienne que nous admirons. Le modèle a lu une seule source publique, noté 2,743 paires de villes et placé huit des dix routes de la compagnie dans son top 100. On ne lui avait rien dit de la compagnie. Puis il a nommé trois paires de villes que la compagnie n’exploite pas, l’arithmétique de chaque note étant exposée.

2,743
Paires de villes notées
Toutes les paires dans l'enveloppe du turbopropulseur, à l'échelle nationale
8
Routes de la compagnie dans le top 100 à l'aveugle
Sur les dix routes qu'elle exploite ; le hasard en prévoit 0.4
0
Données de la compagnie fournies au modèle
Uniquement des données publiques de la DGCA

Ce rapport documente l’ensemble de la construction : le marché et ses opérateurs, les quatre questions que pose le modèle, le travail ingrat sur les données qui a rendu un fichier gouvernemental exploitable, la validation à l’aveugle, les résultats, un atlas national des routes fines, et les limites que nous énonçons avant que quiconque ne les soulève. Une note sur la provenance avant toute chose. Il s’agit d’une analyse indépendante. Aucune compagnie ne l’a commandée, n’a partagé de données pour elle, ni n’y a participé de quelque manière ; l’étude ne revendique aucune relation avec l’opérateur qu’elle modélise, et chaque chiffre provient de données publiques. Le travail a été mené pour démontrer une méthode, sur notre propre temps.


Le marché : une décennie de routes fines

L’aviation intérieure indienne a transporté 166.9 millions de passagers en 2025, d’après les propres relevés par paire de villes de la DGCA. Le chiffre en tête de page masque sa propre structure. Une large part de ces passagers circule entre une douzaine d’aéroports métropolitains sur des monocouloirs de 180 sièges. Le reste circule sur tout le reste : les villes moyennes, les villes de pèlerinage, les pistes insulaires, les capitales d’État qui ont eu un aéroport avant d’avoir de la demande.

Ce second étage est celui de l’aviation régionale, et il se comporte autrement. Un planificateur de Mumbai–Delhi demande combien de fréquences les créneaux autorisent. Un planificateur régional se pose une question plus difficile : cette paire produit-elle assez de passagers pour remplir chaque jour un petit avion, sans en produire tant qu’un opérateur de jets à bas coût entre et prenne le marché ? La bande entre ces deux modes d’échec est étroite. La plupart des paires de villes indiennes se situent en dehors, d’un côté ou de l’autre.

L’environnement réglementaire a décidé d’élargir cet étage. En 2026 le Cabinet de l’Union a approuvé le Regional Connectivity Scheme, Modified UDAN, doté de ₹28,840 crore, courant de l’exercice 2026-27 à l’exercice 2035-36. Le dispositif finance de nouveaux aéroports à partir de pistes non desservies et apporte un financement de comblement de viabilité aux opérateurs prêts à les desservir. La première décennie d’UDAN a construit la piste d’envol de la seconde : à la mi-2026 le tableau de bord quotidien de la DGCA compte 657 routes RCS attribuées sur 93 aéroports mis en service, exploitées par 10 opérateurs. Quoi que l’on pense de l’économie des subventions, la direction est sans ambiguïté : plus d’aéroports, plus de paires fines, plus de décisions sur celles qui méritent un avion.

Le déploiement de la connectivité régionale
657
Routes UDAN attribuées et actives
Statistiques quotidiennes de la DGCA, juillet 2026
93
Aéroports RCS mis en service
Modified UDAN en vise 100 de plus d'ici 2036
₹28,840 cr
Dotation de Modified UDAN
Exercices 2026-27 à 2035-36, Cabinet de l'Union

Plus de décisions, voilà l’expression opérante. Chaque nouvel aéroport multiplie les combinaisons qu’un planificateur de réseau doit examiner. Dix villes font 45 paires possibles. Cinquante villes en font 1,225. Une compagnie qui entend passer d’une douzaine de villes à cinquante choisit dans un champ combinatoire qui croît de façon quadratique, tandis que l’équipe de planification garde la même taille et que la liste courte reste une fiction rassurante.

Et l’erreur coûte cher dans les deux sens. Lancez une paire incapable de remplir l’avion, et la route saigne de la trésorerie pendant les deux ou trois saisons qu’il faut pour admettre l’erreur. Écartez une paire qui mûrissait discrètement, et l’annonce d’horaires d’un concurrent transforme votre hésitation en sa base. La sélection de routes est la décision récurrente la plus lourde d’enjeux que prenne une compagnie régionale, et elle revient d’autant plus vite que le réseau grandit.

L’avion façonne le problème autant que le marché. Un turbopropulseur de 70 sièges existe à cause d’une économie têtue : en dessous d’une certaine densité de demande, le coût au siège d’un jet ne se couvre pas aux tarifs qu’un marché régional acceptera de payer, alors que le coût de trajet plus faible et la croisière plus lente du turbopropulseur épousent presque exactement les secteurs de moins de deux heures. Le prix de cet ajustement est une enveloppe d’exploitation étroite. Faites voler le turbopropulseur trop court et le roulage, la montée et la descente dévorent le temps-bloc ; faites-le voler trop long et le handicap de vitesse de croisière s’aggrave face à la concurrence des jets sur la même paire. La sélection de routes pour un opérateur de turbopropulseurs est donc une recherche bornée, et les recherches bornées sont précisément là où les modèles de notation gagnent leur salaire : l’enveloppe est définissable, les candidats sont énumérables et les arbitrages se répètent.

Les réponses conventionnelles à ce problème prennent deux formes. La première est l’expérience : un responsable de planification qui observe les paires de villes indiennes depuis vingt ans et porte la carte dans sa tête. Cela fonctionne, et les compagnies qui l’ont devraient y tenir. Cela ne passe pas à l’échelle au-delà de cette personne, ne se transmet pas à son départ, et ne peut pas s’auditer soi-même. La seconde forme est l’étude de marché de cabinet de conseil, produite en huit semaines, livrée en présentation, périmée en deux trimestres, et structurellement incapable de dire comment elle est parvenue à son classement.

Nous voulions démontrer une troisième forme. Un modèle petit et lisible qui lit des données publiques, note chaque paire viable, montre son arithmétique, et peut être relancé chaque mois pour le prix d’un café. Non pas en remplacement du responsable de planification aux vingt ans de métier. Comme le tableau de bord posé devant lui.


Les opérateurs : qui exploite réellement l’Inde régionale

Avant de noter les routes, notez le terrain. Le même ensemble de publications de la DGCA qui enregistre le trafic par paire de villes enregistre aussi les opérations par compagnie, et le lire tranche une question que le commentaire sectoriel esquive d’ordinaire : qui est réellement dans le métier régional, à quelle échelle, et dans quelle direction chacun va.

La ligne de partage est l’étape moyenne, la distance que parcourt le passager type d’une compagnie, calculée ici comme passagers-kilomètres rapportés aux passagers transportés sur les douze mois jusqu’à mai 2026. Les opérateurs de ligne principale se regroupent entre 950 et 1,200 kilomètres. Les opérateurs régionaux se regroupent entre 280 et 580. Il n’y a presque rien entre les deux : le marché intérieur indien est deux marchés sous une seule catégorie de licence.

Opérateur Passagers, 12 m jusqu’à mai 2026 Sur un an Étape moyenne
IndiGo 107.5M +1% 948 km
Air India 25.5M +7% 1,076 km
Air India Express 19.3M +48% 1,003 km
Akasa Air 8.8M +12% 1,195 km
SpiceJet 5.1M +5% 1,012 km
Star Air 933,712 +33% 582 km
Alliance Air 587,147 −49% 421 km
FLY91 390,708 +94% 442 km
IndiaOne Air 27,928 −8% 320 km
flybig 3,989 −77% 285 km

Les données opérationnelles par compagnie accusent environ deux mois de retard sur le relevé par paire de villes dans le miroir public, la fenêtre de ce tableau est donc celle des douze mois jusqu’à mai 2026 ; le modèle de routes dans le reste de cette étude va jusqu’à juillet.

L’étage régional mérite sa propre lecture, car ses cinq membres vont dans cinq directions différentes.

L'étage régional, douze mois glissants jusqu'à mai 2026 (la barre est la part des passagers de l'étage)
Star Air · 933,712 pax · +33%
48%
Alliance Air · 587,147 pax · −49%
30%
FLY91 · 390,708 pax · +94%
20%
IndiaOne Air · 27,928 pax · −8%
2%
flybig · 3,989 pax · −77%
1%
Calculé à partir des statistiques mensuelles par compagnie de la DGCA via le miroir india-aviation-traffic

Star Air est le leader actuel en volume, un opérateur d’ERJ basé au Karnataka qui croît d’un tiers sur un an avec l’étape la plus longue de l’étage, le profil d’une régionale qui approche des limites de finesse de la ligne principale. Alliance Air, l’opérateur public historique qui a porté la mission UDAN pendant des années, a fondu de moitié en un an ; une histoire de flotte et de financement qui se règle dans les chiffres de trafic. FLY91 a presque doublé, la plus forte croissance de l’étage, depuis la plus petite base d’ATR. IndiaOne Air et flybig illustrent la mortalité de l’étage : des exploitations à un chiffre d’appareils sur les routes les plus fines, l’une à la dérive, l’autre sortant de fait. Cinq opérateurs, cinq trajectoires, une conclusion pour un modèle de routes : l’étage régional est une compétition ouverte, et le gisement de demande qu’il dispute est un gisement que les compagnies de ligne principale ne peuvent structurellement pas desservir.

Ce mouvement est la toile de fond stratégique de tout ce qui suit. Les routes libérées par un opérateur qui se réduit deviennent l’opportunité d’un autre en deux saisons. Un instrument rafraîchi chaque mois voit la vacance le mois où la capacité s’en va.


La géographie des routes fines : un atlas national

Le modèle construit pour cette étude est délibérément taillé pour une compagnie : sa quatrième question note la proximité aux bases d’une compagnie. Retirez cette question, renormalisez les trois autres, et la même notation tourne indépendamment de tout opérateur sur l’ensemble du pays. Le résultat est un atlas : chaque paire de villes dans l’enveloppe du turbopropulseur, notée sur la taille, la croissance et la distance seules, puis regroupée en six zones analytiques par coordonnées. Les zones sont des bandes de géographie, non des régions administratives, et les paires qui traversent des zones sont affectées par leur point médian.

Zone Paires dans l’enveloppe Dans la bande 70 sièges Passagers, 12 m Sur un an
Sud 714 70 34.4M −2%
Nord 822 37 21.7M +2%
Ouest 376 30 13.9M +3%
Nord-Est 182 19 4.9M −5%
Est 142 15 2.1M −18%
Centre 428 13 1.6M −9%

Deux faits structurels ressortent du tableau. Le Sud est le grand bain. Il détient 70 des 184 paires en bande du pays, deux fois son plus proche rival, sur la plus grande base de passagers. La géographie péninsulaire produit cela : un maillage de villes moyennes distantes de 250 à 700 kilomètres, exactement l’enjambée du turbopropulseur, avec des liaisons ferroviaires assez lentes pour perdre la comparaison des temps. Le Nord est large mais peu profond. Plus de paires dans l’enveloppe que toute autre zone, mais seulement 37 en bande, parce que la demande du nord se concentre sur des axes majeurs vers Delhi qui ont dépassé les 70 sièges depuis longtemps, tandis que le reste est plus fin qu’une rotation quotidienne ne peut le justifier.

Le Nord-Est raconte une troisième histoire qui mériterait son propre rapport : 19 paires en bande sur un terrain où voler remplace une journée de route, l’argument structurel le plus fort du pays en faveur des turbopropulseurs, et la zone où la mortalité des opérateurs a été la plus forte. Le −18% de l’Est est le recul régional le plus marqué du secteur, concentré sur des paires qui ont perdu du service plutôt que sur des paires qui ont perdu de la demande.

L’atlas est délibérément publié au niveau des zones plutôt qu’en liste nationale classée. Une note indépendante de l’opérateur est une lentille de tri, et les paires en tête de chaque zone changent entièrement de sens selon l’avion, les bases et la concurrence dont on parle. L’instrument existe pour répondre à cette question opérateur par opérateur ; l’atlas existe pour montrer où la question vaut la peine d’être posée.


La compagnie, et la question que nous nous sommes posée

La compagnie de cette étude exploite une flotte de six turbopropulseurs ATR 72-600 depuis deux bases, l’une sur la côte de Konkan et l’autre dans le Deccan. Elle dessert un réseau d’une douzaine de villes dans l’ouest et le sud de l’Inde, mêlant liaisons métropolitaines, villes moyennes et une piste insulaire. Une partie de son exploitation relève d’attributions de routes UDAN. Son ambition affichée, dans des entretiens publics, est une flotte d’un ordre de grandeur supérieur, desservant plusieurs fois plus de villes.

Nous avons choisi cette compagnie pour trois raisons. Le réseau est récent, ce qui signifie que chaque route a été choisie délibérément par des gens toujours en poste, face aux conditions de marché actuelles, avec des données modernes. La flotte est homogène, six exemplaires d’un seul type d’appareil, ce qui ramène le problème de modélisation à une enveloppe d’exploitation unique. L’ambition est publique, ce qui signifie que la question à laquelle notre modèle répond, quelle paire ensuite, est une question que cette compagnie affrontera des dizaines de fois dans les cinq prochaines années.

Il y avait aussi une quatrième raison, et c’est la plus honnête. Nous construisons des systèmes d’IA pour des organisations, et le plus difficile dans ce métier est la première conversation. Tout fournisseur revendique des capacités. Les présentations ne coûtent rien. Nous voulions entrer dans l’aviation avec quelque chose qui tourne, sur des données que personne ne pourrait nous accuser d’avoir arrangées, validé contre des décisions que nous ne pouvions pas connaître à l’avance. La façon de gagner l’attention d’un planificateur de réseau est de lui montrer un modèle qui rejoint indépendamment les choix qu’il a réussis.

Nous avons donc posé la contrainte qui donne son titre à cette étude. Le modèle ne recevrait aucune information sur la compagnie. Ni sa carte de routes, ni ses horaires, ni ses coefficients de remplissage, ni ses comptes. Une seule entrée : le relevé public du nombre de personnes ayant volé entre chaque paire de villes indiennes, chaque mois, publié par la Directorate General of Civil Aviation. Si le modèle ne parvenait pas à trouver le réseau de la compagnie dans ce fichier, à l’aveugle, le modèle avait tort et nous ne le montrerions à personne.

Cette contrainte a des allures de handicap. Elle est en réalité tout l’argument méthodologique, et il vaut la peine de s’arrêter sur le pourquoi.

Tout modèle ajusté aux données propres d’une compagnie apprend les décisions de cette compagnie, erreurs comprises. Il devient un écho. Un modèle bâti uniquement sur le relevé public de la demande n’a aucun accès aux décisions, donc lorsqu’il les reproduit malgré tout, quelque chose de réel a été démontré : les décisions sont récupérables à partir des seules données de demande. La validation coupe dans les deux sens, et le second est le plus précieux. Elle valide la compagnie. Une équipe de planification qui a choisi, par jugement privé, les mêmes routes qu’un noteur aveugle trouve dans le relevé public a vu son jugement confirmé de façon indépendante par l’arithmétique. Là où le noteur et l’équipe divergent, la divergence est précise, inspectable et mérite une réunion.

L’aveuglement règle en outre la question de crédibilité qui tue la plupart des propositions analytiques de fournisseurs. Un classement produit après avoir étudié le réseau du client peut toujours être accusé, poliment, d’ingénierie inverse. Un classement produit avant tout contact, à partir de données que chacun peut télécharger, et montré poids apparents, ne le peut pas. Il est falsifiable au sens le plus simple : n’importe qui avec un ordinateur portable peut le relancer et vérifier.

Une décision de périmètre complète le dispositif. Nous avons modélisé la demande, délibérément, et rien d’autre. Les tarifs, les horaires des concurrents, la disponibilité des créneaux et la logistique des équipages sont tous réels, tous absents, et la section sur les limites, vers la fin de cette étude, traite cette absence en détail. La version courte : le relevé public soutient honnêtement un modèle de demande. Prétendre qu’il soutient un modèle de rentabilité serait le genre d’excès que le secteur aérien a appris à flairer.


Une source de données, quatre questions

Le modèle lit un seul fichier : le relevé mensuel de la DGCA des passagers intérieurs transportés entre chaque paire de villes indiennes, d’avril 2015 à juillet 2026. Nous prenons le miroir lisible par machine maintenu dans le dépôt open source india-aviation-traffic, qui agrège les statistiques mensuelles publiées par la DGCA en un CSV continu. Onze années de données : 66,453 enregistrements mensuels portant sur plus de 1,800 paires de villes distinctes ayant vu au moins un passager régulier.

À partir de ce fichier, le modèle pose quatre questions sur chaque paire de villes qu’un ATR 72-600 peut plausiblement desservir. Chaque question produit une sous-note entre zéro et un. Une somme pondérée produit une note sur 100, et chaque paire est classée face à toutes les autres. C’est tout le modèle. Il n’y a pas d’apprentissage automatique dedans, pas d’embedding, pas de boîte noire. C’était une décision de conception, et le raisonnement derrière chaque question porte l’essentiel de la valeur, les voici donc en entier.

Les quatre questions, pondérées
La paire a-t-elle la bonne taille pour un 70 places ?34%
De 2,000 à 25,000 passagers par mois. Assez pour remplir chaque jour un petit avion, trop fin pour qu'un jet de 180 sièges la défende.
Est-elle en croissance ?26%
Les douze mois glissants face aux douze précédents.
L'avion peut-il la faire confortablement ?22%
De 250 à 700 km est la bande confortable. 150 et 900 sont les limites dures.
Touche-t-elle une base ?18%
Là où l'avion, l'équipage et les mécaniciens dorment déjà.

Question un : la paire a-t-elle la bonne taille ? (34%)

Un turbopropulseur de 70 sièges exploitant une paire chaque jour dans les deux sens, à un coefficient de remplissage sain, transporte environ 3,150 passagers par mois. Le modèle récompense donc les paires qui déplacent entre 2,000 et 25,000 passagers par mois. En dessous de 2,000, même un petit avion quotidien vole avec des sièges vides, et la sous-note décroît proportionnellement. Au-dessus de 25,000, la paire peut remplir des jets de 180 sièges, ce qui signifie que les grands opérateurs à bas coût la desservent déjà ou le feront dès que quelqu’un l’aura prouvé, et la sous-note décroît en conséquence.

Cette bande est le cœur stratégique du modèle, et c’est pourquoi elle porte le poids le plus lourd. L’aviation régionale est le métier des paires trop grandes pour être ignorées et trop petites pour qu’un opérateur de jets de ligne principale les défende. Tout le reste du modèle affine cette seule idée.

Question deux : est-elle en croissance ? (26%)

Le modèle compare les douze mois glissants, de juin 2025 à mai 2026, aux douze mois précédents. Une demande stable obtient 0.5. Une croissance de cinquante pour cent ou plus obtient le 1.0 plein, et le recul décroît sous le point médian. Lorsque la base de l’année précédente est inférieure à 500 passagers, le modèle refuse de calculer un taux de croissance et attribue le 0.5 neutre, car une croissance en pourcentage sur une base à trois chiffres est du bruit en costume.

L’intention est d’attraper des vagues plutôt que des mares. Deux paires peuvent déplacer chacune 8,000 passagers par mois, mais celle qui en déplaçait 5,500 un an plus tôt vous dit quelque chose que la paire immobile ne dit pas : la demande sur cette paire est en train d’être découverte, et la découverte n’est pas terminée.

Question trois : l’avion peut-il la faire confortablement ? (22%)

L’ATR 72-600 est un sprinteur. Son économie est à son meilleur sur des secteurs de 250 à 700 kilomètres, soit environ quarante à quatre-vingt-dix minutes en l’air. Le modèle traite cette bande comme idéale et lui attribue 1.0. Entre 150 et 250 kilomètres la note s’atténue, car les secteurs très courts passent trop de temps-bloc en roulage et en montée. Au-delà de 700 kilomètres elle s’atténue de nouveau, et passé 900 kilomètres le modèle exclut purement la paire. Les distances sont orthodromiques, calculées à partir des coordonnées des aéroports.

Les limites dures comptent autant que la bande idéale. Ce sont elles qui réduisent l’espace de recherche à quelque chose d’honnête : sur tous les appariements possibles d’aéroports indiens à trafic enregistré et coordonnées connues, exactement 2,743 paires tombent dans l’enveloppe. Le modèle les classe toutes, à chaque exécution.

Question quatre : touche-t-elle une base ? (18%)

Les avions, les équipages et les mécaniciens dorment quelque part. Pour la géographie de cette compagnie, cela veut dire les deux bases. Une paire touchant l’une ou l’autre obtient 1.0. Une paire n’en touchant aucune obtient 0.55, une pénalité et non une exclusion, car les réseaux développent bien des escales tactiques, mais chaque route orpheline traîne derrière elle des coûts de repositionnement, une complexité de temps de service et une exposition en maintenance.

C’est la seule question qui encode quelque chose de propre à l’opérateur, et même elle n’utilise qu’une connaissance publique : où sont les bases. C’est aussi, délibérément, le poids le plus faible. La demande doit dominer la géographie, sinon le modèle dégénère en carte de l’endroit où les avions se trouvent déjà.

Ce que le modèle ne demande délibérément pas

Les quatre questions sont plus faciles à défendre une fois les candidats écartés consignés, car chaque omission était un choix et non un oubli. Le modèle ne note pas le potentiel de fréquence, combien de rotations quotidiennes une paire pourrait soutenir, car la fréquence est une décision de construction d’horaires en aval de la décision de marché, et l’y intégrer laisserait une fantaisie d’horaire séduisante gonfler un marché médiocre. Il ne note pas le trafic de correspondance sur les bases, car les flux de correspondance dépendent d’horaires de vagues que le relevé public ne voit pas, et un réseau régional de cette taille vit ou meurt d’abord de la demande point à point. Il ne note pas les redevances aéroportuaires ni les écarts de carburant entre escales, des coûts réels, mais assez faibles au regard de la question de la demande pour que les modéliser à partir de tarifs publics ajouterait du théâtre de précision plutôt que de l’exactitude.

Plus difficile encore, il ne tente aucune approximation tarifaire. Il existait une version tentante de ce modèle qui estimait les recettes unitaires à partir de la distance et d’heuristiques de type de marché, et elle aurait produit des chiffres de revenus assurés reposant sur rien. Classer sur la demande et le dire franchement vaut mieux que classer sur des revenus inventés, car le premier est une réponse partielle honnête et le second une réponse complète qui est discrètement une fiction. Chaque omission ci-dessus suit la même règle : le modèle ne pose que des questions auxquelles les données peuvent réellement répondre.

Pourquoi un modèle linéaire à poids visibles

Quatre nombres, 34, 26, 22 et 18, appellent une objection évidente : pourquoi ceux-là ? La réponse honnête est qu’ils encodent un jugement, pas une régression. Ils ont été fixés en raisonnant sur le métier, dans l’ordre où le métier raisonne : taille de l’opportunité d’abord, dynamique ensuite, économie de l’appareil troisième, gravité du réseau en dernier. Qui n’est pas d’accord peut déplacer les poids et relancer ; le code en fait une modification de trente secondes.

Cette relançabilité est l’argument en faveur de la simplicité. Un classeur à gradient boosting ajusté sur le même fichier produirait une liste voisine et ne pourrait jamais l’expliquer à un comité de planification, ni survivre à un tour de « et si l’on valorisait davantage la croissance ? ». Avec un noteur linéaire à quatre questions lisibles, on peut discuter, et c’est précisément ce qui le rend utilisable dans une pièce de professionnels dont les carrières se sont bâties sur ce jugement. Le travail du modèle est de tenir l’arithmétique ferme pendant que les humains débattent des poids. Nous avons écrit la même philosophie pour un autre secteur dans notre étude de cas sur la gouvernance de l’IA : les systèmes qui montrent leur raisonnement sont adoptés, et ceux qui demandent la foi finissent au placard.

Il y a un principe plus profond en dessous, que nous appliquons à chaque système que nous construisons. Les jugements dérivés devraient être stockés, inspectés et versionnés, jamais régénérés de façon opaque à la demande. Une note de 91.2 pour une route signifie quelque chose parce que les quatre sous-notes qui la composent sont écrites à côté, et que la relance du mois prochain pourra être comparée à celle de ce mois-ci ligne à ligne. Une intelligence qui ne peut pas montrer son travail n’est pas une intelligence sur laquelle un secteur régulé peut agir.


Le travail ingrat : faire dire la vérité à un fichier public

Tout projet de données comporte une étape que personne ne met dans la brochure. La nôtre a consommé l’essentiel du temps de construction, et la sauter donnerait une fausse idée de l’endroit où l’effort va réellement dans ce type de travail. Le fichier de la DGCA est un cadeau, onze années de trafic mensuel par paire de villes, publié gratuitement. C’est aussi un fichier assemblé par de nombreuses mains sur de nombreuses années, et il se comporte comme tel.

Commencez par les noms. Le fichier écrit Goa de quatre façons différentes selon l’année et l’aéroport : Goa tout court, Dabolim entre parenthèses, Mopa en deux variantes propres, et, dans les fichiers les plus récents, « Dabolim » seul sans mention de Goa. Traitez-les comme des villes distinctes et le trafic de l’État se découpe en quatre, ruinant tous les chiffres en aval. Cette dernière variante mérite son propre aveu : une version précoce de ce modèle portait des alias pour trois des quatre libellés seulement, et les lignes Dabolim seul, plus de trois millions de passagers par an, ont silencieusement disparu de toutes les paires de Goa. L’erreur n’est apparue que lorsqu’un contrôle de couverture a listé les villes les plus chargées que le modèle ne parvenait pas à placer et que « DABOLIM » figurait près du haut de la liste. Tous les chiffres de ce rapport sont postérieurs à ce correctif.

Goa n’est pas un cas particulier. Mumbai apparaît de trois façons dès l’ouverture de Navi Mumbai. Le nouvel aéroport de Rajkot arrive sous « Hirasar (Rajkot) ». Hindon se présente comme « Ghaziabad ». Tiruchirappalli gagne un second « p » au milieu de la décennie. Vijayawada perd un « a », Kolhapur traîne une espace finale invisible à l’œil et fatale à une comparaison de chaînes, Agatti est tantôt une île et tantôt non, et Bengaluru partage une barre oblique avec Bangalore dans une époque du fichier. Le modèle porte une table d’alias qui replie chaque variante sur un nom canonique, et cette table a été bâtie de la seule façon dont ces tables le sont : en trouvant chaque écart après qu’il a silencieusement tordu un chiffre qui n’aurait pas dû l’être, puis en ajoutant un contrôle de couverture pour que le suivant s’annonce de lui-même.

Vient ensuite l’analyse syntaxique elle-même. Plusieurs noms de villes contiennent des virgules à l’intérieur de champs entre guillemets. Découpez le fichier naïvement sur les virgules, comme le fait un script rapide, et ces lignes se disloquent en un charabia qui peut faire planter quelque chose ou non. La leçon est ancienne mais il faut apparemment la réapprendre une fois par projet : un CSV est un format doté de règles, et seul un vrai analyseur CSV les connaît.

Viennent ensuite les artefacts, plus subtils parce que l’arithmétique est techniquement juste. Les chiffres de croissance extrêmes dans ces données viennent de deux illusions différentes, et elles appellent un traitement différent. La première est l’artefact d’ouverture de service : Raipur–Visakhapatnam affiche +602 pour cent sur une base de 3,697 passagers l’année précédente, et Hindon–Varanasi affiche +3,175 pour cent sur une base de 3,011. Aucun de ces chiffres ne signifie que la demande a explosé. Chacun signifie qu’un service régulier a démarré là où il n’en existait pratiquement aucun, et le pourcentage mesure le service, avec sa demande induite propre, quelques mois après sa naissance. La seconde illusion est plus vicieuse : avant la correction d’alias décrite plus haut, une paire de Goa affichait +7,123 pour cent de croissance, qui s’est évaporée à +2 pour cent dès que les libellés ont été fusionnés, parce que la « croissance » était du trafic migrant entre deux orthographes du même aéroport. Un modèle incapable de reconnaître cela classera avec assurance le lancement d’une route, ou une ligne renommée, comme une explosion de demande.

Notre traitement est le plancher de 500 décrit plus haut, qui étouffe le pire, plus un signalement plutôt qu’une correction pour le reste : une forte croissance sur une base récemment fine est étiquetée comme artefact d’ouverture de service partout où elle survit jusqu’à la sortie. Nous avons choisi d’étiqueter plutôt que de supprimer, délibérément. Un service nouveau qui grandit vers sa demande induite est une information authentique sur un marché. C’est simplement un fait différent d’une croissance organique, et le lecteur mérite de savoir lequel il regarde.

Un dernier cas limite mérite mention parce qu’il montre le modèle en désaccord avec une route qui existe. La compagnie dessert une paire côtière dont la distance orthodromique tombe sous le plancher de 150 kilomètres du modèle, si bien que le modèle refuse de la noter. Le plancher est économiquement juste, des secteurs aussi courts couvrent rarement leurs coûts de cycle en économie d’avion à voilure fixe, et la route en question existe sous une attribution de connectivité régionale, où le financement de comblement de viabilité change l’équation que le modèle note. Nous avons laissé le plancher en place et noté l’exclusion. Un modèle qui plie discrètement ses règles pour flatter le réseau observé a démissionné de son véritable travail.

La raison de s’attarder sur tout cela dépasse la fierté du métier : la différence entre un modèle crédible et un modèle embarrassant vit presque entièrement dans cette couche. La logique de notation des quatre questions tient sur une fiche, et n’importe quel analyste compétent pourrait la reconstruire en un après-midi. Ce qu’il ne pourrait pas faire en un après-midi, c’est savoir que Kolhapur traîne une espace finale. Le travail sur données publiques se capitalise : les alias, les planchers et les signalements bâtis pour ce modèle se transposent désormais à toute question d’aviation indienne que nous aborderons ensuite.


Le test qu’il devait passer d’abord

Tout ce qui précède est le préambule d’un moment : demander au modèle achevé, qui ne sait rien d’aucune compagnie, laquelle des 2,743 paires il préfère, puis vérifier où le réseau réel de la compagnie a atterri dans ce classement.

Le protocole mérite une phrase de pédanterie, car les tests à l’aveugle ne sont honnêtes qu’à la hauteur de leur séquencement. Les quatre questions et leurs poids ont été écrits et gelés d’abord, à partir du seul raisonnement métier. La liste des routes de la compagnie a été constituée séparément, à partir d’informations d’horaires publiques, et comparée au classement seulement après que le classement a existé. Aucun poids n’a été revu après la comparaison. Un modèle ajusté jusqu’à flatter la réponse connue prouve seulement que son auteur sait ajuster, et c’est pourquoi le gel est venu avant le regard.

Voici le résultat, en entier. Le modèle a noté et classé les 2,743 paires dans l’enveloppe de l’ATR. Le réseau de la compagnie s’est placé ainsi.

Route Rang sur 2,743 Note Distance Passagers, 12 m glissants
Agatti – Goa 6 95.8 538 km 38,619
Hubli – Hyderabad 9 94.0 414 km 55,493
Jalgaon – Pune 36 89.2 319 km 40,774
Goa – Jalgaon 38 89.0 649 km 41,267
Hyderabad – Rajahmundry 40 88.6 360 km 303,230
Hyderabad – Vijayawada 72 82.9 264 km 367,588
Goa – Pune 74 82.7 356 km 456,149
Bengaluru – Hubli 82 81.8 371 km 103,909
Bengaluru – Goa 317 51.3 483 km 1,526,595
Goa – Hyderabad 323 50.8 533 km 1,265,807
Les 100 premiers rangs sur 2,743 — les routes de la compagnie marquées
69363840727482 rank 1 rank 100 of 2664
#317 Bengaluru–Goa · #323 Goa–Hyderabad sit beyond the first 100
Les cases pleines sont des routes que la compagnie exploite. Les deux au-delà de la bande sont les paires métropolitaines qui ont dépassé la bande du turbopropulseur.

Huit des dix routes de la compagnie figurent dans le top 100 sur 2,743 du modèle, deux d’entre elles dans le top dix. Si le classement était aléatoire, le nombre attendu de ces dix routes tombant dans un top 100 quelconque est de 0.36. On n’a jamais dit au modèle que ces routes existaient en tant que réseau. Il les a trouvées parce que la signature de demande qui a conduit une équipe de planification chevronnée à les choisir est écrite clairement dans le relevé public, et que les quatre questions sont réglées pour lire exactement cette signature.

Considérez ce que dit réellement chacun de ces rangs élevés. La paire insulaire au rang 6 réunit un marché captif, aucune alternative de transport de surface, et une longueur de secteur au cœur de la bande du turbopropulseur. Hubli–Hyderabad au rang 9 est une liaison de capitale d’État en croissance de 27 pour cent, à la taille naturelle exacte d’une rotation quotidienne. Les paires aux rangs 35, 37 et 39 sont le jeu régional classique : trafic de capitale d’État et de ville du delta, trop fin pour un service constant en jet, assez épais pour voler chaque jour. Une équipe de planification a vu tout cela avec ses propres méthodes. Le modèle l’a vu avec quatre questions et un fichier public.

Maintenant les deux entrées en bas du tableau, car elles ressemblent à des échecs et sont l’inverse. Les deux paires métropolitaines sont aux rangs 317 et 323, avec 1.3 et 1.5 million de passagers par an. Si le modèle était un recommandeur de routes généraliste, classer des marchés d’un million de passagers dans les 300 serait une erreur. Mais le modèle note l’opportunité pour turbopropulseur, jamais l’importance, et des paires de cette taille ont dépassé le créneau optimal des 70 sièges depuis des années. Les jets y sont déjà. Le comportement correct pour ce noteur est de rétrograder de telles paires, et il le fait, pour la raison exactement annoncée : la question de la taille plafonne puis s’inverse au-dessus de la bande des routes fines. La compagnie exploite les deux paires malgré tout, vraisemblablement pour l’alimentation du réseau, la présence de marque et le positionnement des appareils, motifs stratégiques réels qui vivent hors de la juridiction d’un modèle de demande. Le modèle n’a pas besoin d’approuver chaque route pour être utile. Il a besoin d’être en désaccord de façon lisible.

Trois désaccords légers se situent dans la bande 72 à 82, et il vaut la peine d’en regarder les sous-notes. Goa–Pune, avec 456,000 passagers par an, dérive au-dessus du haut de la bande des 70 sièges ; le modèle ampute sa note de taille pour la même raison qu’il enterre les paires métropolitaines, simplement plus doucement. Hyderabad–Vijayawada et Bengaluru–Hubli perdent des points sur la croissance, pas sur la taille : des marchés solides dont la dynamique sur l’année glissante a été modeste dans cette fenêtre. C’est le modèle qui dit « route saine, en maturation » ou « route saine, pas une vague en ce moment », lectures défendables et, plus important, inspectables. N’importe qui peut ouvrir les sous-notes et voir les sommes qu’il compare.

La distribution derrière le tableau compte autant que les rangs qu’il contient. Tracez les 2,743 notes par ordre de classement et la courbe chute fortement sur la première centaine de paires, puis s’aplatit en un long milieu indifférencié. Les routes de la compagnie se regroupent sur la partie raide, ce qui est le placement significatif : le modèle sépare nettement ses premières dizaines de paires, et le réseau se trouve dans ce groupe séparé plutôt que dispersé dans le plateau où les écarts de rang veulent dire peu. Un rang 9 sur cette courbe est une affirmation forte. Un rang 900 contre 1,000 est du bruit, et on le dit aux utilisateurs du modèle.

Un mot sur ce que cette validation établit et n’établit pas, car il est facile de surestimer et nous préférons sous-estimer. Formellement, le test montre que la fonction de classement du modèle, construite et pondérée avant toute comparaison avec le réseau de la compagnie, attribue des rangs dans les 4 pour cent supérieurs à huit paires que la compagnie a choisies indépendamment. Les poids ont été fixés par raisonnement métier et gelés avant la validation. Ce que le test n’établit pas, c’est un pouvoir prédictif sur la rentabilité. Une route peut être parfaite en demande et perdre quand même de l’argent sur les tarifs, et le modèle ne dit rien des tarifs, une limite que cette étude prend au sérieux dans sa propre section.

Ce que le test achète, en termes pratiques, c’est une légitimité. Lorsque ce modèle affirme ensuite qu’une paire non desservie ressemble aux meilleures routes de la compagnie, cette affirmation hérite de la crédibilité de la redécouverte à l’aveugle. Elle a un sens précis et vérifiable : la paire se note comme se notent Agatti–Goa et Hubli–Hyderabad, sur les mêmes quatre questions, dans les mêmes données publiques. C’est un autre type d’énoncé que le « nous voyons du potentiel ici » d’un consultant, et cette différence est toute la raison de construire l’instrument avant de faire l’argument.


Ce qu’il a trouvé : trois paires que la compagnie n’exploite pas

La validation posée sur la table, le même classement peut se lire dans l’autre sens. Retirez toutes les paires que la compagnie dessert déjà et regardez ce qui reste en tête. Cette étude montre trois des paires obtenues, choisies parce que chacune raconte une histoire différente sur la façon dont le modèle argumente. Plusieurs autres ont franchi la même barre de notation, et nous les retenons délibérément : une liste classée livrée en gros invite à la réfutation de salon, tandis qu’une liste courte travaillée dans une pièce, à côté des chiffres propres d’un opérateur, devient un plan.

Route Rang sur 2,743 Note Distance Passagers, 12 m glissants Croissance
Calicut – Hyderabad 8 94.7 728 km 141,183 +42%
Hyderabad – Kolhapur 28 91.2 445 km 51,615 +16%
Bengaluru – Kannur 56 85.2 274 km 113,848 +24%

Calicut – Hyderabad : la vague

La plus grande et la plus dynamique des trois, et une paire du top dix national. Un peu plus de 141,000 passagers ont circulé entre ces villes sur les douze mois jusqu’à juillet 2026, près de douze mille par mois, et le marché a crû de 42 pour cent sur un an depuis une base saine, ce qui écarte les deux familles d’artefacts. La logique de la demande se lit depuis le terrain : la troisième métropole du Kerala, dense en étudiants, en travailleurs de l’informatique et en familles revenues du Golfe, reliée à la capitale technologique du Deccan. L’anatomie de la note : maximum sur la taille, 34 sur 34. Maximum sur la connexion à une base, 18 sur 18, puisqu’une extrémité est la base Deccan de la compagnie. Deux déductions : la croissance prend 23.9 sur 26, car 42 pour cent reste sous le plafond de 50 pour cent, et la distance prend 18.8 sur 22, car 729 kilomètres dépassent la bande idéale de 700 kilomètres. Total, 94.7, rang 8 sur les 2,743.

Calicut – Hyderabad · rang 8 sur 2,743
Bonne taille34 of 34
Croissance23.9 of 26
Distance18.8 of 22
Base18 of 18
Score94.7
141,183 passagers sur les douze mois glissants, en hausse de 42% sur un an. Déductions : le secteur de 728 km au-delà de la bande confortable, et une croissance sous le plafond de 50%.

La lecture stratégique : un corridor de travail et de famille entre la troisième métropole du Kerala et la capitale technologique du Deccan, en croissance à un rythme qui suggère un marché en cours de découverte plutôt que simplement desservi. Les 728 kilomètres poussent un ATR vers la limite du confort, environ deux heures en l’air, et la note porte déjà cette pénalité honnêtement au lieu de la cacher.

Hyderabad – Kolhapur : le cas d’école

Rang 28, et l’expression la plus pure de ce à quoi sert le modèle. Environ 4,300 passagers par mois, soit presque exactement la taille naturelle d’une rotation quotidienne de 70 sièges. Croissance de 16 pour cent sur une base propre pluriannuelle : organique, sans éclat, réelle. Longueur de secteur de 445 kilomètres, en plein centre de la bande idéale, 22 sur 22. Une extrémité à la base Deccan de la compagnie, 18 sur 18. La seule déduction est la croissance, 17.2 sur 26, car 16 pour cent est solide plutôt qu’explosif. Total, 91.2.

Hyderabad – Kolhapur · rang 28 sur 2,743
Bonne taille34 of 34
Croissance17.2 of 26
Distance22 of 22
Base18 of 18
Score91.2
Environ 4,300 passagers par mois, la taille naturelle d'une rotation quotidienne de 70 sièges. La seule déduction est la croissance : 16% est solide plutôt qu'explosif.

Aucun chiffre pris isolément n’est excitant ici, et c’est précisément le point. C’est le genre de paire qu’un tri humain manque : trop petite pour une présentation en conférence, en croissance trop douce pour un titre, reliant une base à une ville sans liaison directe depuis celle-ci. Le modèle la fait remonter parce que l’arithmétique ne s’ennuie pas. Des paires comme celle-ci sont l’endroit où un instrument de notation paie son loyer, en trouvant la route discrète qui va à l’avion comme un gant pendant que l’attention est ailleurs, sur les bruyantes.

Bengaluru – Kannur : la demande qui note malgré la carte

Rang 56, et la plus instructive des trois, car elle s’y classe en portant la plus lourde pénalité du modèle. Aucune extrémité ne touche une base, la paire prend donc la déduction complète de base, 9.9 sur 18. Elle se classe malgré tout 56e sur 2,743, sur la force de tout le reste : près de 114,000 passagers annuels, parfaitement dimensionnée à 34 sur 34 ; une croissance de 24 pour cent sur une base à six chiffres, 19.2 sur 26 ; et un secteur de 274 kilomètres dans la bande idéale, 22 sur 22. Total, 85.2.

Bengaluru – Kannur · rang 56 sur 2,743
Bonne taille34 of 34
Croissance19.2 of 26
Distance22 of 22
Base9.9 of 18
Score85.2
Aucune extrémité ne touche une base, la paire porte donc la pénalité complète du modèle et se classe malgré tout 56e sur 2,743. La demande est si forte.

Quand une paire absorbe la plus lourde pénalité structurelle du modèle et devance encore 2,609 des 2,743 candidates, la demande n’est pas marginale. Le modèle dit : ce marché est assez fort pour justifier de penser au-delà de la carte de bases actuelle, qu’il s’agisse d’accrocher la paire à l’exploitation existante ou de la traiter comme la graine d’une future escale. Cette décision appartient à des humains munis de feuilles de coûts. La contribution du modèle est de s’assurer que la question soit posée.

Lire une anatomie de note

Les trois anatomies ci-dessus suivent un schéma qu’il vaut la peine d’expliciter, car c’est le savoir-faire que l’instrument enseigne à ses utilisateurs. Une note totale élevée dit peu par elle-même ; l’information vit dans l’endroit où les points ont été perdus. Calicut–Hyderabad ne perd que sur la distance, la question opérationnelle qu’elle pose porte donc sur l’économie de secteur au bord de l’enveloppe : consommation de carburant, ajustement des temps de service des équipages, et capacité de l’horaire à tenir des rotations de deux heures. Hyderabad–Kolhapur ne perd que sur la croissance, sa question porte donc sur le plafond : un marché à 16 pour cent continue-t-il d’absorber des sièges, ou une rotation quotidienne le sature-t-elle ? Bengaluru–Kannur ne perd que sur l’ajustement de base, sa question est donc purement logistique : que coûte la desserte de cette paire en repositionnement et en organisation d’équipages, puisque rien ne dort à l’une ou l’autre extrémité ?

Trois routes, trois programmes de diligence entièrement différents, tous lus directement dans la sous-note qui a payé la pénalité. Une note unique et opaque, si exacte soit-elle, ne pourrait jamais faire cela. La décomposition convertit un classement en plan de travail, et cette conversion, davantage que le classement lui-même, est ce qu’une équipe de planification achète réellement en adoptant un instrument lisible.

La forme du résultat

Posez les trois paires sur une carte et un motif apparaît qu’aucune note isolée n’énonce : toutes trois se situent dans l’empreinte géographique que la flotte dessert déjà. Aucune n’exige que la compagnie aille ailleurs. Elles demandent au réseau de capter une demande qui circule déjà dans son propre voisinage, à côté d’avions qui dorment déjà tout près. Les plans de croissance imaginent d’ordinaire l’expansion comme un mouvement vers l’extérieur ; les premières suggestions du modèle portent toutes sur la densité à portée de main.

Le réseau, et les trois paires que le modèle apprécie
Agatti Bengaluru Calicut Goa Hubli Hyderabad Jalgaon Kannur Kolhapur Pune Rajahmundry Vijayawada
Flown todayScored, not flown
Les traits pleins sont exploités aujourd'hui. Les pointillés sont notés, non exploités. Les positions sont une géométrie orthodromique approximative, non une projection.

C’est aussi la réserve intégrée au résultat. Le modèle voit la demande, et la demande à portée est nécessaire mais loin d’être suffisante. Savoir si l’une des trois paires survit au contact des tarifs, des fréquences concurrentes et des horaires de créneaux est une question à laquelle le relevé public ne peut pas répondre, ce qui amène cette étude à sa section la plus importante.


Présenter l’analyse : un rapport que le lecteur survole

Une analyse juste mais non lue ne change rien, la couche de présentation a donc reçu la même attention de conception que le modèle. Les résultats ont été publiés sous forme d’une page web unique et autonome, et sa construction fait partie de cette étude de cas parce que les choix se généralisent à tout livrable analytique destiné à un dirigeant opérationnel plutôt qu’à un analyste.

La page est bâtie autour d’un seul parcours continu. Une carte de l’ouest et du sud de l’Inde reste fixée derrière le texte et, à mesure que le lecteur défile, une caméra la survole : le réseau se dessine route par route dans l’ordre où le modèle les a classées, et chacune des trois paires non desservies est parcourue comme son propre segment, un avion traçant la ligne pointillée de ville en ville pendant que les chiffres de cette paire arrivent à côté. Faire défiler est la seule interaction que le lecteur doit apprendre. Tout le reste, les anatomies de note, les bandes de rangs, le thème visuel, est une profondeur facultative.

Quatre décisions de présentation ont fait le travail persuasif.

La validation avant l’opportunité, toujours. La structure de la page impose l’ordre de l’argument : le lecteur découvre d’abord la méthode du modèle, puis la preuve qu’il a redécouvert le réseau existant, et seulement ensuite une suggestion quelconque. Un lecteur qui vient de voir un modèle aveugle classer les décisions reconnues bonnes de son secteur dans les quatre pour cent supérieurs accorde une confiance provisoire à l’écran suivant. Les mêmes trois paires, présentées d’abord, se liraient comme l’avis d’un fournisseur de plus.

Chaque note s’ouvre sur son arithmétique. Chaque fiche de route se déplie, d’une pression, en quatre sous-notes avec les points exacts gagnés et perdus : 18.3 sur 22 sur la distance, 9.9 sur 18 sur l’ajustement de base. Rien n’est présenté comme un verdict indécomposable. C’est l’expression en interface de toute la philosophie du modèle, et les lecteurs perçoivent la différence entre un chiffre qu’ils peuvent ouvrir et un chiffre qu’ils doivent accepter.

Les manques sont annotés, pas cachés. Le tableau de validation de la page inclut les deux paires métropolitaines au bas du classement, avec une note expliquant pourquoi un noteur d’opportunité pour turbopropulseur devrait classer bas des marchés d’un million de passagers. Laisser les lignes les moins flatteuses, avec leur raisonnement, a acheté plus de crédibilité que les lignes les mieux classées à elles seules.

Les limites ont leur propre chapitre, dans la page, sans qu’on les demande. Les tarifs, les horaires des concurrents, les créneaux et les artefacts de croissance sont énoncés dans le rapport lui-même, en langage clair, avant qu’aucun lecteur ne puisse les soulever. Dans toutes les conversations depuis, la section des limites est la partie que les lecteurs les plus avertis mentionnent en premier, et avec approbation.

Le choix d’une page vivante plutôt que d’un PDF était en soi un argument. Une présentation fige une analyse au moment de l’export et demande qu’on la croie ; une page dont les tableaux réagissent, dont les anatomies s’ouvrent et dont la carte survole invite le lecteur à y toucher, et toucher est la façon dont les sceptiques se convertissent. Le support épouse aussi la promesse du modèle : quelque chose de conçu pour se relancer chaque mois devrait arriver sous une forme qui, visiblement, le pourrait, et non en instantané dont la date vieillit déjà en pied de page.

Deux courtoisies mineures ont complété l’ensemble. La page est un fichier unique sans dépendance externe, elle se charge donc partout, fonctionne hors ligne une fois ouverte, respecte le mode sombre et les préférences de mouvement réduit, et s’imprime proprement sur papier pour le lecteur qui veut y griffonner. Et elle a été publiée discrètement, non indexée, adressée à son lecteur visé plutôt qu’aux moteurs de recherche, parce qu’une démonstration bâtie pour un opérateur devrait se comporter comme une correspondance, courtoise jusque dans ses métadonnées.


Ce que le modèle ne peut pas voir, énoncé avant qu’on le demande

Un modèle gagne la confiance par les limites qu’il déclare, cette section est donc la liste honnête la plus longue que nous sachions écrire. Quatre choses sont invisibles pour un noteur bâti sur le relevé par paire de villes de la DGCA, et chacune est capable à elle seule de renverser une décision de route.

Les tarifs

La DGCA publie combien de personnes ont volé. Elle ne publie pas ce qu’elles ont payé. Cet écart n’est pas une erreur d’arrondi ; dans l’économie des routes fines c’est fréquemment toute la question. Deux paires peuvent porter des volumes de passagers identiques tandis que l’une soutient des tarifs qui couvrent le coût de trajet d’un turbopropulseur et que l’autre survit sur des prix bradés qui noieraient tout nouvel entrant. La recette unitaire varie selon la saison, le jour de la semaine, la fenêtre de réservation et le mélange de voyages de loisir, d’affaires et d’obligation, et rien de cette variance ne laisse de trace dans un décompte de passagers.

La conséquence pour la lecture de cette étude est directe : chaque rang dans les résultats ci-dessus est un énoncé sur la demande, jamais sur les recettes. Une paire que le modèle adore pourrait être un cimetière tarifaire. L’erreur inverse existe aussi, et elle est plus subtile : une paire que le modèle note simplement bonne pourrait dégager des recettes unitaires exceptionnelles, car les marchés captifs sans alternative ferroviaire paient pour leur géographie. La route insulaire au rang 6 existe en partie sur cette logique. Distinguer les deux cas exige des données tarifaires, et les données tarifaires vivent à l’intérieur des systèmes de gestion des recettes des compagnies et des canaux de distribution qu’ils alimentent, précisément derrière le mur qu’un modèle sur données publiques respecte.

La capacité des concurrents

Le modèle voit que 141,000 passagers ont volé entre Calicut et Hyderabad. Il ne peut pas voir qui les a transportés, à quelle fréquence, sur quel appareil, ni avec combien de capacité invendue. Une paire dont la demande croît de 42 pour cent tandis que la capacité en place croît de 20 est une invitation. La même courbe de demande avec des opérateurs en place ajoutant des sièges plus vite que des passagers est un combat au couteau déguisé en opportunité. Le fichier par compagnie que publie la DGCA donne des parts de marché agrégées, mais les horaires et les décomptes de sièges par route appartiennent aux bases de données d’horaires et aux opérateurs eux-mêmes.

Cette limite interagit avec la question de la croissance d’une manière que tout lecteur professionnel repérera aussitôt. Une forte croissance attire de la capacité, et la capacité, une fois posée, transforme une vague en guerre de parts en deux saisons. Un modèle de demande signale la vague. Seule une couche concurrentielle peut dire s’il reste de la place dessus. Construire cette couche à partir d’horaires publiés est possible, et c’est la première amélioration que nous ferions avec une semaine du temps d’un opérateur ; elle ne peut simplement pas se bâtir à partir du seul relevé de passagers, et prétendre le contraire empoisonnerait les chiffres qui sont sains.

Nous avons testé le raccourci évident, et le test mérite d’être rapporté parce qu’il a échoué de façon instructive. Une archive publiée d’horaires intérieurs indiens récupérés par scraping couvre quatorze compagnies et 99 villes sur sept ans, et elle ne contient pas du tout la compagnie que cette étude modélise. Une compagnie entière en exploitation, absente du jeu de données vers lequel tout le monde se tournerait d’abord. Voilà l’argument contre les données concurrentielles récupérées par scraping en une phrase : elles échouent en silence, et elles échouent précisément sur les petits opérateurs auxquels une analyse régionale s’intéresse.

Lue purement comme une illustration, cette même archive esquisse pourtant ce que dirait une vraie couche. Sur les trois paires mises en avant dans cette étude, ses entrées valides pour 2025 montrent un unique opérateur de ligne principale tenant l’horaire à une fréquence allant de quotidienne à quatre fois par jour, tandis que la demande en dessous croît de 16 à 42 pour cent. Un opérateur en place, du matériel au gabarit de jet, une demande dépassant ce qu’un seul horaire peut absorber : c’est le motif de l’entrant, et c’est exactement ce que la couche existe pour détecter. Nous publions l’esquisse en énonçant sa provenance et sans en auditer les chiffres, parce que ce qui compte est la forme de la méthode, et que sa version honnête tourne sur des données d’horaires de qualité opérateur ou ne tourne pas.

Créneaux et réalité au sol

Une paire peut être parfaitement dimensionnée, en croissance, à portée, et toucher une base, et rester inexploitable à toute heure commercialement sensée, parce que l’aéroport à une extrémité n’offre qu’une arrivée à 14:40 sur un marché d’affaires ou pas de poste de stationnement du tout. La rareté des créneaux dans les métropoles indiennes est une contrainte vivante, et elle mord le plus là où les compagnies régionales veulent se connecter : l’extrémité grande ville d’une paire fine, où la valeur d’alimentation et d’auto-correspondance est la plus élevée. Au-delà des créneaux se trouvent les contraintes au sol plus discrètes, espace de comptoir, contrats d’assistance en escale, stationnement de nuit, disponibilité du carburant sur les petits terrains, dont aucune n’apparaît dans un jeu de données public à une finesse exploitable.

Le cadrage honnête est que le modèle classe des marchés, et que les marchés ne sont que les deux tiers d’une route. Le tiers restant est la permission opérationnelle, et la permission opérationnelle se négocie, elle ne se calcule pas.

Les artefacts de croissance, reformulés en étiquette d’avertissement

La section sur le travail de données a décrit l’artefact d’ouverture de service du côté du constructeur ; il a sa place dans cette liste du côté du lecteur, car c’est la seule limite qui fabrique activement une fausse confiance. Une paire affichant une croissance à trois chiffres peut être un marché découvert, ou bien l’horaire vieux d’un an d’une seule compagnie générant sa propre demande induite, et la différence décide si un second opérateur meurt de faim. Le modèle étouffe les bases sous 500 passagers et signale la croissance sur base récemment fine, mais étouffer et signaler sont des atténuations. Le remède est le temps : observer si les troisième et quatrième semestres de la paire tiennent le niveau que les deux premiers ont revendiqué. L’arithmétique sait attendre patiemment. Le capital devrait aussi.

Pourquoi publier les limites est la stratégie

Il existe une école de l’art commercial qui dit d’attaquer par les forces et de laisser les lacunes émerger en phase de diligence. Nous soutenons l’inverse, et cette étude est bâtie là-dessus. Chaque limite ci-dessus définit précisément un jeu de données dont la prochaine version du modèle a besoin, et chacun de ces jeux vit à l’intérieur d’un opérateur : performance tarifaire, renseignement concurrentiel, portefeuille de créneaux, courbes de maturation par route. Déclarer les limites est donc identique à publier l’ordre du jour de la collaboration. Un lecteur au sein d’une compagnie peut regarder cette section et savoir, colonne par colonne, ce qui se passerait si ses chiffres rencontraient cet instrument.

C’est la conception délibérée de tout l’exercice. Le modèle sur données publiques est complet comme démonstration et incomplet comme outil de décision, et l’incomplétude désigne exactement une porte. Remettre à un opérateur une réponse finie serait à la fois faux, pour toutes les raisons de cette section, et stratégiquement vide. Lui remettre un instrument validé doté de quatre prises d’entrée étiquetées est une invitation accompagnée de ses propres preuves.


L’utiliser comme instrument, pas comme rapport

Une étude de marché est un événement. Un instrument est une habitude. La différence décide si le travail analytique se capitalise ou s’évapore, et il vaut la peine de préciser à quoi ressemble l’habitude avec ce modèle, car le profil opérationnel en est la partie la moins spectaculaire et la plus persuasive.

Le modèle fait quelques centaines de lignes de Python ordinaire. Il ingère deux fichiers CSV récupérés depuis le miroir public, tourne en quelques secondes sur un ordinateur portable, et imprime son classement complet avec chaque sous-note exposée. Il n’y a pas de service auquel s’abonner, pas de tableau de bord à licencier, pas de fournisseur dans la boucle. Quand la DGCA publie un nouveau mois, le cycle de récupération et d’exécution prend moins d’une minute, et le classement de juin peut être posé à côté de celui de mai ligne à ligne. Une réunion de planification mensuelle peut s’ouvrir sur un diff : quelles paires ont bougé, quelles sous-notes les ont fait bouger, et si le mouvement est un signal ou un artefact.

Imaginez le rituel concrètement. Le fichier de juillet arrive. L’exécution prend une minute. Le diff montre la sous-note de croissance de Calicut–Hyderabad glissant de 26.0 vers 24 à mesure que l’année explosive se recoupe, Hyderabad–Kolhapur stable, et une paire dont personne ne parlait grimpant du rang 90 au rang 60 sur deux mois consécutifs de gains discrets. Dix minutes d’une réunion de planification, une fois par mois, et la vision périphérique du réseau reste balayée. Pas d’analyste affecté en permanence, pas d’étude trimestrielle commandée, pas de présentation.

Cette cadence change la nature des questions qu’une équipe pose. Une étude figée appelle un verdict : accepter ou réfuter. Un instrument mensuel appelle des hypothèses : si la croissance de ce corridor tient au-dessus de 20 pour cent deux trimestres de plus, il franchit notre seuil ; à surveiller. La sélection de routes ressemble moins à un contentieux sur les conclusions d’un consultant et davantage à une liste de surveillance avec des déclencheurs, ce qui est déjà la façon dont pensent les planificateurs expérimentés. L’instrument ne remplace pas la réflexion. Il lui donne une mémoire, et une mémoire qui survit aux changements de personnel.

Versionner le jugement compte autant que versionner le code. Les quatre poids sont un énoncé de conviction explicite et daté : voici combien nous valorisons la taille face à la dynamique, à la distance et à la géographie, à la date de ce trimestre. Quand la conviction change, parce qu’une nouvelle base ouvre ou que la flotte ajoute un type à plus grand rayon d’action, les poids changent en un seul endroit visible, et tout classement historique peut être relancé sous la nouvelle conviction pour comparaison. Le jugement institutionnel vit d’ordinaire dans des têtes et des consensus de couloir. Ici il vit dans quatre nombres sous contrôle de version, discutables par tous, auditables par tous, et cette migration du jugement du folklore vers des artefacts inspectables vaut, d’après notre expérience dans plusieurs secteurs, plus que la sortie même du modèle. C’est le même principe que nous appliquons en concevant des structures opérationnelles d’IA pour les entreprises : la réflexion reste humaine, l’arithmétique devient une infrastructure, et rien de dérivé n’est jamais régénéré de façon opaque quand il peut être stocké, daté et signé.

L’économie mérite un paragraphe simple. Toute cette construction, acquisition des données, nettoyage, modélisation, validation et le rapport interactif, a été exécutée par une petite équipe en quelques jours, sur des données publiques gratuites, sans cycle d’achat. Ce n’est pas une vantardise sur l’équipe ; c’est un fait sur l’époque. Le coût marginal de transformer un relevé public en instrument de décision validé s’est effondré, et toute affirmation analytique qui justifiait autrefois une étude à six chiffres doit désormais se mesurer à ce qu’un groupe compétent peut construire et valider en une semaine. Les organisations qui intègrent cela réévaluent leurs questions en conséquence. L’intrant rare n’est plus la puissance analytique. C’est de savoir quelles questions valent la peine d’être instrumentées, et ce savoir circule encore dans la tête des opérateurs.

Ce qui changerait avec un opérateur dans la boucle mérite d’être dit concrètement, car cela transforme la liste des limites d’un aveu en feuille de route. Les données tarifaires feraient du classement de demande un classement de contribution, la différence entre « des gens volent sur cette paire » et « cette paire paie l’avion ». Les données d’horaires ajouteraient une couche de saturation, séparant les vagues ouvertes des vagues encombrées. Les contraintes de créneaux et de sol élagueraient la liste au sous-ensemble exploitable avant que quiconque ne tombe amoureux d’un chiffre. Et l’historique de maturation des routes de l’opérateur, la façon dont ses jeunes routes ont réellement monté en charge, calibrerait la question de la croissance contre une vérité de terrain qu’aucun fichier public ne contient. Chaque ajout est un travail borné, de semaines et non de trimestres, car le châssis sur lequel il se boulonne tourne déjà.


Les questions qu’un planificateur de réseau poserait

Cette étude sera lue, si elle l’est, par des gens qui ont passé leur carrière à prendre la décision qu’elle modélise. Ils auront des objections, et ce sont de bonnes objections. Voici les six que nous attendrions du lecteur le plus aiguisé de la pièce, avec les réponses que nous donnerions autour d’une table.

« Notre équipe sait déjà tout cela. »

Pour les dix routes du tableau de validation : oui, de façon démontrée, et c’est là le résultat. L’accord du modèle avec le réseau existant est présenté comme une preuve en faveur du jugement de l’équipe, jamais comme un substitut. L’affirmation avancée est plus étroite et, selon nous, plus difficile à écarter : aucune équipe, quelle que soit sa taille, ne relit 2,743 paires chaque mois avec la même attention. Le tri humain est guidé par les priorités, et la priorité est fixée par ce qui est déjà visible, ce qui explique qu’un Hyderabad–Kolhapur reste inexaminé au rang 28 pendant que l’attention va à des marchés plus bruyants. L’instrument ne sait pas des choses que l’équipe ignore. Il s’occupe de choses dont l’équipe n’a pas le temps de s’occuper, uniformément, tous les mois, sans fatigue. Savoir et s’occuper sont deux capacités distinctes, et les réseaux se perdent dans l’écart entre les deux.

« Pourquoi devrions-nous faire confiance à des poids que vous avez inventés ? »

Vous ne devriez pas leur faire confiance ; vous devriez les discuter, et le modèle est bâti pour que la discussion soit peu coûteuse. Les quatre poids sont une codification défendable de la logique standard de planification de réseau, et leur défense figure dans la section de méthode. Mais la réponse plus profonde est que le classement est remarquablement stable sous des changements de poids raisonnables. Échangez la taille et la croissance, à 26 et 34, et les routes de validation restent dans le décile supérieur, parce que les paires qui notent bien sur ces données notent bien sur plusieurs questions à la fois. La sensibilité aux poids est ici une expérience de quinze secondes, et la faire tourner en direct devant un sceptique, en voyant les bonnes paires rester bonnes pendant que les paires limites se réordonnent, a convaincu plus de gens que n’importe quel argument en prose. Un modèle que l’on peut mettre sous contrainte pendant la réunion est un autre objet qu’un modèle que l’on vous demande de croire.

« Pourquoi pas de l’apprentissage automatique ? »

Parce que la contrainte qui lie ce problème est la confiance, et qu’ici la confiance découle de la lisibilité. Un classeur appris et ajusté sur onze années de ce fichier noterait sans doute les paires quelques pour cent « mieux » selon une métrique hors ligne, et serait inutilisable dans le seul cadre qui compte : une pièce où un décideur demande « pourquoi cette paire et pas celle-là ? » et a besoin d’une réponse qui résiste au contre-interrogatoire. Quatre questions à l’arithmétique visible répondent à cela par construction. Il y a aussi un problème d’honnêteté statistique : avec moins de 700 paires dans l’enveloppe et une cible aussi bruitée que le succès d’une route, un apprenant flexible a plus de capacité que les données n’ont de leçons, et ce qu’il apprendrait avec le plus d’aisance serait les biais historiques des opérateurs en place. Le noteur linéaire n’est pas un compromis en attente d’une amélioration. À cette échelle de données, c’est l’outil correct.

« Et la saisonnalité ? »

Traitée structurellement plutôt qu’astucieusement. Chaque niveau utilisé par le modèle est une somme sur douze mois glissants, et chaque chiffre de croissance compare une année complète à l’année complète précédente. Chaque fenêtre contient exactement une mousson, un pic d’hiver, un creux d’été, si bien que la forme saisonnière s’annule dans la question de taille comme dans celle de croissance. Ce que le modèle ne fait délibérément pas, c’est noter la forme intra-annuelle ; une paire qui remplit les avions en décembre et les vide en juillet peut mériter un service saisonnier plutôt qu’annuel, et cette distinction demande une analyse à résolution mensuelle que le noteur actuel laisse de côté. Les courbes mensuelles existent dans le même fichier, la couche de forme saisonnière est donc une autre extension bornée, pas une refonte.

« Les données ont un an quand elles comptent, et elles comptent des passagers transportés, pas de la demande. »

Les deux sont vrais et méritent de la précision. Le relevé de la DGCA accuse deux à trois mois de retard sur le calendrier, et une fenêtre en année glissante lisse par construction le signal le plus récent ; cet instrument lit des marées, pas la météo, et une décision d’horaire pour la saison suivante est une décision de marée. Le second point est le plus profond : le fichier enregistre les passagers transportés, c’est-à-dire la demande filtrée par la capacité que les compagnies ont choisi d’offrir. Une paire sans service affiche zéro passager, quel que soit le nombre de gens qui auraient voulu y voler, si bien que le véritable espace blanc, les paires de villes avec de la demande et aucun vol, est structurellement invisible ici. Cet angle mort convient mieux à l’utilisateur de ce modèle, un opérateur qui grandit dans une région connue, qu’à un planificateur partant de zéro : les paires qu’il fait remonter sont des marchés déjà prouvés par l’avion de quelqu’un, à des volumes que l’offre en place n’a pas épuisés. Estimer la demande de paires non desservies exige une modélisation gravitaire sur des données de population et d’économie, un autre instrument avec ses usages propres et ses barres d’erreur propres, plus larges.

« Huit sur cent, cela peut être de la chance. Comment savons-nous que le test est solide ? »

En comptant. Le réseau de la compagnie occupe dix places parmi 2,743 paires classées. Si le classement du modèle était aléatoire, le nombre attendu de ces dix tombant dans un top 100 quelconque est de 0.36. Huit y sont tombées, dont deux dans le top dix. La probabilité que huit ou plus de dix paires données tombent dans un top 100 aléatoire sur 2,743 est astronomiquement faible ; ce n’est pas un signal marginal ayant besoin d’une valeur p habillée pour paraître respectable. Le vrai défi est ailleurs : les questions du modèle encodent une logique de turbopropulseur, et la compagnie est un opérateur de turbopropulseurs, donc bien sûr un tamis en forme de turbopropulseur attrape des routes en forme de turbopropulseur. Ce à quoi nous répondons : oui, exactement. L’affirmation n’a jamais été que le modèle contient de la magie. L’affirmation est que la logique opérante d’une décision métier précise et difficile peut être écrite en quatre questions, exécutée contre un fichier public, et démontrée capable de reproduire des choix d’experts. La démystification est le produit.

« Que faudrait-il pour se fier à ceci lors d’une vraie décision de lancement ? »

Plus que ce modèle, et le modèle le dit lui-même ; les quatre limites énoncées sont la liste de contrôle. Concrètement, nous voudrions le rang de demande confirmé par une lecture tarifaire sur la paire, une couche concurrentielle montrant la capacité en place et sa trajectoire, une réponse sur les créneaux aux deux extrémités à des heures commercialement utiles, et deux trimestres de plus du signal de croissance qui tient. Le rôle du modèle dans cette séquence est le tri, dépenser une attention analytique coûteuse seulement là où une arithmétique publique bon marché a déjà trouvé un pouls. Aucun instrument de ce genre ne devrait jamais être le dernier mot avant que du capital ne bouge. Son travail est d’être le premier mot, de façon fiable, chaque mois, pour que l’investigation coûteuse démarre depuis une liste courte classée au lieu d’une carte blanche.


L’instrument, une semaine plus tard : le relevé complet et les questions auxquelles il sait désormais répondre

L’étude ci-dessus tournait sur un fichier : le relevé par paire de villes, agrégé par un miroir ouvert. Dans la semaine qui a suivi sa rédaction, nous sommes allés à la source et avons pris tout ce que la DGCA publie sous Aviation Data and Statistics : les mêmes tableaux par paire de villes jusqu’à avril 2015 (deux mois qui manquent au miroir, récupérés dans les PDF de la DGCA elle-même), les statistiques d’exploitation mensuelles de chaque compagnie depuis 2009 (départs, heures de vol, sièges-kilomètres, coefficient de remplissage, fret), les tableaux trimestriels internationaux depuis 2015, et 144 rapports mensuels de trafic avec ponctualité, annulations et réclamations. Tout cela vit désormais dans un entrepôt unique avec des noms de villes canoniques et sept contrôles de réconciliation. Le contrôle qui compte le plus : les totaux par paire de villes et les totaux par compagnie, deux publications distinctes de la DGCA comptant les mêmes passagers, concordent au passager près sur 135 des 135 mois.

L'édition entrepôt, douze mois glissants jusqu'à juillet 2026
136
Mois de données par paire de villes, sans trou
D'avril 2015 à juillet 2026 ; deux mois récupérés depuis des PDF
135 / 135
Mois où les deux tableaux de la DGCA concordent
Les totaux par paire de villes égalent les totaux par compagnie, au passager près
8 of 10
Routes de la compagnie dans le top 100 à l'aveugle, inchangé
Désormais sur 2,743 paires notées ; 79 villes de plus portent des coordonnées
144
Rapports mensuels de trafic traités
Ponctualité, annulations, réclamations, de 2014 à 2026

Avec les tableaux par compagnie au même endroit que les paires de villes, le modèle cesse d’être un écran et devient un ensemble d’instruments. Chacun est énoncé avec sa fenêtre et sa propre mesure d’erreur, car c’est la seule façon dont un planificateur de réseau laissera un chiffre entrer dans la pièce.

Les opérateurs, mesurés dans leur propre unité

Les statistiques d’exploitation mensuelles permettent de lire le secteur dans l’unité qu’un dirigeant régional gère réellement : heures de vol, départs, sièges-kilomètres par heure. Sur les douze mois jusqu’à juillet 2026 le secteur a volé à un coefficient de remplissage passagers de 85.1 pour cent. Les opérateurs régionaux réunis ont volé à 71.9. À l’intérieur de ce groupe, l’écart est l’histoire : FLY91 à 76.4 pour cent (en hausse de 2.1 points sur les douze mois précédents, sur des départs en croissance de 89 pour cent), Star Air à 74.3, IndiaOne Air à 65.1 et Alliance Air à 64.2, en baisse de 10.3 points. Les appareils régionaux volent des étapes de 300 à 540 kilomètres à 1.2 à 1.4 heure de vol par départ ; les opérateurs de monocouloirs volent des étapes de 880 à 1,180 kilomètres. Même pays, deux métiers différents, désormais visibles dans un seul tableau.

Coefficient de remplissage passagers, intérieur régulier, douze mois jusqu'à juillet 2026
Akasa Air
92.3%
SpiceJet
85.6%
IndiGo
85.2%
Toutes compagnies
85.1%
Air India Express
84.6%
Air India
82.9%
FLY91
76.4%
Star Air
74.3%
IndiaOne Air
65.1%
Alliance Air
64.2%
Source : statistiques mensuelles de trafic et d'exploitation de la DGCA (formulaire A de l'OACI). CR = passagers-km / sièges-km offerts.

Comment une route neuve monte réellement en charge

L’artefact d’ouverture de service décrit plus haut avait un jumeau positif qui attendait dans le même fichier. Si le relevé montre chaque route jamais née, il montre comment les routes grandissent. Nous avons identifié chaque paire de villes véritablement nouvelle depuis avril 2016, une paire sans trafic antérieur atteignant 500 passagers dans l’un de ses trois premiers mois, redémarrages post-pandémie exclus : 395 lancements, dont 145 dans la classe turbopropulseur de 2,000 à 8,000 passagers par mois. Leur trajectoire médiane est la référence qu’aucune équipe de planification n’avait, parce qu’aucune équipe seule ne lance assez de routes pour la calculer.

La route médiane de classe turbopropulseur porte 3,863 passagers par mois au mois trois, 3,046 au mois douze et 1,594 au mois vingt-quatre. Soixante-cinq pour cent volent encore au mois douze et 70 pour cent au mois vingt-quatre (certaines routes s’interrompent puis reviennent). La route neuve typique culmine tôt puis s’érode ; une route encore en ascension dans sa deuxième année fait quelque chose d’inhabituel. Rapportés à cette courbe, les lancements de 2024 de la compagnie se situent au-dessus de la médiane jusqu’au mois vingt-quatre, ce qui est le genre de résultat qu’un relevé public peut remettre à une équipe de planification comme une preuve et non comme un compliment.

Passagers mensuels médians, lancements de classe turbopropulseur depuis 2016 (145 routes)
Mois 11921 of 3863
Mois 33863 of 3863
Mois 63762 of 3863
Mois 123046 of 3863
Mois 241594 of 3863
Les barres montrent le volume de la route médiane à chaque mois en part de son pic du mois trois. Part des routes encore exploitées : 100 pour cent au mois un, 65 au mois douze, 70 au mois vingt-quatre.

Entraîné sur les 332 lancements disposant de deux années observables, un classeur qui ne voit que ce qui est connu au mois trois (volume précoce, distance, population de bassin, trafic des extrémités, mois de lancement, présence d’une métropole) prédit la survie au mois vingt-quatre avec une AUC validée par validation croisée de 0.73 face à un taux de base de 61 pour cent. Modeste, honnête, et suffisant pour classer les lancements de cette année par les chances que le relevé leur donne.

Demande latente : ce qu’une paire devrait porter

Le tri classe des paires qui montrent déjà de la demande. Un modèle gravitaire pose la question antérieure : étant donné les populations de bassin de deux villes, le trafic de leurs aéroports et la distance qui les sépare, combien de personnes devraient voler, et où est l’écart ? Ajusté sur 613 paires desservies, le modèle explique deux tiers de la variance hors échantillon (R carré validé par validation croisée de 0.67) avec une élasticité de distance de moins 0.67 et une pénalité sur les paires sous 300 kilomètres, où la route et le rail assurent le trajet. Le résidu est le résultat. Hyderabad–Nagpur porte 109,000 passagers par an contre un potentiel proche de 378,000 ; Bengaluru–Tirupati 55,000 contre 275,000. Parmi les paires pratiquement sans service, Bagdogra–Patna, Mangalore–Pune, Ranchi–Varanasi et Goa–Mangalore montrent chacune un potentiel supérieur à 100,000 passagers par an selon les termes du modèle. Le potentiel n’est pas une réservation ; c’est là où l’arithmétique dit de regarder en premier.

Une prévision qui énonce son erreur

Chaque paire dépassant mille passagers sur la dernière année porte désormais une prévision à douze mois, issue de modèles de gradient boosting ajustés par horizon sur l’historique propre de la paire et le calendrier. Le chiffre qui compte n’est pas la prévision mais le backtest : entraîné jusqu’à juillet 2025 et invité à prédire les douze mois suivants, l’erreur absolue pondérée du modèle sur 666 paires a été de 18.3 pour cent contre 31.5 pour cent pour une règle saisonnière naïve ; sur les axes majeurs 12.4 pour cent, sur les paires de classe turbopropulseur 27.7 contre 63.1 ; sur le total national 4.7 pour cent contre 14.3. En regardant devant depuis juillet 2026, il place les douze prochains mois à 163.2 millions de passagers contre 167.5 millions sur les douze derniers, une année molle, avec des fourchettes attachées à chaque paire. Un nouveau concurrent, un choc tarifaire ou une immobilisation de flotte ne figurent pas parmi les variables, et le modèle le dit.

Ce que les sorties laissent derrière elles

Les tableaux par compagnie remontent à 2009, assez loin pour voir partir trois transporteurs. Jet Airways détenait 10.8 pour cent des passagers intérieurs réguliers dans les six mois précédant son arrêt en avril 2019 ; dans les six mois suivants, IndiGo a gagné 4.3 points de part, SpiceJet 2.6 et Go First 2.3, chacun sur une croissance de capacité de 15 à 45 pour cent sur un an. Les 7.4 pour cent de Go First en 2023 sont allés pour 7.1 points à IndiGo. Le niveau du secteur est aussi loin que portent les données publiques, puisque la DGCA ne publie pas le trafic par compagnie et par paire ; mais la forme de la redistribution est désormais un fait mesuré plutôt qu’un souvenir.

Qualité de service, d’après les rapports du régulateur

Les 144 rapports mensuels de trafic ajoutent la seconde dimension qu’un passager ressent. Sur l’année civile 2025, la ponctualité aux six aéroports métropolitains s’est établie en moyenne à 81.6 pour cent pour IndiGo, 78.4 pour Akasa Air, 76.4 pour le groupe Air India, 58.3 pour Alliance Air et 58.1 pour SpiceJet. Le taux global d’annulation en juin 2026 était de 0.63 pour cent. Lus à côté des coefficients de remplissage et des parts, ces chiffres transforment un tableau d’opérateurs en portrait d’opérateurs.

Interroger les données

Tout cela se trouve derrière le panneau en fin de page. C’est l’entrepôt sous forme de conversation : un analyste qui ne répond qu’à partir de requêtes qu’il exécute devant vous (chaque réponse s’ouvre pour les montrer), énonce la fenêtre et la source avec chaque chiffre, et refuse de juger la viabilité ou la rentabilité parce que les données ne le permettent pas. Demandez-lui ce qu’une paire a porté, comment un lancement se compare à la courbe de référence, quel opérateur régional vole le plus plein, ou ce qu’il ne peut pas voir. Les mêmes outils sont exposés comme serveur MCP, une équipe de planification peut donc placer le relevé et les modèles à l’intérieur de l’assistant qu’elle utilise déjà.


Le motif, au-delà de l’aviation

Retirez les hélices de cette étude et il reste une méthode générique. Elle comporte cinq étapes, et chacune se transpose à tout secteur où une décision de sélection récurrente et à fort enjeu rencontre un relevé public.

Trouvez la colonne vertébrale publique. Tout secteur régulé publie plus que ses acteurs n’en utilisent d’ordinaire : autorisations de médicaments et listes de ruptures, trafic portuaire, attributions de marchés, comptes déposés, registres de sanctions, cadastres, statistiques du commerce. Le fichier par paire de villes de la DGCA est d’un cœur inhabituellement propre, onze ans, mensuel, universel, mais son existence n’a rien d’inhabituel. La première heure de cette méthode pose toujours la même question : que compte déjà le régulateur ?

Encodez le jugement, en petit. Les quatre questions sont venues d’un raisonnement sur la façon dont pense un planificateur de réseau, écrit et pondéré. Tout domaine opérationnel a ses quatre à six questions équivalentes que ses vétérans appliquent d’instinct : qu’est-ce qui fait un bon appel d’offres à soumissionner, un bon bassin pour une clinique, une bonne référence à mettre en rayon, un bon compte à appeler en premier. La discipline consiste à garder le modèle assez petit pour que chaque note puisse se défendre à voix haute, car dès qu’une note ne peut plus s’expliquer, la pièce revient à l’instinct et l’instrument meurt.

Validez à l’aveugle contre des décisions connues. C’est l’étape qui sépare la méthode d’un tableur avec des opinions, et elle est disponible dans tout domaine ayant un historique observable. Avant que le modèle ne puisse recommander, il doit redécouvrir : classer les choix que l’organisation a déjà faits, sans qu’on lui dise lesquels. S’il réussit, chaque suggestion ultérieure hérite d’une crédibilité méritée. S’il échoue, le modèle s’est trompé en privé, pour un coût nul, ce qui est l’endroit le moins cher où un modèle peut échouer.

Déclarez les limites comme un programme de données. Ce que la colonne vertébrale publique ne peut pas voir, les tarifs ici, les marges, la capacité ou l’intention ailleurs, devient une liste nommée, et la liste sert en même temps de plan d’intégration des données internes du propriétaire. Des limites énoncées d’emblée transforment le scepticisme en cadrage.

Faites-le tourner à une cadence, et gardez le jugement versionné. L’instrument se relance quand le relevé se met à jour, ses poids vivent sous contrôle de version comme des énoncés de conviction datés, et ses sorties sont conservées à côté du raisonnement, de sorte que tout désaccord futur soit un diff plutôt qu’un débat sur des souvenirs.

Pour rendre la transposition concrète, appliquez la méthode à un autre secteur en un paragraphe. Un distributeur pharmaceutique décidant quels comptes hospitaliers poursuivre affronte la même forme de problème que le planificateur de routes : des milliers de candidats, quelques dizaines de viables, un jugement concentré dans des têtes chevronnées. La colonne vertébrale publique existe, dans les appels d’offres d’achat de médicaments, les registres de lits hospitaliers et les données de licences réglementaires. Le jugement maison se comprime en une poignée de questions : le compte a-t-il la bonne taille pour notre empreinte logistique, ses achats croissent-ils, est-il dans notre rayon de chaîne du froid, se trouve-t-il près de comptes que nous servons déjà ? La validation à l’aveugle est disponible, car le portefeuille actuel de comptes du distributeur est un ensemble de décisions historiques que le modèle doit redécouvrir avant de pouvoir recommander. Même instrument, autres noms communs. Rien dans le cas de l’aviation ne dépendait de l’aviation ; cela dépendait d’un relevé public, d’un jugement compressible et d’un historique vérifiable, et ces trois ingrédients sont courants.

Aucune de ces étapes n’exige de technologie héroïque, et cette observation est la thèse discrète de cette étude. L’enthousiasme actuel pour l’IA en entreprise se concentre sur la génération, les agents conversationnels, les copilotes, la rédaction de documents, et la plupart des organisations ont désormais acheté ou construit la couche facile. La valeur qui se capitalise se situe un cran au-dessus, dans l’instrumentation des décisions : prendre les sélections que des gens chevronnés répètent sous incertitude et donner à chacune une colonne vertébrale de données publiques, une notation explicite du jugement maison, une validation à l’aveugle et une cadence mensuelle. La sélection de routes aériennes se trouve démontrer le motif de façon vive, parce que le relevé public est généreux et les décisions célèbres. Le motif lui-même est transposable à tout bureau où quelqu’un demande de façon répétée « laquelle ensuite ? »


Reproduire cette étude

Tout ce que contient cette étude peut être vérifié depuis un ordinateur portable, et une revendication de reproductibilité devrait s’accompagner de la recette réelle, la voici donc.

Les données sont le fichier agrégé des paires de villes intérieures issu du miroir open source india-aviation-traffic des statistiques mensuelles de la DGCA, deux CSV totalisant environ 4.5 MB. Le modèle est un unique script Python sans dépendance au-delà de la bibliothèque standard. L’exécution dure quelques secondes et imprime deux blocs : le tableau de validation, le réseau connu de la compagnie classé à l’aveugle, et les meilleures opportunités non desservies avec leurs sous-notes.

Les paramètres qui définissent le modèle, en un seul endroit : enveloppe de 150 à 900 kilomètres avec bande idéale de 250 à 700 ; créneau de taille optimal de 2,000 à 25,000 passagers par mois avec décroissance proportionnelle en dehors ; croissance mesurée comme douze mois glissants face aux douze précédents avec un plancher de base de 500 passagers et une notation neutre en dessous ; villes de base pondérées à la note pleine en cas de contact et à 0.55 sinon ; poids 34, 26, 22, 18. Les distances sont orthodromiques, à partir de coordonnées aéroportuaires publiées. L’aliasing des noms de villes est appliqué avant toute agrégation, et la table d’alias fait partie du code, ce n’est pas une étape de prétraitement que quelqu’un doit se rappeler.

Quiconque relance contre un mois DGCA ultérieur obtiendra des chiffres différents, ce qui est tout l’intérêt d’un instrument. La revendication de validation est datée : sur les douze mois clos en juillet 2026, les rangs sont ceux imprimés dans le tableau de validation, et le modèle qui les a produits a été gelé avant la comparaison. Si un mois ultérieur déplace un rang, c’est le marché qui parle, et la bonne réaction est la curiosité pour la sous-note qui a bougé.

L’édition entrepôt ajoute une seconde recette. L’export complet de la DGCA, les analyseurs, les portes de réconciliation, les modèles et les outils de conversation vivent dans un même dépôt ; aviation build, aviation gates, aviation models et aviation report reconstruisent tout à partir des fichiers bruts en une vingtaine de minutes, et aviation mcp expose les mêmes quatre outils (schéma, SQL en lecture seule, sorties de modèles, recherche documentaire) à tout assistant compatible MCP.

Adapter l’étude à un autre opérateur relève d’une courte liste de contrôle plutôt que d’une reconstruction. Remplacez l’ensemble des bases par les bases propres de l’opérateur, ce qui change une ligne. Remplacez les paramètres d’enveloppe si la flotte diffère, un jet régional de 90 places étire la bande de distance et relève la bande de taille, et chacune de ces modifications tient en deux nombres. Réexaminez la table d’alias face à toute ville que le nouveau réseau touche et que celui-ci ne touchait pas, car les bizarreries de nomenclature sont la seule part du travail garantie de resurgir. Puis lancez la même validation à l’aveugle contre le réseau connu du nouvel opérateur avant de lire la moindre opportunité, et tenez la même règle que nous avons tenue : un modèle incapable de redécouvrir le réseau existant n’a rien à faire à lui suggérer des ajouts. La règle ne coûte rien à appliquer et fait toute la différence entre un instrument et une diapositive.


Un dernier mot sur ce que cette étude demande à son lecteur. Si vous dirigez un réseau, l’invitation est explicite dans la section des limites : les quatre angles morts du modèle nomment les quatre jeux de données qui le compléteraient, et cet achèvement représente des semaines de travail, chez vous, contre vos chiffres. Si vous dirigez quelque chose qui n’a rien à voir avec des avions, l’invitation est la section du motif : quelque part dans votre exploitation se trouve une décision de sélection récurrente, un relevé public qui la concerne, et une poignée de questions que vos meilleurs éléments se posent déjà d’instinct. La distance entre ces matières premières et un instrument validé est bien plus courte que le secteur de l’analyse ne vous a entraîné à le croire.

Qu’a prouvé cet exercice, au bout du compte ? Trois choses, par ordre croissant de portée.

Il a prouvé qu’une décennie de décisions d’aviation régionale indienne est lisible dans des données publiques, ce qui est un compliment à la publication de la DGCA et aux planificateurs dont les choix ont laissé une signature aussi nette. Il a prouvé que le jugement derrière une décision récurrente à fort enjeu peut s’écrire en petit, se valider à l’aveugle et se transformer en un instrument dont la relance ne coûte rien, ce qui est un énoncé de méthode disponible pour tout secteur doté d’un relevé public. Et il nous a prouvé, à nous surtout, que la façon la plus rapide de gagner l’attention d’un opérateur sérieux est de faire un vrai travail sur son problème avant de lui demander son temps, de publier l’arithmétique, et d’énoncer les limites avant qu’on ne les demande.

Le modèle tourne. Le relevé se met à jour chaque mois. Et 2,743 paires de villes sont désormais surveillées par quelque chose qui ne se lasse jamais de surveiller, en attendant que les chiffres que seul un opérateur détient achèvent le tableau.

Frequently asked questions

Can a route model built only on public data be trusted?+

It has to earn trust through blind validation. Before suggesting anything, this model was asked to rank all 2,743 feasible city pairs without being told which routes the carrier flies. It placed eight of the carrier's ten routes in its top 100, against a random expectation of well under one, which means the ranking logic reproduces expert network-planning decisions from public data alone.

What data does the route model use?+

One public source: the DGCA's monthly record of domestic passengers carried between every pair of Indian cities, from April 2015 to July 2026. No fares, no schedules, and no carrier-internal data of any kind are inputs.

What can the model not see?+

Fares, competitor capacity, and airport slots. It ranks demand, never profitability. Each of those blind spots names a dataset that only an operator holds, which is exactly where the model's next version would come from.

Ask the data

The warehouse behind this report, as a conversation

DGCA public statistics (domestic 2015 onward, airlines 2009 onward, international 2015 onward, monthly traffic reports 2014 onward) and the models in this report. Every number comes from a query you can open. It sees demand, not fares or schedules.

Source: DGCA (provisional). Answers describe demand structure; they never judge viability or profitability. Conversations are logged to improve the analyst.

Prêt à engager la conversation ?

Découvrez comment ArkOne conçoit la gouvernance et l'architecture de programme nécessaires pour générer des résultats IA mesurables.

Réserver un appel découverte