
Le mandarin, le cantonais, le shanghaïen et le hokkien sont couramment qualifiés de dialectes du chinois. Pourtant, leurs différences peuvent être plus importantes que celles qui séparent plusieurs langues européennes officiellement reconnues. Comprendre pourquoi révèle quelque chose de fascinant sur la manière dont nous définissons les langues.
La plupart des gens considèrent le chinois comme une seule langue parlée dans différents dialectes régionaux. Le mandarin est la langue standard officielle en Chine continentale, tandis que le cantonais, le shanghaïen, le hokkien, le hakka et d’autres variétés sont couramment décrits comme des formes régionales d’une même langue.
Mais une particularité intéressante complique les choses : de nombreux « dialectes » chinois ne sont pas mutuellement intelligibles.
Une personne parlant mandarin ne peut généralement pas comprendre une conversation menée entièrement en cantonais, en shanghaïen ou en hokkien sans y avoir été exposée auparavant ou les avoir étudiés. Ces variétés diffèrent considérablement par leur prononciation et leur vocabulaire, ainsi que par certains aspects de leur grammaire.
Considérons maintenant les langues de l’ex-Yougoslavie. Le serbe, le croate, le bosnien et le monténégrin sont reconnus comme des langues nationales standard distinctes. Pourtant, leurs locuteurs peuvent généralement se comprendre sans grande difficulté.
Cela crée un contraste fascinant. Certaines langues officiellement reconnues sont extrêmement proches, tandis que certaines variétés traditionnellement classées comme dialectes sont radicalement différentes.
Qu’est-ce qui fait donc exactement qu’une variété est une langue plutôt qu’un dialecte ?
La réponse ne se limite pas au vocabulaire et à la grammaire. L’histoire, l’identité culturelle, l’éducation et la standardisation linguistique jouent également un rôle important. Reconnaître des différences linguistiques n’implique pas que les communautés doivent avoir des identités nationales ou politiques distinctes. La classification linguistique et l’identité nationale sont des questions liées, mais fondamentalement différentes.
Le chinois est une famille diversifiée de langues apparentées
Le chinois appartient à la famille des langues sino-tibétaines. Ses variétés forment la branche sinitique, que les linguistes divisent généralement en plusieurs grands groupes.
Selon le système de classification, le chinois compte environ sept à dix grands groupes, chacun comprenant de nombreuses variétés régionales.
| Groupe | Variétés bien connues | Principales régions |
|---|---|---|
| Mandarin | Mandarin standard, sichuanais | Nord et sud-ouest de la Chine |
| Wu | Shanghaïen, parler de Suzhou | Shanghai, Zhejiang |
| Yue | Cantonais, taishanais | Guangdong, Hong Kong |
| Min | Hokkien, teochew, parler de Fuzhou | Fujian, Taïwan |
| Hakka | Variétés du hakka | Guangdong, Fujian, Jiangxi |
| Xiang | Hunanais | Hunan |
| Gan | Variétés du gan | Jiangxi |
| Jin | Variétés du jin | Shanxi |
| Huizhou | Variétés du hui | Sud de l’Anhui |
| Pinghua | Variétés du pinghua | Guangxi |
La classification exacte ne fait pas l’unanimité. Par exemple, le jin est parfois regroupé avec le mandarin, tandis que le min comprend plusieurs variétés fortement divergentes.
Même l’appartenance à un même groupe ne garantit pas l’intercompréhension. Le hokkien et le parler de Fuzhou appartiennent tous deux au groupe min, mais leurs locuteurs ne peuvent généralement pas se comprendre sans y avoir été exposés auparavant.
Certaines communautés voisines du sud de la Chine parlent également des variétés qui peuvent être difficiles à comprendre pour les personnes extérieures, y compris les locuteurs d’autres variétés du chinois.
L’Encyclopaedia Britannica décrit le chinois comme un ensemble de variétés communément appelées dialectes, mais généralement classées comme des langues distinctes par les spécialistes. Elle compare leurs différences à celles qui existent entre les langues romanes modernes, telles que l’espagnol, l’italien et le français.
Décrire le chinois comme un groupe de langues apparentées n’est donc pas une position linguistique inhabituelle. C’est une manière bien établie de comprendre sa diversité.
Qu’est-ce qui distingue une langue d’un dialecte ?
L’un des concepts les plus utiles en linguistique est l’intercompréhension, c’est-à-dire la capacité des locuteurs de différentes variétés à se comprendre sans étude préalable.
Prenons l’anglais américain et l’anglais britannique. Ils diffèrent par leur prononciation, leur vocabulaire et certaines conventions grammaticales, mais leurs locuteurs peuvent généralement communiquer sans difficulté. La plupart des gens les reconnaissent comme des variétés de l’anglais.
Considérons maintenant l’espagnol et le portugais. Ces langues partagent un ancêtre commun et de nombreuses similitudes, mais la compréhension entre leurs locuteurs est moins assurée, surtout dans les échanges spontanés.
Le mandarin et le cantonais présentent une situation comparable. Bien qu’ils appartiennent tous deux à la tradition linguistique chinoise, connaître l’un ne permet pas automatiquement de comprendre l’autre.
Il en va de même pour le mandarin et le shanghaïen, ou pour le mandarin et le hokkien.
Il ne s’agit pas simplement d’accents différents. Ce sont des systèmes linguistiques distincts qui se sont développés au fil des siècles, avec des différences importantes dans leurs systèmes phonologiques, leur vocabulaire et certaines structures grammaticales.
L’intercompréhension n’est toutefois pas un critère parfait. Une personne parlant mandarin qui regarde régulièrement la télévision cantonaise peut comprendre beaucoup plus de cantonais qu’une personne qui n’y a jamais été exposée. L’exposition, l’éducation et les contacts régionaux peuvent fortement influer sur la compréhension.
Les langues peuvent aussi former des continuums dialectaux, dans lesquels les variétés voisines sont relativement faciles à comprendre, tandis que les variétés plus éloignées deviennent de plus en plus différentes.
Néanmoins, l’intercompréhension constitue un point de départ utile pour comprendre pourquoi de nombreuses variétés du chinois peuvent raisonnablement être considérées comme des langues distinctes.
Le mandarin et le cantonais ne diffèrent pas seulement par leur prononciation
Pour apprécier les différences entre les variétés du chinois, examinons quelques expressions courantes.
| Français | Mandarin | Cantonais |
|---|---|---|
| Je | 我 (wǒ) | 我 (ngo5) |
| Il ou elle | 他 / 她 (tā) | 佢 (keoi5) |
| Manger | 吃 (chī) | 食 (sik6) |
| Ne… pas | 不 (bù) | 唔 (m4) |
| Être | 是 (shì) | 係 (hai6) |
| Quoi | 什么 (shénme) | 乜嘢 (mat1 je5) |
| Maintenant | 现在 (xiànzài) | 而家 (ji4 gaa1) |
Certains mots utilisent les mêmes caractères, mais se prononcent différemment. D’autres utilisent des mots et des caractères entièrement différents.
Les différences deviennent plus claires lorsqu’on compare des phrases complètes.
Français : Que veux-tu manger ?
Mandarin : 你想吃什么?
Nǐ xiǎng chī shénme?
Cantonais : 你想食乜嘢?
Nei5 soeng2 sik6 mat1 je5?
Les deux phrases expriment le même sens et partagent certains éléments de leur structure grammaticale. Cependant, leur vocabulaire et leur prononciation diffèrent considérablement.
Le cantonais utilise aussi des particules grammaticales, des marqueurs aspectuels et d’autres constructions qui ne correspondent pas directement à l’usage courant du mandarin.
Les deux variétés partagent un fondement historique, mais cela ne les rend pas interchangeables.
La comparaison surprenante avec l’ex-Yougoslavie
L’illustration la plus frappante du fonctionnement de la classification linguistique vient peut-être du sud-est de l’Europe.
Pendant une grande partie du XXe siècle, les communautés parlant serbe, croate, bosnien et monténégrin étaient associées à une langue standard commune généralement appelée serbo-croate.
Après la dissolution de la Yougoslavie, quatre langues nationales standard distinctes se sont établies : le serbe, le croate, le bosnien et le monténégrin.
Chacune possède son propre statut officiel, ses conventions normalisées, ses traditions littéraires et ses liens avec l’identité nationale. Des différences existent dans le vocabulaire, la prononciation, l’orthographe et les expressions privilégiées. Le serbe utilise également les alphabets cyrillique et latin, tandis que le croate utilise l’alphabet latin.
Pourtant, les locuteurs de ces quatre variétés standard peuvent généralement communiquer sans traduction.
Une personne parlant croate peut habituellement regarder la télévision serbe et comprendre ce qui est dit. Une personne parlant bosnien peut généralement converser avec une personne parlant monténégrin sans avoir à étudier le monténégrin comme une langue étrangère.
Les différences sont réelles, mais l’intercompréhension reste très élevée.
Cette situation contraste avec celle du mandarin et du cantonais, dont les locuteurs doivent souvent utiliser une langue commune, comme le mandarin standard, pour communiquer.
| Variétés linguistiques | Degré habituel d’intercompréhension à l’oral sans étude préalable |
|---|---|
| Serbe et croate | Très élevé |
| Croate et bosnien | Très élevé |
| Serbe et monténégrin | Très élevé |
| Mandarin et cantonais | Faible |
| Mandarin et shanghaïen | Faible |
| Mandarin et hokkien | Faible |
| Hokkien et parler de Fuzhou | Faible |
Il s’agit de descriptions qualitatives générales plutôt que de mesures numériques précises. La compréhension réelle dépend de l’éducation, de l’exposition et des variétés particulières concernées.
Néanmoins, le contraste central est clair.
Le serbe, le croate, le bosnien et le monténégrin sont reconnus comme des langues nationales standard distinctes malgré leur étroite parenté linguistique. Le mandarin, le cantonais et le hokkien sont souvent appelés dialectes malgré une intercompréhension bien plus faible.
Cela ne signifie pas que les langues nationales de l’ex-Yougoslavie devraient être considérées comme illégitimes ou que leurs distinctions sont sans importance. Leurs normes et leurs identités distinctes sont bien établies.
Cette comparaison montre plutôt que la similitude linguistique n’est pas le seul facteur déterminant la reconnaissance d’une variété comme langue.
Ce phénomène n’est pas propre au chinois
Des situations similaires existent partout dans le monde.
Le norvégien, le suédois et le danois sont reconnus comme des langues distinctes, mais leurs locuteurs peuvent souvent se comprendre à des degrés divers. Le norvégien et le suédois sont particulièrement proches à bien des égards, même si la compréhension varie selon le dialecte et l’exposition de chaque personne.
L’hindi et l’ourdou constituent un autre exemple intéressant. Leurs formes familières courantes peuvent présenter un degré élevé d’intercompréhension, tandis que leurs normes formelles diffèrent par le vocabulaire, les systèmes d’écriture et les traditions littéraires.
L’arabe présente une situation plus comparable à celle du chinois. L’arabe standard moderne fournit une langue écrite formelle commune dans une grande partie du monde arabe, tandis que les variétés parlées au quotidien peuvent différer radicalement. L’arabe marocain et l’arabe irakien, par exemple, peuvent être difficiles à comprendre pour leurs locuteurs respectifs sans exposition préalable.
L’allemand offre un autre exemple. Certaines variétés du suisse allemand diffèrent considérablement de l’allemand standard, mais elles sont généralement regroupées au sein de la tradition linguistique allemande au sens large.
Ces exemples montrent qu’il n’existe aucune règle universelle selon laquelle des variétés étroitement apparentées doivent toujours être classées comme dialectes, ou des variétés fortement divergentes doivent toujours être reconnues comme des langues distinctes.
Parfois, des variétés étroitement apparentées développent des normes nationales indépendantes. Parfois, des variétés très différentes restent rattachées à une identité linguistique et culturelle commune.
Pourquoi les langues chinoises sont-elles encore appelées dialectes ?
Cette terminologie s’explique par d’importantes raisons historiques, culturelles et linguistiques.
Premièrement, les communautés sinophones partagent une longue histoire littéraire et culturelle. Leurs langues se sont développées à partir de formes historiques apparentées du chinois, et de nombreuses communautés ont maintenu des liens grâce à la littérature, à l’éducation et aux échanges culturels.
Deuxièmement, le mandarin standard sert de langue commune dans toute la Chine continentale et occupe également une place centrale dans l’éducation et la communication publique à Taïwan. Les locuteurs de différentes variétés régionales apprennent fréquemment le mandarin et l’utilisent pour communiquer au-delà de leurs communautés locales.
Troisièmement, le terme chinois 方言 (fāngyán), couramment traduit par « dialecte », ne correspond pas parfaitement au sens courant du mot anglais « dialect ». Il peut désigner de manière générale des formes régionales de parler, y compris des variétés qui ne sont pas mutuellement intelligibles.
Enfin, les appellations linguistiques sont façonnées par les conventions historiques et les identités culturelles partagées. Une identité commune peut englober une diversité linguistique considérable, tout comme des identités distinctes peuvent se développer autour de langues étroitement apparentées.
Le terme « dialecte chinois » est donc compréhensible dans son contexte historique et culturel.
La difficulté apparaît lorsque les lecteurs anglophones l’interprètent comme désignant une variation mineure d’une même langue parlée.
Tout le monde n’utilise-t-il pas les mêmes caractères chinois ?
L’une des raisons pour lesquelles les variétés du chinois semblent plus unifiées qu’elles ne le sont à l’oral est leur tradition écrite commune.
Une personne parlant cantonais et une personne parlant mandarin peuvent avoir du mal à se comprendre à l’oral, alors que toutes deux peuvent lire le chinois écrit standard si elles l’ont appris.
Cependant, cela ne signifie pas que la norme écrite représente directement chaque variété parlée de la même manière.
Le chinois écrit standard repose largement sur le vocabulaire et la grammaire du mandarin. Les locuteurs d’autres variétés du chinois apprennent généralement cette norme écrite dans le cadre de l’enseignement formel, même lorsqu’elle diffère de leur parler quotidien.
Le cantonais en fournit un exemple particulièrement clair.
Français : Il n’est pas à la maison.
Chinois écrit standard : 他不在家。
Cantonais familier écrit : 佢唔喺屋企。
Les deux phrases expriment le même sens, mais leur vocabulaire et leurs conventions grammaticales diffèrent.
Une personne connaissant uniquement le chinois écrit standard peut ne pas reconnaître toutes les expressions utilisées en cantonais familier écrit.
D’autres variétés du chinois possèdent également un vocabulaire et des structures grammaticales spécifiques, bien que leurs traditions écrites et leur degré de standardisation diffèrent.
Un système d’écriture commun peut faciliter la communication par-delà les frontières linguistiques, mais il ne supprime pas ces frontières.
L’inverse est également vrai. Le serbe et le croate peuvent utiliser des conventions d’écriture différentes tout en restant très largement mutuellement intelligibles à l’oral.
Les systèmes d’écriture et les langues parlées sont liés, mais ce n’est pas la même chose.
Pourquoi ces distinctions comptent pour la traduction et l’IA
Les différences entre les variétés du chinois ne relèvent pas simplement du débat universitaire. Elles ont des conséquences pratiques pour les logiciels de traduction, la reconnaissance vocale, les sous-titres et l’intelligence artificielle.
On ne peut pas automatiquement attendre d’un modèle de reconnaissance vocale entraîné principalement sur le mandarin qu’il comprenne correctement le cantonais ou le hokkien. Ces langues ont des systèmes phonologiques, un vocabulaire et des conventions linguistiques différents.
De même, traduire un texte en chinois écrit standard ne produit pas nécessairement la langue qu’une personne parlant cantonais utiliserait naturellement dans une conversation quotidienne.
Un service de traduction qui annonce prendre en charge le « chinois » peut désigner le mandarin standard, le chinois écrit standard, le cantonais ou une combinaison de ces éléments. La distinction est importante, car la prise en charge de l’un ne garantit pas celle des autres.
Par exemple, un système de traduction par IA peut nécessiter un entraînement et une évaluation propres à chaque langue pour produire du cantonais naturel plutôt qu’un chinois écrit fondé sur le mandarin. Les systèmes de reconnaissance vocale doivent également tenir compte des différences de prononciation, de vocabulaire et, parfois, de structures linguistiques entièrement différentes.
Le défi ne se limite pas aux variétés les plus connues.
Le hokkien, le hakka, le teochew, le parler de Fuzhou et d’autres langues régionales comptent d’importantes communautés de locuteurs, mais reçoivent souvent moins d’attention de la part des technologies linguistiques grand public.
Prendre en charge ces langues exige davantage que de les traiter comme des variantes du mandarin. Cela peut nécessiter de recueillir des données d’entraînement appropriées, de développer des conventions d’écriture, d’évaluer les productions en langue maternelle et de travailler avec des locuteurs qui comprennent les différences régionales.
C’est particulièrement important pour la traduction en temps réel, où deux personnes parlant des langues différentes doivent pouvoir communiquer naturellement sans s’appuyer sur une langue commune.
Reconnaître la diversité linguistique peut améliorer la précision de la traduction, l’accessibilité et la préservation des langues. Cela aide également les développeurs de technologies à décrire plus précisément les langues prises en charge.
Le chinois est-il donc une seule langue ou plusieurs ?
La réponse dépend de la manière dont le mot « chinois » est utilisé.
D’un point de vue historique et culturel, le chinois peut servir de terme générique couvrant de nombreuses variétés linguistiques apparentées qui partagent d’importantes traditions littéraires et culturelles.
Du point de vue de la linguistique comparative, il est souvent plus instructif de décrire le chinois comme un groupe de langues sinitiques apparentées au sein de la famille sino-tibétaine.
Les deux descriptions peuvent être utiles, car elles répondent à des questions différentes.
Qualifier le cantonais, le hokkien ou le shanghaïen de langue distincte au sens linguistique ne revient pas à nier ses liens avec l’histoire ou la culture chinoises. Cela n’implique pas non plus quoi que ce soit concernant la nationalité ou l’identité politique de ses locuteurs.
De même, reconnaître le serbe, le croate, le bosnien et le monténégrin comme des langues nationales standard distinctes n’exige pas de supposer que leurs différences linguistiques sont plus grandes qu’elles ne le sont.
La classification des langues comporte au moins deux dimensions : le degré de différence linguistique entre les variétés, et la manière dont les communautés les identifient, les standardisent et les utilisent.
Ces dimensions ne coïncident pas toujours.
Conclusion : une langue ne se résume pas à une classification linguistique
La distinction entre une langue et un dialecte peut sembler simple, mais le chinois et les langues de l’ex-Yougoslavie montrent à quel point elle peut devenir complexe.
Le serbe, le croate, le bosnien et le monténégrin sont des langues nationales standard distinctes malgré leur forte intercompréhension. Le mandarin, le cantonais, le hokkien et le shanghaïen sont souvent décrits comme des dialectes malgré des différences linguistiques majeures qui peuvent empêcher leurs locuteurs de communiquer facilement.
Aucune de ces situations ne peut s’expliquer par la seule intercompréhension.
L’histoire, l’éducation, les traditions littéraires, l’identité culturelle et la standardisation influencent toutes la manière dont les langues sont classées et nommées.
L’essentiel à retenir n’est pas que certaines langues officiellement reconnues devraient perdre leur statut, ni que chaque variété régionale du chinois doit recevoir une appellation particulière.
C’est que la diversité linguistique ne correspond pas toujours aux catégories de langues que nous utilisons dans la vie quotidienne.
Le chinois en est un exemple particulièrement frappant. Derrière un nom familier unique se cache une extraordinaire diversité de langues apparentées, dont beaucoup diffèrent les unes des autres aussi fortement que des langues reconnues séparément ailleurs dans le monde.
Comprendre cette diversité nous donne une vision plus précise du chinois et nous permet de mieux apprécier la complexité du langage humain.
Références et lectures complémentaires
- Encyclopaedia Britannica : les langues chinoises. Présentation de la diversité linguistique du chinois, de l’intercompréhension et des principaux groupes de langues sinitiques.
- Jin Liu : examen historique du discours sur le fangyan dans la Chine moderne. Recherche sur les langues régionales chinoises, la terminologie et le développement historique de l’identité linguistique.
- Michele Mannoni : dialectes chinois/dialectes du chinois. Discussion universitaire sur la terminologie et la distinction entre dialectes et langues en linguistique chinoise.
- Le pluricentrisme en classe : la langue serbo-croate. Recherche explorant les relations, l’intercompréhension et la standardisation du bosnien, du croate, du monténégrin et du serbe.
- Ljubica Djordjević : le statut juridique des langues issues du serbo-croate. Analyse des normes linguistiques officielles qui se sont développées après la dissolution de la Yougoslavie.