Ask Lutecium, Synthèse Documentaire — Conception Technique

Ask Lutecium, Synthèse Documentaire — Conception Technique

Cette page décrit l'architecture technique du composant de synthèse documentaire d'Ask Lutecium. Il est destiné aux concepteurs de logiciels, chercheurs et lecteurs intéressés par les techniques employées.

Ask Lutecium sépare délibérément la récupération sémantique du traitement du modèle de langage. Le modèle de langage n'est pas autorisé à répondre librement à partir de ses connaissances générales. Son rôle se limite à analyser le matériel extrait de Lutecium et à sélectionner des propositions documentaires pouvant être vérifiées par rapport à ces sources.

1. Architecture générale

Question de l'utilisateur
     |
     v
Semantic retrieval
     |
     v
Relevant Mathèmes passages
     |
     v
Answerability analysis
     |
     v
Relevance classification
     |
     v
Documentary proposition extraction
     |
     v
Mechanical exact-quotation verification
     |
     v
Selection and ordering
     |
     v
Deterministic citation rendering
     |
     v
Displayed documentary synthesis

La recherche sémantique et la synthèse documentaire sont des opérations distinctes. La recherche sémantique peut effectuer une recherche sur le site Lutecium, les Mathèmes de Lacan et les archives miroirs. À l'heure actuelle, la synthèse documentaire se limite au seul corpus Mathèmes de Lacan ..

2. Extraction sémantique

La question formulée par l'utilisateur est d'abord transformée en sa représentation sémantique à l'aide d'un modèle d'intégration multilingue. Des passages similaires sont extraits des collections Lutecium indexées à l'aide d'une recherche de similarité vectorielle construite dans un espace vectoriel de 384 dimensions.

Ce n'est pas dans cette étape que la réponse à la question est formulée. À cette étape là sont identifiés uniquement les passages sémantiquement proches de la requête.

Cette distinction est importante: la similarité sémantique n'est pas considérée comme une preuve qu'un passage ou un segment répond effectivement à la question.

3. Traitement du modèle de langage

Lorsque le serveur de synthèse GPU principal est disponible, les Mathèmes récupérés sont soumis à plusieurs étapes d'un modèle de langage contraint.

Capacité de réponse

La première étape consiste à déterminer si le matériel documentaire récupéré permet effectivement de répondre. Une relation thématique seule ne suffit pas.

Classification par pertinence

Chaque passage récupéré est classé individuellement. Les passages simplement associés au sujet général, mais ne contribuant pas directement à répondre à la question, sont exclus de la synthèse.

Extraction de propositions documentaires

Le modèle identifie les propositions explicitement valides dans les passages retenus et associe chaque proposition à une citation exacte et un identifiant de source..

Vérification mécanique

La vérification décisive est effectuée par du code informatique ordinaire, pas par le modèle de langage utilisé.

Pour chaque passage proposé, le programme vérifie que la séquence des mots exacte est bien présente dans le passage source identifié par le modèle. Une citation introuvable littéralement est rejetée.

Mise en ordre

Après vérification, le modèle de langage peut sélectionner, regrouper et commander les propositions documentaires validées. Il n'est pas permis d'inventer des transitions théoriques supplémentaires ou des phrases explicatives entre elles.

Rendu déterministe

Les références des sources et sa présentation finale sont générés par programme. Le modèle ne fabrique pas de citations.

4. Sept règles anti-hallucinations

Une absence de règles ou des règles faibles conduisent ces systèmes à produire et forger des hallucinations. Pour éviter que cela ne se produise, une série de sept règles sont appliquées, et en étant obligatoires elles minimisent le risque d'hallucinations.

  1. Règle de source uniquement. Le modèle de langage ne peut utiliser que les passages fournis par le système de récupération Lutecium. Les connaissances générales contenues dans le modèle ne sont pas acceptées comme preuve documentaire.
  2. Règle de capacité de réponse. La proximité sémantique ne suffit pas. Le matériel récupéré doit contenir des propositions explicites capables de répondre à la question. Si ce n'est pas le cas, le système doit signaler que le matériel documentaire est insuffisant.
  3. Règle de pertinence directe. Toute source retenue pour la synthèse doit porter directement sur la question. Les passages qui sont simplement thématiquement liés doivent être écartés.
  4. Règle de référencement exact. Chaque proposition documentaire doit être associée à une citation exacte provenant d'une source identifiée.
  5. Règle de vérification mécanique. L'existence de chaque citation utilisée est vérifiée mécaniquement par rapport au texte source récupéré. La vérification est donc indépendante de l'assertion du modèle linguistique dans laquelle la citation existe.
  6. Règle du document immuable. Une fois un support exact vérifié, le contenu documentaire présenté au lecteur est limité par ce matériel source vérifié. La paraphrase générée par le modèle n'est pas autorisée à remplacer la proposition documentaire par une formulation non étayée..
  7. Règle de non-liaison générative. Le modèle peut sélectionner, des propositions documentaires validées par groupe et classification, mais cela ne peut pas créer de relations causales, déductions théoriques, transitions explicatives ou citations absentes du matériel source.

Ces règles contraignent considérablement le comportement génératif habituel d'un modèle de langage. Ils sont spécifiquement conçus pour empêcher les déclarations non étayées d'entrer dans la synthèse documentaire.. Ils ne devraient pas, cependant, être interprété comme une garantie théorique que tout système de modèle de langage est incapable d'erreur.

5. Communication structurée avec le LLM

Les étapes de synthèse communiquent avec le modèle de langage en utilisant des structures JSON contraintes plutôt que de la prose en forme libre.

Le service valide JSON avant de l'utiliser. Si une réponse LLM est tronquée ou contient du JSON mal formé, l'étape peut être réessayée une fois avec une gamme de données plus grande. Si une sortie structurée valide ne peut toujours pas être obtenue, le pipeline de synthèse complet est considéré comme ayant échoué.

6. Synthèse GPU primaire

Le parcours de synthèse normal utilise un serveur d'inférence GPU dédié connecté au réseau privé Lutecium.

Le serveur principal actuel fonctionne sur une machine dotée d'un GPU rapide qui nous est gracieusement prêté., il exécute un modèle Qwen de 27 milliards de paramètres via llama.cpp. Le service de synthèse lui-même s'exécute sur une machine Lutecium et envoie des requêtes d'inférence au GPU principal tout en conservant la récupération, la vérification et le rendu sous contrôle de Lutecium.

7. Mode CPU dégradé

Si le serveur GPU principal n'est pas disponible, Ask Lutecium ne suspend pas la recherche sémantique.

Les résultats sémantiques sont renvoyés immédiatement, tandis qu'une synthèse dégradée asynchrone peut être démarrée sur la machine Lutecium en utilisant un modèle de langage plus petit basé sur son processeur.

Le mode dégradé consolide l'analyse en une seule passe de modèle de langage contraint, suivi d'une vérification mécanique des citations et d'un rendu déterministe.

Ce mode est plus lent, nécessitant normalement environ une à quatre minutes selon la question, les passages récupérés et la réutilisation du prompt-cache.

Les requêtes dégradées identiques en attente sont dédupliquées afin que les rechargements répétés de pages ne génèrent pas plusieurs tâches CPU coûteuses.. La file d'attente dégradée est également limitée.

8. Gestion des pannes

  • GPU principal disponible et synthèse complète réussie: la synthèse documentaire normale s'affiche.
  • GPU principal indisponible: la recherche sémantique s'affiche immédiatement et la synthèse dégradée asynchrone est lancée.
  • GPU principal disponible mais une synthèse complète particulière échoue: la requête est transférée vers une synthèse dégradée asynchrone plutôt que de présenter une erreur sans issue à l'utilisateur.

9. Séparation entre récupération et génération

Le système de recherche sémantique détermine quels documents peuvent être pertinents. Le modèle de langage effectue ensuite une analyse documentaire contrainte. Enfin, un logiciel déterministe ordinaire vérifie les citations et construit des citations.

Le modèle linguistique n’agit donc pas comme une source autonome de connaissances. Il agit comme un composant analytique contrôlé entre la récupération et la vérification déterministe.

10. Portée et limites actuelles

La synthèse documentaire s'opère actuellement sur le corpus Mathèmes de Lacan. La recherche sémantique elle-même couvre une collection plus large comprenant le site Web Lutecium et les archives miroirs.

La synthèse affichée doit par conséquent être comprise comme une vue documentaire structurée des Mathèmes récupérés., non comme une interprétation théorique exhaustive de Lacan et non comme un substitut à la consultation des textes originaux.