Zurück zu den Neuigkeiten
InnovationAI Understanding Briefing

Abrufen von Code in natürlicher Sprache für 1C:Enterprise: Ein offener Benchmark und effizienter Bi-Encoder

Das Abrufen von Codes in natürlicher Sprache ist eine sich schnell entwickelnde Aufgabe in der Informatik. Allerdings kombiniert das 1C:Enterprise-Ökosystem russische Syntax mit hochgradig domänenspezifischer Terminologie, für die es bisher praktisch keine offenen Datensätze und spezialisierten Modelle gab.

5 min readRead the primary source
Source-page capture accompanying Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder
PrimärquellendokumentQuelle aufgezeichnet
Herausgeber
arxiv.org
Quelllink
arxiv.orghttps://arxiv.org/abs/2608.19957
Quelltyp
Primärdokument – ​​eine offizielle Ankündigung, ein Papier, eine Akte oder eine Erstanbieterseite, die wir direkt lesen.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

Bi-Encoder
Ein Modell, das Abfragen und Dokumente in separate Vektoren kodiert, damit sie im großen Maßstab schnell verglichen werden können.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Abruf
Suchen relevanter Dokumente oder Datensätze aus einer Wissensquelle für eine Abfrage.
Testen Sie sich selbstWas ist KI? Quiz

Was ist passiert?

Die Autoren präsentieren eine umfassende Pipeline für den 1C-Code-Abruf: einen offenen von 3.413 realen, PII-bereinigten Abfrage-Code-Paaren, ein reproduzierbares Evaluierungsgeschirr und einen speziellen . Um den Mangel an gekennzeichneten Daten zu überwinden, optimieren sie mithilfe von Matryoshka Representation Learning (MRL) und einem datenschutzbewussten Tokenizer 784.057 synthetische Tripletts, die von google/gemma-4-26B-A4B-it aus öffentlichen Code-Repositories generiert wurden.

Die Autoren präsentieren eine umfassende Pipeline für den 1C-Code-Abruf, bestehend aus einem offenen , einem reproduzierbaren Evaluierungs-Harness und einem speziellen .

Der offene besteht aus 3.413 realen, PII-gereinigten Abfrage-Code-Paaren, die zur Bewertung der Leistung der vorgeschlagenen Pipeline verwendet werden.

Das reproduzierbare Bewertungssystem stellt sicher, dass der Bewertungsprozess konsistent ist und von anderen reproduziert werden kann.

Der spezialisierte ist darauf ausgelegt, Codeschnipsel effizient aus dem 1C:Enterprise-Ökosystem abzurufen, das russische Syntax mit hochdomänenspezifischer Terminologie kombiniert.

Um den Mangel an gekennzeichneten Daten zu überwinden, optimieren die Autoren 784.057 synthetische Tripletts, die von google/gemma-4-26B-A4B-it aus öffentlichen Code-Repositories generiert wurden, mithilfe von Matryoshka Representation Learning (MRL) und einem datenschutzbewussten Tokenizer.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Durch den Einsatz des offenen Benchmarks und des reproduzierbaren Bewertungssystems wird sichergestellt, dass der Bewertungsprozess konsistent ist und von anderen reproduziert werden kann.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Quellenangaben: arxiv.org ↗

Warum es wichtig ist

Die vorgeschlagene Pipeline behebt den Mangel an offenen Datensätzen und spezialisierten Modellen für den 1C-Code-Abruf und ermöglicht die Entwicklung genauerer und effizienterer Abrufsysteme. Der Einsatz von MRL und einem datenschutzbewussten Tokenizer gewährleistet zudem den Schutz sensibler Informationen.

Die vorgeschlagene Pipeline behebt den Mangel an offenen Datensätzen und spezialisierten Modellen für den 1C-Code-Abruf und ermöglicht die Entwicklung genauerer und effizienterer Abrufsysteme.

Die Verwendung von MRL und einem datenschutzbewussten Tokenizer gewährleistet den Schutz sensibler Informationen und macht die vorgeschlagene Pipeline zuverlässiger und vertrauenswürdiger.

Die vorgeschlagene Pipeline hat das Potenzial, die Entwicklung von 1C-Code--Systemen zu verbessern, die für verschiedene Anwendungen wie Softwareentwicklung und -wartung unerlässlich sind.

Durch die Verwendung synthetischer Tripletts, die aus öffentlichen Code-Repositorys generiert werden, verringert sich der Bedarf an gekennzeichneten Daten, wodurch die vorgeschlagene Pipeline effizienter und kostengünstiger wird.

Die vorgeschlagene Pipeline kann als Ausgangspunkt für die weitere Forschung und Entwicklung fortschrittlicherer 1C-Code--Systeme verwendet werden.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Durch den Einsatz des offenen Benchmarks und des reproduzierbaren Bewertungssystems wird sichergestellt, dass der Bewertungsprozess konsistent ist und von anderen reproduziert werden kann.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
Interaktiver Konzeptcheck+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Was Sie als nächstes sehen sollten

Der Ansatz der Autoren zur Feinabstimmung synthetischer Tripletts, die aus öffentlichen Code-Repositorys generiert werden, sowie die Verwendung von MRL und einem datenschutzbewussten Tokenizer sind wichtige Aspekte, die in dieser Forschung beobachtet werden sollten.

Der Ansatz der Autoren zur Feinabstimmung synthetischer Tripletts, die aus öffentlichen Code-Repositories generiert werden, ist ein wichtiger Aspekt, den es bei dieser Forschung zu beachten gilt.

Die Verwendung von MRL und einem datenschutzbewussten Tokenizer ist ein weiterer wichtiger Aspekt, den es zu beachten gilt, da dadurch der Schutz sensibler Informationen gewährleistet wird.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeschnipsel effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ebenfalls sehenswert, da sie das Potenzial hat, die Entwicklung von 1C-Codeabrufsystemen zu verbessern.

Durch den Einsatz des offenen Benchmarks und des reproduzierbaren Bewertungssystems wird sichergestellt, dass der Bewertungsprozess konsistent ist und von anderen reproduziert werden kann.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Verwendung von synthetischen Tripletts, die aus öffentlichen Code-Repositorys generiert wurden, durch die Autoren verringert den Bedarf an gekennzeichneten Daten und macht die vorgeschlagene Pipeline effizienter und kostengünstiger.

Die vorgeschlagene Pipeline kann als Ausgangspunkt für die weitere Forschung und Entwicklung fortschrittlicherer 1C-Code--Systeme verwendet werden.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Die Fähigkeit der vorgeschlagenen Pipeline, Codeausschnitte effizient aus dem 1C:Enterprise-Ökosystem abzurufen, ist ein bedeutender Fortschritt auf dem Gebiet des Abrufs von Code in natürlicher Sprache.

Das Potenzial der vorgeschlagenen Pipeline zur Verbesserung der Entwicklung von 1C-Code--Systemen macht sie zu einem wichtigen Forschungs- und Entwicklungsbereich.

Verwandte Leitfäden und Quizze

Was ist KI?ChatGPT & LLMsKI-EthikKI-AgentenKI-Modelle erklärtTransformatorenZukunft der KIKI-TrainingPrompt EngineeringTesten Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?