• Startseite
  • Produkte
  • Jetzt
  • Buchnotizen
  • Lebenslauf
  • Unternehmensberatung
  • Spiele
  • Click to open the search input field Click to open the search input field Suche
  • Menü Menü
Denis Reis
  • Link zu X
  • Link zu Facebook
  • Link zu Xing
  • Link zu LinkedIn
  • Link zu Rss dieser Seite
  • Link zu Mail
How-To Tutorials SAP BI BA

SAP HANA Vector Embeddings leicht gemacht

SAP HANA Vector Engine Embeddings sind einfach

Vector Datenbanken sind essenziell für RAG (Retrieval Augmented Generation) Prozesse in AI Tools. Neben SAP Document Grounding können Sie auch native SAP HANA Cloud Vector Engine nutzen. Dieser Ansatz erlaubt Ihnen mehr Flexibilität. In diesem Beitrag führe ich Sie Schritt für Schritt durch die Extraktion von PDF Inhalten, Verbindung zu der Datenbank, Embeddings und Retrieval.

So erleichtern Sie die Entscheidungsfindung und gewinnen einen umfassenden Überblick über Ihr Geschäft! Mit meinem Buch lernen Sie, SAP BPC für die Unternehmensplanung einzurichten, zu nutzen und zu erweitern.

Setup

Zuerst installieren wir die benötigten Module. In diesem Beispiel verwende ich einfachheitshalber Langchain, Langchain HANA und OpenAI. Für die Kommunikation mit der HANA Cloud Datenbank wird SAP HANA Python Client hdbcli verwendet. Für die Arbeit mit PDF Dateien nutze ich pypdf. Für die Verwaltung von Umgebungsvariablen nutze ich python-dotenv.

pip install hdbcli
pip install pypdf
pip install langchain
pip install langchain-hana
pip install python-dotenv

Im nächsten Schritt werden diese importiert

import os
from dotenv import load_dotenv
from hdbcli import dbapi
from pypdf import PdfReader
from langchain_text_splitters import RecursiveCharacterTextSplitter
from langchain_hana import HanaDB
from langchain_core.documents import Document
from langchain_openai import OpenAIEmbeddings
from datetime import datetime

Die API Schlüssel und die Konstanten für den Datenbankzugriff werden in der .env Datei im folgenden Format abgelegt. Dabei werden keine Leerzeichen oder Klammern genutzt. Im Beitrag Wie Sie einen SAP Datasphere Datenbankbenutzer anlegen habe ich detailliert die Einrichtung eines Bentuzers für die HANA Cloud Datenbank von Datasphere beschrieben. Sie können auch eine dedizierte HANA Cloud Datenbank auf BTP nutzen, um die Last auf Datasphere zu verringern.

OPENAI_API_KEY=your_api_key
dbUser=space#user
dbPassword=your_db_user_password
dbHost=your_host
dbPort=your_port_eg_444
dbTable=name_of_the_table

Diese Informationen werden nun in die Umgebungsvariablen geladen, um später auf diese zugreifen zu können.

load_dotenv(override=True)

Dokumente laden und aufteilen

Nun laden wir die Dokumente, die wir in der Vector Engine ablegen wollen.

file_path = "C:/temp/Apple_10k_2025.pdf"
pdf =PdfReader(file_path)

Anschließend extrahieren wir den Text aus der PDF Datei.

text = ""

for page in pdf.pages:
    text += page.extract_text()

Dieser wird in mehrere Teile gesplittet.

text_splitter = RecursiveCharacterTextSplitter()

chunks = text_splitter.split_text(text)
len(chunks)
print(chunks[0])

Metadaten vorbereiten

Neben den Inhalten selbst sind auch Metadaten für das Housekeeping entscheidend. Daher extrahieren wir Metadaten aus dem Dokument.

# Get the current date in YYYYMMDD format
currentdate = datetime.now().strftime('%Y%m%d')

# Extract file name
pdf_file = file_path.split('/')[-1]

# Extract company name. Assuming it comes before the first underscore
# Extract characters before the first underscore in file name
pdf_company = pdf_file.split('_')[0]

# Extract pdf metadata
pdf_author = pdf.metadata.author
pdf_creation_year = pdf.metadata.creation_date.year
pdf_creation_month = pdf.metadata.creation_date.month
pdf_creation_day = pdf.metadata.creation_date.day
pdf_creator = pdf.metadata.creator
pdf_title = pdf.metadata.title

# Central embedding (vs user embedding), therefore good quality
quality = "good"
print(pdf_file)
print(pdf_company)

Die Metadaten werden für den jeweiligen Teil des Dokumentes erstellt.

##Provide metadata for each chunk
metadatas = [{'embedd_time': currentdate, 
                'file': pdf_file, 
                'company': pdf_company, 
                'author': pdf_author, 
                'creation_year': pdf_creation_year,
                'creation_month': pdf_creation_month,
                'creation_day': pdf_creation_day,
                'creator': pdf_creator,
                'title': pdf_title,
                'quality': quality} 
                for chunk in chunks]

Embedding Modell erstellen

Nun instanzieren wir das Modell, welches wir für Embeddings nutzen wollen. In meinem Beispiel verwende ich das OpenAI Modell.

#text-embedding-3-small can have up to 1536 dimensions
#text-embedding-3-large can have up to 3072 dimensions
embeddings = OpenAIEmbeddings(model="text-embedding-3-large")

SAP HANA Cloud Datenbank

Um die Embeddings zu speichern, nutzen wir die Vector Engine der SAP HANA Cloud Datenbank. Zunächst stellen wir eine Verbindung zur Datenbank her. Achten Sie darauf, dass Ihre IP in der Whitelist der Datenbank gepflegt ist.

connection = dbapi.connect(
    address=os.getenv('dbHost'),
    port=os.getenv('dbPort'),
    user=os.getenv('dbUser'),
    password=os.getenv('dbPassword'),
    encrypt=True,
    sslValidateCertificate=False
    )

print(f"Connected to Datasphere:: {connection.isconnected()}")

Nun geben wir die Tabelle an, die für den Zugriff auf die Vektoreinbettungen verwendet werden soll. Die angegebene Tabelle wird automatisch erstellt, falls sie nicht existiert. Falls die angegebene Tabelle bereits existiert, wird sie verwendet. In unserem Beispiel haben wir den Namen der Tabelle in der Umgebungsvariable abgelegt.

db = HanaDB(embedding=embeddings, connection=connection, table_name=os.getenv('dbTable'))

Im SAP HANA Database Explorer sehen Sie nun die neu angelegte Tabelle.

Tabelle wurde angelegt

Die Tabelle ist zunächst leer. Mit dem folgenden Befehl fügen wir die Dokumentteile samt Metadaten hinzu.

#Add the loaded document chunks
db.add_texts(chunks, metadatas)

Jetzt können Sie die jeweiligen Dokumentschnipsel samt Metadaten und dem entsprechenden Vector in der Tabelle sehen.

Tabelleninhalt

Ein Vektorindex kann Top-k-Nearest-Neighbor-Abfragen für Vektoren erheblich beschleunigen. Mit der Funktion create_hnsw_index können Sie einen Hierarchical Navigable Small World (HNSW) Vektorindex erstellen.

db.create_hnsw_index()

Das Ergebnis ist im Reiter Indexes einsehbar.

Index angelegt

Inhalte abfragen

Nun kann die Datenbank in Ihrer RAG Pipeline genutzt werden. Anbei ein Beispiel für die Ähnlichkeitssuche, wobei die 5 besten Ergebnisse verwenden werden.

query = "Which new products were announced by Apple in 2025? Display the results per quarter."
docs = db.similarity_search(query, k=5)

Mit dem folgenden Befehl können die Ergebnisse ausgegeben werden:

#Output
for doc in docs:
        print("-" * 80)
        print(doc.page_content)
        print("-" * 80)

Sie können auch bestimmte Metadaten bei der Suche verwenden. Einen Überblick über mögliche Filter finden Sie in der Langchain SAP HANA Cloud Vector Engine Dokumentation.

query = "Which new products were announced in first quarter of 2025?"
docs = db.similarity_search(query, k=2, filter={"quality": "good"})

Langchain Dokumente für Embeddings nutzen

Neben dem demonstrierten Beispiel für PDF Dateien. Können Sie auch Langchain Document Objekte für Embeddings nutzen. Diese speichern den Inhalten und die zugehörigen Metadaten. Zum Beispiel:

docs = [
Document(
page_content="Product, Service and Software Announcements. Reis Corp announces new product, service and software offerings at various times during the year. Significant announcements during fiscal year 2025 included the following: First Quarter 2025: • myLaptop Noob 16-in.; Second Quarter 2025: • myLaptop Water 13-innch and• Reis Intelligence™, a artificial intelligence system that leverages SAP HANA Cloud Vector Engine. As well as myPhone 110, myPhone 110 Plus and myPhone 110 Noob.",
metadata={"doc_name": "Reis_10k.txt", "quality": "good"},
),
Document(
page_content="foo",
metadata={"doc_name": "foo.txt", "quality": "good"},
),
Document(
page_content="foo",
metadata={"doc_name": "bar.txt", "quality": "bad"},
),
]      
db.add_documents(docs)

Inhalte löschen

Wie bereits erwähnt, helfen die Metadaten beim Housekeeping. So können Sie diese zum selektiven Löschen nutzen.

db.delete(filter={"quality": "bad"})

Alternativ können Sie einfach alle Embeddings löschen:

## Delete already existing documents from the table
db.delete(filter={})

Verbindung zur Datenbank trennen

Denken Sie bitte daran, Ihre Verbindung zur Datenbank anschließend zu trennen.

## Close connection to Datasphere
connection.close()
print(f"\nConnected to Datasphere:: {connection.isconnected()}")

Ihre User beklagen sich über langsame Berichte?

  • In meinem Newsletter lernen Sie, wie Sie Abhilfe schaffen.
  • Entdecken Sie die Möglichkeiten der Performanceoptimierung.
  • Praktische Anleitungen ermöglichen Ihnen schnelle Erfolge bei der Optimierung von SAP Systemen.
  • Viele Tipps und Tricks zu SAP BI Themen.
  • Holen Sie die maximale Performance aus Ihrem SAP BI!
  • Bei der Anmeldung zu meinem Newsletter erhalten Sie das Buch „High Performance SAP BI“ als Willkommensgeschenk.
Fordere SAP Performance Tricks an

Jetzt anfordern!

* Pflichtfeld
 
Kein SPAM. Ich hasse Spam genau so wie du.

8. Dezember 2025/0 Kommentare/von Denis
Eintrag teilen
  • Teilen auf Facebook
  • Teilen auf X
  • Teilen auf WhatsApp
  • Teilen auf Pinterest
  • Teilen auf LinkedIn
  • Teilen auf Tumblr
  • Teilen auf Vk
  • Teilen auf Reddit
  • Per E-Mail teilen
https://www.denisreis.com/wp-content/uploads/2025/12/sap-hana-cloud-vector-engine-e1765286668566.jpg 488 1024 Denis https://www.denisreis.com/wp-content/uploads/2016/09/logo.png Denis2025-12-08 07:25:002025-12-12 19:41:52SAP HANA Vector Embeddings leicht gemacht
Das könnte Dich auch interessieren
Wie Sie eigene Farben für ABAP Elemente bestimmen Wie Sie eigene Farben für ABAP Elemente bestimmen
Wie Sie Daten aus SAP Analytics Cloud nach SAP Datasphere laden Wie Sie Daten aus SAP Analytics Cloud nach SAP Datasphere laden
Hilfreiche Analysis for Office Tricks, die Ihr Leben leichter machen Hilfreiche Analysis for Office Tricks, die Ihr Leben leichter machen
How To - SAP Analysis Spalten über Checkbox verstecken SD Tabellen
Python Pandas und NumPy in SAP Datasphere Datenflüssen nutzen Python Pandas und NumPy in SAP Datasphere Datenflüssen nutzen
How To - SAP Analysis Spalten über Checkbox verstecken How To – SAP Analysis Spalten über Checkbox verstecken
0 Kommentare

Hinterlasse einen Kommentar

An der Diskussion beteiligen?
Hinterlasse uns deinen Kommentar!

Schreibe einen Kommentar Antwort abbrechen

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Diese Website verwendet Akismet, um Spam zu reduzieren. Erfahre, wie deine Kommentardaten verarbeitet werden.

Stay connected

  • RSS abonnieren
  • XING
  • LinkedIn
  • Twitter
  • Facebook
  • Newsletter

Ich lese gerade

12 Rules for Life: An Antidote to Chaos

SAP BI Buchempfehlung

SAP Analysis for Microsoft Office: Reporting leicht gemacht: BI-Werkzeug für MS Excel

Kategorien

  • Allgemein
  • BPC
  • Buchnotizen
  • CSS
  • Excel
  • How-To Tutorials SAP BI BA
  • Know-How SAP
  • Projektmanagement und Führung
  • VBA

Hörfutter

Hol dir ein kostenloses Hörbuch!

Anzeige

Beliebt
  • Bestimmte Zeilen in eine andere Tabelle kopieren
    Excel VBA – Bestimmte Zeilen in eine andere Tabelle...9. März 2014 - 22:14
  • Excel VBA - Wie Sie den Blattschutz ohne Kennwort aufheben
    Excel VBA – Wie Sie den Blattschutz ohne Kennwort...24. Oktober 2017 - 12:58
  • Excel VBA - Zeichen ersetzen mit Replace
    Excel VBA – Zeichen ersetzen mit Replace12. Oktober 2014 - 20:15
  • Wie sie das aktuelle Datum in einer Liste finden
    Excel VBA – Wie Sie das aktuelle Datum in einer Liste...30. Januar 2018 - 12:57
Kürzlich
  • Datasphere CLI einrichten
    Wie Sie Datasphere CLI einrichten20. Juni 2026 - 10:57
  • Linux Spickzettel
    Linux Spickzettel24. April 2026 - 20:38
  • SAP Datasphere als Remote Quelle für SAP HANA nutzen
    SAP Datasphere als Remote Quelle für SAP HANA nutzen23. März 2026 - 09:27
  • Markdown Syntax Spickzettel
    Markdown Spickzettel25. Februar 2026 - 22:14
Kommentare
  • PaulSuper Artikel, leider gibt es diesen FuBa bei BW/4HANA 2023...3. März 2026 - 13:34 von Paul
  • MichaelHallo, ich habe diesen Beitrag gefunden, gerade der Tipp...1. August 2023 - 14:52 von Michael
  • CarportDanke für die tolle Arbeit die hier geleistet wurde, hier...14. Februar 2023 - 12:15 von Carport
  • Tobias IsenbergHi, kann nur davon abraten/warnen, das Sprachpaket zu...19. Oktober 2022 - 14:31 von Tobias Isenberg

Werbung

Schlagwörter

ABAP AI Analysis Aufwandsschätzung BAdI berechtigungen BPC BTP Controlling CSS Datasphere Delegation Design Studio EPM EvDRE Excel HTML JavaScript Meeting PM Prozessketten Python SAC SAP Script Logic Scrum SQL SQLScript Tabellen Transformationsroutinen Tutorial VBA Workshop

Archiv

  • Juni 2026
  • April 2026
  • März 2026
  • Februar 2026
  • Januar 2026
  • Dezember 2025
  • November 2025
  • Oktober 2025
  • September 2025
  • August 2025
  • Juli 2025
  • Juni 2025
  • Mai 2025
  • April 2025
  • März 2025
  • Februar 2025
  • Januar 2025
  • Dezember 2024
  • November 2024
  • Oktober 2024
  • September 2024
  • August 2024
  • Juli 2024
  • Juni 2024
  • Mai 2024
  • April 2024
  • März 2024
  • Februar 2024
  • Januar 2024
  • Dezember 2023
  • November 2023
  • Oktober 2023
  • September 2023
  • August 2023
  • Juli 2023
  • Juni 2023
  • Mai 2023
  • April 2023
  • März 2023
  • Februar 2023
  • Januar 2023
  • Dezember 2022
  • November 2022
  • Oktober 2022
  • September 2022
  • August 2022
  • Juli 2022
  • Juni 2022
  • Mai 2022
  • April 2022
  • März 2022
  • Februar 2022
  • Januar 2022
  • Dezember 2021
  • November 2021
  • Oktober 2021
  • September 2021
  • August 2021
  • Juli 2021
  • Juni 2021
  • Mai 2021
  • April 2021
  • März 2021
  • Februar 2021
  • Januar 2021
  • Dezember 2020
  • November 2020
  • Oktober 2020
  • September 2020
  • August 2020
  • Juli 2020
  • Juni 2020
  • Mai 2020
  • April 2020
  • März 2020
  • Februar 2020
  • Januar 2020
  • Dezember 2019
  • November 2019
  • Oktober 2019
  • September 2019
  • August 2019
  • Juli 2019
  • Juni 2019
  • Mai 2019
  • April 2019
  • März 2019
  • Februar 2019
  • Januar 2019
  • Dezember 2018
  • November 2018
  • Oktober 2018
  • Juli 2018
  • Juni 2018
  • Mai 2018
  • April 2018
  • März 2018
  • Februar 2018
  • Januar 2018
  • Dezember 2017
  • November 2017
  • Oktober 2017
  • September 2017
  • August 2017
  • Juli 2017
  • Juni 2017
  • Mai 2017
  • April 2017
  • März 2017
  • Februar 2017
  • Januar 2017
  • Dezember 2016
  • November 2016
  • Oktober 2016
  • September 2016
  • August 2016
  • Juli 2016
  • Juni 2016
  • Mai 2016
  • April 2016
  • März 2016
  • Februar 2016
  • Januar 2016
  • Dezember 2015
  • November 2015
  • Oktober 2015
  • September 2015
  • August 2015
  • Juli 2015
  • Juni 2015
  • Mai 2015
  • April 2015
  • März 2015
  • Februar 2015
  • Januar 2015
  • Dezember 2014
  • November 2014
  • Oktober 2014
  • September 2014
  • August 2014
  • Juli 2014
  • Juni 2014
  • Mai 2014
  • April 2014
  • März 2014
  • Februar 2014
  • Januar 2014
  • Dezember 2013
  • November 2013
  • Oktober 2013
  • September 2013
  • August 2013
  • Juli 2013
  • Juni 2013
  • Mai 2013
  • April 2013
  • März 2013
  • Februar 2013
  • Januar 2013
  • Dezember 2012
  • November 2012
  • Oktober 2012
  • September 2012
  • August 2012
  • Juli 2012
  • Juni 2012
  • Mai 2012
  • April 2012
  • März 2012
  • Februar 2012
  • Januar 2012
© Copyright - Denis Reis - Lumen accipe et imperti - Impressum - Datenschutz
  • Link zu X
  • Link zu Facebook
  • Link zu Xing
  • Link zu LinkedIn
  • Link zu Rss dieser Seite
  • Link zu Mail
Link to: Wie Sie einen SAP Datasphere Datenbankbenutzer anlegen Link to: Wie Sie einen SAP Datasphere Datenbankbenutzer anlegen Wie Sie einen SAP Datasphere Datenbankbenutzer anlegenWie Sie einen SAP Datasphere Datenbankbenutzer anlegen Link to: Data Provisioning Agent für SAP Datasphere einrichten Link to: Data Provisioning Agent für SAP Datasphere einrichten Data Provisioning Agent für SAP Datasphere einrichtenData Provisioning Agent für SAP Datasphere einrichten
Nach oben scrollen Nach oben scrollen Nach oben scrollen

Diese Website benutzt Cookies. Wenn du die Website weiter nutzt, erteilst du eine Einverständniserklärung zur Erhebung personenbezogener Daten nach der DSGVO. Weitere Informationen zu Cookies und insbesondere dazu, wie Sie deren Verwendung widersprechen können, finden Sie in unseren Datenschutzhinweisen.

Akzeptieren


Wie wir Cookies verwenden

Wir können Cookies anfordern, die auf Ihrem Gerät eingestellt werden. Wir verwenden Cookies, um uns mitzuteilen, wenn Sie unsere Websites besuchen, wie Sie mit uns interagieren, Ihre Nutzererfahrung verbessern und Ihre Beziehung zu unserer Website anpassen.

Klicken Sie auf die verschiedenen Kategorienüberschriften, um mehr zu erfahren. Sie können auch einige Ihrer Einstellungen ändern. Beachten Sie, dass das Blockieren einiger Arten von Cookies Auswirkungen auf Ihre Erfahrung auf unseren Websites und auf die Dienste haben kann, die wir anbieten können.

Notwendige Website Cookies

Diese Cookies sind unbedingt erforderlich, um Ihnen die auf unserer Webseite verfügbaren Dienste und Funktionen zur Verfügung zu stellen.

Da diese Cookies für die auf unserer Webseite verfügbaren Dienste und Funktionen unbedingt erforderlich sind, hat die Ablehnung Auswirkungen auf die Funktionsweise unserer Webseite. Sie können Cookies jederzeit blockieren oder löschen, indem Sie Ihre Browsereinstellungen ändern und das Blockieren aller Cookies auf dieser Webseite erzwingen. Sie werden jedoch immer aufgefordert, Cookies zu akzeptieren / abzulehnen, wenn Sie unsere Website erneut besuchen.

Wir respektieren es voll und ganz, wenn Sie Cookies ablehnen möchten. Um zu vermeiden, dass Sie immer wieder nach Cookies gefragt werden, erlauben Sie uns bitte, einen Cookie für Ihre Einstellungen zu speichern. Sie können sich jederzeit abmelden oder andere Cookies zulassen, um unsere Dienste vollumfänglich nutzen zu können. Wenn Sie Cookies ablehnen, werden alle gesetzten Cookies auf unserer Domain entfernt.

Wir stellen Ihnen eine Liste der von Ihrem Computer auf unserer Domain gespeicherten Cookies zur Verfügung. Aus Sicherheitsgründen können wie Ihnen keine Cookies anzeigen, die von anderen Domains gespeichert werden. Diese können Sie in den Sicherheitseinstellungen Ihres Browsers einsehen.

Andere externe Dienste

Wir nutzen auch verschiedene externe Dienste wie Google Webfonts, Google Maps und externe Videoanbieter. Da diese Anbieter möglicherweise personenbezogene Daten von Ihnen speichern, können Sie diese hier deaktivieren. Bitte beachten Sie, dass eine Deaktivierung dieser Cookies die Funktionalität und das Aussehen unserer Webseite erheblich beeinträchtigen kann. Die Änderungen werden nach einem Neuladen der Seite wirksam.

Google Webfont Einstellungen:

Google Maps Einstellungen:

Google reCaptcha Einstellungen:

Vimeo und YouTube Einstellungen:

Datenschutzrichtlinie

Sie können unsere Cookies und Datenschutzeinstellungen im Detail in unseren Datenschutzrichtlinie nachlesen.

Datenschutz
Einstellungen akzeptieren