gibt es Informationen über die Abdeckung von nicht per eigener DOI erfassten Buchkapiteln (z.B. in Sammelbänden) in Lobid oder auch über andere Web APIs? Diese Kapitel sind in den Geisteswissenschaften oftmals genauso wichtig wie Zeitschriftenbeiträge und sind, wie Ihr wisst, ja sehr schlecht bibliographisch erfasst. Anekdotisch habe ich in den letzten Jahren immer wieder gesehen, dass Bibliotheks- und andere bibliographische Datenbanken auch Buchkapitel erfassen, aber es wäre interessant zu wissen, ob das lediglich die per CrossRef erfassten sind oder ob manche Kataloge systematisch Buchkapitel einpflegen.
Als Teil von Universitätsbibliographien oder Forschungsinformationssystemen dürften natürlich sehr viele Buchkapitel von der eigenen Einrichtung erfasst sein und dann etwa über BASE oder OpenAIRE gesamtheitich ausgewertet werden können. Zudem erfasst der Index Theologicus m.W. viele sehr unterschiedliche Publiaktionsformen und daher bestimmt auch Buchkapitel und vom Fach her würde ich da auch welche ohne DOI erwarten.
Danke für den Hinweis auf Wissensgraphen, die auch geisteswissenschaftliche Themen besser abdecken. Auswertungen dazu kennst du auch vermutlich nicht, oder? Das scheint mir eine große Leerstelle zu sein - viele Beiträge in Sammelbänden, gerade ältere, sind bibliographisch nicht separat erfasst und damit für viele Recherchezwecke praktisch unsichtbar. Eigentlich sitzt zotero.org auf einem unglaublichen Schatz solcher Metadaten, aber sie machen damit nichts, natürlich auch weil sie nicht die Zustimmung der Benutzer haben…
Nein, ich kenne keine Auswertungen dazu. Persönlich würde eher ein Potential bei Bibliotheken sehen hier Arbeit zu investieren, was punktuell auch passiert z.B. Hochschulbibliographie, aber keine Vollständigkeit etwa bei einen eigenen Artikelindex für Discovery-Systeme im Auge hat.
Bin mir nicht sicher, ob genau das gesucht wird, wollte es der Vollstândigkeit halber erwähnt wissen: Die Verlage, die die Thoth-Plattform nutzen, implementieren damit ja auch das im o.g. Report angefûhrte Metadata Framework - mit dem Vorteil, dass direkt auch Kapiteldaten bereitgestellt werden können.
Über unsere offene GraphQL-API können diese dann auch explizit abgefragt werden - mehr zur API über Thoth GraphQL API Documentation
„Downstream“ werden Kapitel-Daten bisher aber - außer direkt bei Crossref - meines Wissens noch von ziemlich wenigen Aggregatoren abgefragt …
Von der DNB und den Verbünden werden Inhaltsverzeichnisse gescannt über denen OCR liegt und damit der Katalog angereichert. Im K10plus-Index sind diese Verzeichnisse mit durchsuchbar. Bedeutet das nicht ein Teil der Aufsätze aus Sammelwerken ist da? Nur eben in Form von automatisch erkanntem Text in PDF-Dokumenten und nicht als einzelne Datensätze. Keine Ahnung ob es vorstellbar ist das auf eine Art umzuwandeln, die sinnvolle Ergebnisse erzielt. Namen von Verfassenden, Titel und zumindest noch die Seitenzahl auf der der Aufsatz anfängt stehen da meistens und könnten ausgelesen werden. Es müsste natürlich auch noch angereichert werden und Dubletten kontrolliert und vielleicht lassen sich auch Namen von Verfassenden normalisieren.
Vielleicht ist das ein Weg um mehr Artikel als eigene verknüpfte Datensätze in den Katalog zu bekommen. Aber wahrscheinlich eher nicht, sonst hätte das bestimmt schon wer gemacht.
Danke für die Rückmeldung. Lustigerweise arbeite ich im Moment genau mit dem von Dir genannten Material. Ich ziehe mir ein Sample der Inhaltsverzeichnis-PDFs und lasse zwei Vision-LLMs darüber laufen, um strukturierte Daten zu extrahieren: chapter-segmentation/evaluation/corpus/dnb-toc-only/README.md at main · cboulanger/chapter-segmentation · GitHub Falls es Interesse gibt, kann ich gerne die Ergebnisse vermelden. Ich will versuchen, ein kleines LLM zu finetunen, damit man die Kapitelmetadaten leicht aus den DNB-Daten oder auch ganzen PDFs extrahieren kann.
Im hbz-Verbund wurden und werden auch jede Menge Inhaltsverzeichnisse digitalisiert. Die URLs stehen in den lobid-resources-Daten im Feld tableOfContents.id. Das Feld ist nicht indexiert, so dass du dir nicht einfach alle Titel mit Inhaltsverzeichnissen über die API holen kannst, sondern mit dem Vollabzug arbeiten musst. Wöchentliche Vollabzüge (jeweils erstellt am Wochenende) findest du unter Index of /download/dumps/lobid-resources (latestLobidResources.jsonl.gz).
Mit der Hilfe von Claude Code habe ich aus den DNB-TOC-PDFs einen Datensatz von >600 validierten JSON-Auszügen hergestellt und damit das NuExtract3-Datenextraktionsmodell gefinetuned. Damit lässt sich schon einiges anfangen, denn NuExtract3 läuft etwa auf einem MacBook Pro mit 32GB auch lokal ohne dass man ein HPC braucht. Vielleicht ist das Experiment ja interessant für die Kataloganreicherung!