Logo Logo
FAQ
Contact
Switch language to German
Reinforcement learning for multi-period resource allocation tasks
Reinforcement learning for multi-period resource allocation tasks
Advances in optimization techniques are opening up new opportunities to tackle longstanding optimization problems. This progress is largely driven by recent developments in Machine Learning (ML), fueled by the increasing availability of data, improved computational capabilities, and increased research funding. A prominent example of such a longstanding optimization problem is the important class of resource allocation tasks. Resource allocation tasks involve the distribution of limited resources among multiple entities, often under constraints and across dynamic, multi-period settings. These challenges arise in a wide range of domains, including finance, logistics, and engineering, where decision-making must continuously adapt to evolving information and conditions. Reinforcement Learning (RL) -- a subfield of ML -- is particularly well-suited to these demands, as it excels at modeling sequential decision-making under uncertainty. In this thesis, we focus on applying RL methods to resource allocation tasks, with an emphasis on financial applications due to their practical relevance and research importance. Additionally, general resource allocation tasks are addressed, highlighting the broader applicability of the proposed approaches. A particular focus of this thesis is the integration of linear allocation constraints into the RL framework and the associated methodological challenges. To this end, three approaches are proposed for incorporating one, two, and an arbitrary number of linear constraints. These methods address key limitations of prior work, particularly regarding constraint satisfaction guarantees and empirical performance. The proposed approaches guarantee compliance with constraints while showing improved results in benchmark evaluations. Furthermore, this thesis presents a novel RL approach for deriving optimal investment strategies, which is a domain-specific resource allocation task, tailored to investors with varying levels of risk preference. The proposed approach generalizes across a continuous spectrum of risk preferences, significantly reducing training costs compared to other approaches. Empirical evaluations using real-world financial data demonstrate the strong performance of our approach across different investment scenarios, outperforming existing approaches., Fortschritte in Optimierungstechniken eröffnen neue Möglichkeiten zur Lösung bestehender Optimierungsprobleme. Dieser Fortschritt wird vor allem durch aktuelle Entwicklungen im Bereich des Machine Learning (ML) vorangetrieben, die auf einer verbesserten Datenlage, gesteigerten Rechenleistungen und einer erhöhten Bereitstellung von Forschungsmitteln beruhen. Ein prominentes Beispiel für ein bestehendes Optimierungsproblem ist die wichtige Klasse von Ressourcenallokationsaufgaben. Diese beinhalten die Verteilung begrenzter Ressourcen auf mehrere Entitäten -- häufig unter Berücksichtigung von Nebenbedingungen und in dynamischen, mehrperiodigen Entscheidungssituationen. Solche Aufgaben treten in einer Vielzahl von Anwendungsbereichen auf, etwa in der Finanzwirtschaft, der Logistik oder im Ingenieurwesen, wo Entscheidungsprozesse kontinuierlich an neue Informationen und sich verändernde Bedingungen angepasst werden müssen. Reinforcement Learning (RL) -- ein Teilbereich des Machine Learning -- eignet sich besonders gut für diese Anforderungen, da es auf die Modellierung sequentieller Entscheidungen unter Unsicherheit spezialisiert ist. Im Rahmen dieser Dissertation werden RL-Methoden zur Lösung von Ressourcenallokationsaufgaben untersucht, mit einem besonderen Fokus auf finanzwirtschaftliche Anwendungen aufgrund ihrer großen praktischen Relevanz und wissenschaftlichen Bedeutung. Darüber hinaus werden auch allgemeine Allokationsprobleme betrachtet, um die breite Anwendbarkeit der vorgeschlagenen Ansätze zu unterstreichen. Ein besonderer Schwerpunkt dieser Arbeit liegt auf der Integration linearer Allokationsnebenbedingungen in das RL-Framework sowie auf den damit verbundenen methodischen Herausforderungen. In diesem Zusammenhang werden drei Ansätze zur Integration von einer, zwei sowie einer beliebigen Anzahl linearer Nebenbedingungen vorgestellt. Diese Ansätze adressieren zentrale Schwächen bestehender Methoden, insbesondere im Hinblick auf die Einhaltung von Nebenbedingungen und der empirischen Leistungsergebnisse. Die vorgestellten Ansätze garantieren nicht nur die Einhaltung sämtlicher Nebenbedingungen, sondern übertreffen bestehende Verfahren auch deutlich in umfangreichen Benchmark-Evaluierungen. Darüber hinaus wird in dieser Arbeit eine neuartige RL-Methode zur Ableitung optimaler Portfolio-Investitionsstrategien vorgestellt, eine domänenspezifische Ressourcenallokationsaufgabe, die auf Investoren mit unterschiedlichen Risikopräferenzen zugeschnitten ist. Die vorgeschlagene Methode erlaubt eine Generalisierung über ein kontinuierliches Spektrum an Risikopräferenzen hinweg und reduziert dabei die Trainingskosten im Vergleich zu bestehenden Verfahren erheblich. Empirische Auswertungen mit realen Finanzmarktdaten belegen die starken Ergebnisse des vorgestellten Ansatzes in verschiedenen Investitionsszenarien gegenüber bestehenden Methoden.
Reinforcement Learning, Portfolio Optimization, Finance, Constrained Optimization
Winkel, David
2025
English
Universitätsbibliothek der Ludwig-Maximilians-Universität München
Winkel, David (2025): Reinforcement learning for multi-period resource allocation tasks. Dissertation, LMU München: Faculty of Mathematics, Computer Science and Statistics
[thumbnail of Winkel_David.pdf]
Preview
PDF
Winkel_David.pdf

6MB

Abstract

Advances in optimization techniques are opening up new opportunities to tackle longstanding optimization problems. This progress is largely driven by recent developments in Machine Learning (ML), fueled by the increasing availability of data, improved computational capabilities, and increased research funding. A prominent example of such a longstanding optimization problem is the important class of resource allocation tasks. Resource allocation tasks involve the distribution of limited resources among multiple entities, often under constraints and across dynamic, multi-period settings. These challenges arise in a wide range of domains, including finance, logistics, and engineering, where decision-making must continuously adapt to evolving information and conditions. Reinforcement Learning (RL) -- a subfield of ML -- is particularly well-suited to these demands, as it excels at modeling sequential decision-making under uncertainty. In this thesis, we focus on applying RL methods to resource allocation tasks, with an emphasis on financial applications due to their practical relevance and research importance. Additionally, general resource allocation tasks are addressed, highlighting the broader applicability of the proposed approaches. A particular focus of this thesis is the integration of linear allocation constraints into the RL framework and the associated methodological challenges. To this end, three approaches are proposed for incorporating one, two, and an arbitrary number of linear constraints. These methods address key limitations of prior work, particularly regarding constraint satisfaction guarantees and empirical performance. The proposed approaches guarantee compliance with constraints while showing improved results in benchmark evaluations. Furthermore, this thesis presents a novel RL approach for deriving optimal investment strategies, which is a domain-specific resource allocation task, tailored to investors with varying levels of risk preference. The proposed approach generalizes across a continuous spectrum of risk preferences, significantly reducing training costs compared to other approaches. Empirical evaluations using real-world financial data demonstrate the strong performance of our approach across different investment scenarios, outperforming existing approaches.

Abstract

Fortschritte in Optimierungstechniken eröffnen neue Möglichkeiten zur Lösung bestehender Optimierungsprobleme. Dieser Fortschritt wird vor allem durch aktuelle Entwicklungen im Bereich des Machine Learning (ML) vorangetrieben, die auf einer verbesserten Datenlage, gesteigerten Rechenleistungen und einer erhöhten Bereitstellung von Forschungsmitteln beruhen. Ein prominentes Beispiel für ein bestehendes Optimierungsproblem ist die wichtige Klasse von Ressourcenallokationsaufgaben. Diese beinhalten die Verteilung begrenzter Ressourcen auf mehrere Entitäten -- häufig unter Berücksichtigung von Nebenbedingungen und in dynamischen, mehrperiodigen Entscheidungssituationen. Solche Aufgaben treten in einer Vielzahl von Anwendungsbereichen auf, etwa in der Finanzwirtschaft, der Logistik oder im Ingenieurwesen, wo Entscheidungsprozesse kontinuierlich an neue Informationen und sich verändernde Bedingungen angepasst werden müssen. Reinforcement Learning (RL) -- ein Teilbereich des Machine Learning -- eignet sich besonders gut für diese Anforderungen, da es auf die Modellierung sequentieller Entscheidungen unter Unsicherheit spezialisiert ist. Im Rahmen dieser Dissertation werden RL-Methoden zur Lösung von Ressourcenallokationsaufgaben untersucht, mit einem besonderen Fokus auf finanzwirtschaftliche Anwendungen aufgrund ihrer großen praktischen Relevanz und wissenschaftlichen Bedeutung. Darüber hinaus werden auch allgemeine Allokationsprobleme betrachtet, um die breite Anwendbarkeit der vorgeschlagenen Ansätze zu unterstreichen. Ein besonderer Schwerpunkt dieser Arbeit liegt auf der Integration linearer Allokationsnebenbedingungen in das RL-Framework sowie auf den damit verbundenen methodischen Herausforderungen. In diesem Zusammenhang werden drei Ansätze zur Integration von einer, zwei sowie einer beliebigen Anzahl linearer Nebenbedingungen vorgestellt. Diese Ansätze adressieren zentrale Schwächen bestehender Methoden, insbesondere im Hinblick auf die Einhaltung von Nebenbedingungen und der empirischen Leistungsergebnisse. Die vorgestellten Ansätze garantieren nicht nur die Einhaltung sämtlicher Nebenbedingungen, sondern übertreffen bestehende Verfahren auch deutlich in umfangreichen Benchmark-Evaluierungen. Darüber hinaus wird in dieser Arbeit eine neuartige RL-Methode zur Ableitung optimaler Portfolio-Investitionsstrategien vorgestellt, eine domänenspezifische Ressourcenallokationsaufgabe, die auf Investoren mit unterschiedlichen Risikopräferenzen zugeschnitten ist. Die vorgeschlagene Methode erlaubt eine Generalisierung über ein kontinuierliches Spektrum an Risikopräferenzen hinweg und reduziert dabei die Trainingskosten im Vergleich zu bestehenden Verfahren erheblich. Empirische Auswertungen mit realen Finanzmarktdaten belegen die starken Ergebnisse des vorgestellten Ansatzes in verschiedenen Investitionsszenarien gegenüber bestehenden Methoden.