main banner

Rozwiązanie Data Science dla bankowości

LeverX zaprojektował i wdrożył rozwiązanie data science, które automatycznie rozpoznaje merchantów na podstawie danych o transakcjach kartowych i wzbogaca je o informacje dotyczące kategorii działalności, oferowanych produktów i usług oraz profilu ryzyka.

Spis treści:

Rozwiązanie do rozpoznawania sprzedawców oparte na uczeniu maszynowym.

Klient

Dostawca danych i analiz transakcyjnych dla banków europejskich 

Problem

Klient dostarcza bankom dane wykorzystywane między innymi do analizy zachowań klientów, segmentacji oraz podejmowania decyzji biznesowych. Jednym z problemów była ograniczona ilość informacji dostępnych w surowych danych o transakcjach kartowych.

Sam zapis transakcji nie zawsze pozwala jednoznacznie określić, kto jest merchantem, czym się zajmuje i jakie produkty lub usługi oferuje. Opisy mogą być skrócone, niejednolite i różnić się w zależności od banku czy rynku.

Dla dostawcy danych oznaczało to potrzebę stworzenia mechanizmu, który pozwoli automatycznie uzupełniać te informacje bez konieczności ręcznej analizy dużych wolumenów transakcji.

Celem projektu było więc opracowanie rozwiązania, które:

  • automatycznie identyfikuje i kategoryzuje merchantów,
  • wykorzystuje dodatkowe źródła informacji do zwiększenia jakości klasyfikacji,
  • rozpoznaje produkty i usługi oferowane przez merchantów,
  • dostarcza bankom bardziej szczegółowych danych do dalszej analizy,
  • może obsługiwać dane pochodzące z wielu instytucji finansowych i rynków.

Rozwiązanie

LeverX zaprojektował aplikację data science opartą na kilku współpracujących ze sobą modelach uczenia maszynowego. Każdy z nich odpowiada za inny element analizy danych.

Klasyfikacja merchantów:

Pierwszy model odpowiada za przypisanie merchanta do odpowiedniej kategorii działalności na podstawie dostępnych danych tekstowych. Do reprezentacji tekstu wykorzystano Doc2Vec z biblioteki Gensim, a także metodę TF-IDF. Za właściwą klasyfikację odpowiadała regresja logistyczna. Takie połączenie pozwoliło wykorzystać zarówno informacje wynikające z występowania określonych słów, jak i kontekst zawarty w opisach tekstowych.

Scoring stron internetowych

Drugim elementem rozwiązania jest model scoringowy analizujący strony internetowe powiązane z merchantami. Model wykorzystuje algorytmy XGBoost i LightGBM, a dobór hiperparametrów został zautomatyzowany za pomocą frameworka Optuna. Analiza URL stanowi dodatkowe źródło informacji, które może wspierać identyfikację profilu działalności merchanta oraz ocenę wiarygodności dostępnych danych.

Rozpoznawanie produktów i usług

Trzeci moduł odpowiada za identyfikację produktów i usług oferowanych przez danego merchanta. Został zaimplementowany w Pythonie z wykorzystaniem biblioteki NumPy i stanowi kolejne źródło informacji wykorzystywane w procesie wzbogacania danych.

Jeden pipeline przetwarzania danych

Trzy elementy zostały połączone w jeden spójny proces. Na wejściu rozwiązanie otrzymuje surowe dane dotyczące transakcji, a kolejne modele wzbogacają je o informacje dotyczące merchanta, jego kategorii działalności oraz oferowanych produktów i usług.

W efekcie powstaje bardziej uporządkowany zestaw danych, który może zostać przekazany do dalszego przetwarzania i analizy po stronie banku.

Szczegóły projektu

Firma Emerline była zaangażowana w opracowanie rozwiązania z zakresu nauki o danych, którego celem było dostarczenie europejskim bankom szczegółowych, skategoryzowanych informacji na temat korzystania z ich produktów — kart debetowych i kredytowych. Celem było stworzenie mechanizmu, który automatycznie wykrywałby cenne dla banków informacje o akceptantach na podstawie płatności klientów, a następnie dzieliłby te dane na kategorie. W ten sposób bank mógłby zidentyfikować swoich kluczowych akceptantów oraz uzyskać wgląd w zachowania klientów i związane z nimi ryzyko.

Nasz zespół był odpowiedzialny za stworzenie algorytmów uczenia maszynowego, które zapewniłyby ekstrakcję następujących danych:

  • Ocena adresów URL akceptantów na podstawie różnych kryteriów
  • Wydobywanie istotnych informacji
  • Rozpoznawanie produktów
  • Kategoryzacja sprzedawców według związanych z nimi ryzyk

Proces kategoryzacji musiał zostać opracowany zgodnie z listą kategorii dostarczoną przez klienta.

Kolejnym wyzwaniem była optymalizacja procesu oceny adresów URL w taki sposób, aby był on jak najbardziej zbliżony do sposobu, w jaki ludzie wybierają strony internetowe podczas wyszukiwania informacji.

 

Jak działa rozwiązanie?

Proces został zaprojektowany tak, aby warstwa data science mogła współpracować z istniejącymi systemami bankowymi bez konieczności przebudowy ich podstawowych mechanizmów transakcyjnych.

Przepływ danych wygląda następująco:

1. Transakcja kartowa
Klient banku dokonuje płatności kartą debetową lub kredytową.

2. Rejestracja transakcji
Informacje o transakcji trafiają do systemów bankowych.

3. Przekazanie danych do warstwy Data Science
Bank przekazuje dane do środowiska odpowiedzialnego za ich analizę.

4. Analiza i klasyfikacja
Modele ML rozpoznają merchanta, analizują dostępne informacje i przypisują odpowiednie kategorie oraz dodatkowe atrybuty.

5. Wzbogacone dane
Wyniki są przekazywane z powrotem do systemów bankowych i mogą zostać wykorzystane w dalszej analizie.

Takie rozdzielenie warstwy analitycznej od systemów bankowych pozwala rozwijać modele i skalować rozwiązanie bez konieczności ingerowania w podstawowe systemy transakcyjne.

Najważniejsze wyzwania techniczne

  • Niepełne i niespójne dane o merchantach
    Jednym z największych wyzwań była jakość danych wejściowych. Opisy transakcji mogą być krótkie, niejednolite i pozbawione informacji, które pozwalałyby bezpośrednio określić profil działalności merchanta.

Modele musiały więc skutecznie wykorzystywać dostępne dane tekstowe oraz dodatkowe źródła informacji.

  • Połączenie kilku modeli ML
    Klasyfikacja tekstu, scoring URL oraz rozpoznawanie produktów to różne zadania wymagające odmiennych metod analizy. Istotnym elementem projektu było połączenie ich w jeden spójny pipeline, w którym wynik jednego etapu może stanowić dodatkową informację dla kolejnych elementów procesu.

  • Niezbalansowane dane
    W danych transakcyjnych poszczególne kategorie merchantów nie występują z taką samą częstotliwością. Niektóre branże są reprezentowane znacznie częściej niż inne. Dlatego ważnym elementem prac było odpowiednie strojenie modeli. Do automatyzacji procesu doboru hiperparametrów wykorzystano framework Optuna.

  • Skalowanie na wiele rynków
    Rozwiązanie zostało zaprojektowane z myślą o danych pochodzących od wielu instytucji finansowych działających na różnych rynkach europejskich. Wymagało to uwzględnienia różnic w formatach i jakości danych oraz zaprojektowania procesu, który może pracować na dużych i zróżnicowanych zbiorach danych.

Technologie wykorzystane w projekcie

  • Python – język programowania wykorzystany do implementacji warstwy przetwarzania danych.

  • Gensim – biblioteka wykorzystana między innymi do tworzenia reprezentacji tekstowych.

  • Doc2Vec – metoda reprezentacji dokumentów w postaci wektorów, wykorzystana w klasyfikacji tekstu.

  • TF-IDF – metoda określania znaczenia słów w dokumentach, wykorzystana jako element procesu klasyfikacji.

  • Regresja logistyczna – model klasyfikacyjny wykorzystany do przypisywania merchantów do kategorii działalności.

  • XGBoost – algorytm gradient boosting wykorzystany w modelu scoringowym.

  • LightGBM – biblioteka gradient boosting zoptymalizowana pod kątem wydajnego trenowania modeli na dużych zbiorach danych.

  • Optuna – framework wykorzystany do automatycznej optymalizacji hiperparametrów modeli.

  • NumPy – biblioteka Python wykorzystywana do obliczeń numerycznych i przetwarzania danych. 

Top Firms

TOP Software Development Companies

Dedykowane tworzenie oprogramowania
Przyspiesz cyfrową transformację dzięki dedykowanym rozwiązaniom programistycznym LeverX. Tworzymy aplikacje dopasowane do specyfiki Twojej firmy i jej potrzeb biznesowych.
Dowiedz się więcej

Wyniki

Wdrożone rozwiązanie pozwoliło zautomatyzować proces wzbogacania danych transakcyjnych i dostarczać klientowi bardziej szczegółowych informacji o merchantach.

  • Automatyzacja analizy danych. Proces, który wcześniej wymagał dodatkowej analizy danych, został przeniesiony do zautomatyzowanego pipeline’u opartego na modelach uczenia maszynowego.

  • Więcej informacji o merchantach. Dane transakcyjne zostały wzbogacone o informacje dotyczące kategorii działalności merchantów oraz oferowanych przez nich produktów i usług.

  • Dodatkowy sygnał do analizy ryzyka. Informacje dotyczące profilu merchanta mogą stanowić dodatkowy element wykorzystywany przez banki w analizie ryzyka i zachowań klientów.

  • Możliwość dalszego skalowania. Warstwa data science została oddzielona od podstawowych systemów transakcyjnych banku. Dzięki temu rozwiązanie może być rozwijane i dostosowywane do kolejnych źródeł danych oraz instytucji finansowych.

  • Większa wartość danych dostarczanych bankom. Dla klienta możliwość dostarczania bardziej szczegółowych i uporządkowanych informacji zwiększyła wartość danych wykorzystywanych przez jego odbiorców.

Potrzebujesz rozwiązania Data Science dla sektora finansowego?

LeverX projektuje rozwiązania wykorzystujące uczenie maszynowe i analizę danych, które można zintegrować z istniejącym środowiskiem IT. Porozmawiajmy o tym, jak podejście oparte na Data Science może wesprzeć procesy w Twojej organizacji.

Skontaktuj się z ekspertami LeverX

Więcej projektów