Spis treści
Narzędzia do automatyzacji notatek ze spotkań opierają się zazwyczaj na module transkrypcji mowy na tekst, który przetwarza dźwięk ze spotkania w czasie rzeczywistym lub na podstawie nagrania po jego zakończeniu.
Po zakończeniu transkrypcji asystent AI generuje zwięzłe podsumowanie najważniejszych wątków rozmowy, wyodrębniając kluczowe tematy oraz decyzje podjęte w trakcie spotkania.
Typowe podsumowanie zawiera listę omawianych tematów, zidentyfikowane decyzje oraz — w wielu narzędziach — listę zadań przypisanych poszczególnym uczestnikom wraz z terminami realizacji, o ile zostały one wspomniane podczas spotkania.
Niektóre narzędzia potrafią automatycznie rozpoznawać fragmenty rozmowy wskazujące na przydzielenie konkretnego zadania danej osobie, tworząc na tej podstawie listę działań do wykonania po spotkaniu.
Jakość transkrypcji zależy od czynników takich jak jakość dźwięku, liczba osób mówiących jednocześnie oraz specyficzne słownictwo branżowe. W przypadku języka polskiego rozpoznawanie mowy może napotykać dodatkowe trudności związane ze specyfiką fonetyczną i gramatyczną języka.
Zależy to od konfiguracji konkretnego narzędzia oraz polityki organizacji — część rozwiązań umożliwia usunięcie nagrania audio po wygenerowaniu transkrypcji.
Jakość rozpoznawania mowy różni się w zależności od języka — języki o mniejszej liczbie danych treningowych, w tym niektóre języki słowiańskie, mogą wykazywać niższą dokładność transkrypcji.