Space-Time Attentionを用いた動画理解機構に基づくEnd-to-Endマルチモーダル対話応答生成

山﨑 善啓

17:40 〜 18:00

[1O5-GS-7-05] Space-Time Attentionを用いた動画理解機構に基づくEnd-to-Endマルチモーダル対話応答生成

〇山﨑善啓¹、折橋翔太¹、増村亮¹、内田美尋¹、高島瑛彦¹ (1. 日本電信電話株式会社, NTTコンピュータ&データサイエンス研究所)

[[オンライン]]

キーワード：マルチモーダル対話、動画理解、End-to-End応答生成

マルチモーダル対話システムの研究タスクとして、Audio Visual Scene-aware Dialog (AVSD)と呼ばれる与えられた音響・動画像情報に関する質問応答を行うタスクが挙げられる。AVSDに関する従来のモデルの多くは、動画像内容の理解のためにConvolutional Neural Network (CNN)に基づく動画像表現を用いて応答を生成している。CNNは時空間方向に局所的な特徴抽出を行う傾向にあるといわれている一方で、時間的に広い依存性や空間的に大域的な特徴もAVSDのモデルには必要であると考えられる。本研究では、時空間方向に大域的な表現を獲得しやすいといわれているTransformerに基づく動画像表現を用いたニューラル応答生成モデルを提案する。応答性能を評価した結果、本手法はCNNに基づく動画像表現を用いた従来法に比べて、より高い客観評価値が得られることを示した。

講演PDFパスワード認証
論文PDFの閲覧にはログインが必要です。参加登録者の方は「参加者用ログイン」画面からログインしてください。あるいは論文PDF閲覧用のパスワードを以下にご入力ください。

講演情報

[1O5-GS-7] 画像音声メディア処理：分類・生成

[1O5-GS-7-05] Space-Time Attentionを用いた動画理解機構に基づくEnd-to-Endマルチモーダル対話応答生成

パスワード