マルチモーダルとは
一言でいうと
文章だけでなく、画像・音声・動画など複数の種類の情報をAIがまとめて扱えることです。
もう少し詳しく
マルチモーダルは「複数の形式」という意味で、AIが文章、画像、音声、動画などをまとめて理解したり作ったりできることを指します。最近の主要な生成AIの多くは、この能力を持つようになっています。
たとえば、写真を見せて「この部品の名前は?」と聞いたり、手書きのメモを撮影して清書してもらったりできます。音声で話しかけて、音声で答えてもらう使い方もこれにあたります。
文字を打つのが苦手な人や、現場で手がふさがっている人でも使いやすくなる点が、中小企業にとっての利点です。紙や写真を多く扱う業務ほど、AIを活用できる余地が広がります。
中小企業の仕事でいうと
現場で撮った設備の写真を見せて、点検報告書の下書きを作ってもらう、といった使い方ができます。
気をつけたいこと
画像や音声の読み取りにも誤りは起こります。数字や型番など重要な情報は人が確認しましょう。