To, co v řeči zaznívá mezi řádky — tón hlasu, emoce, důraz nebo výška hlasu. Audio modely často berou slova příliš doslova a tyhle signály jim unikají, takže nepoznají sarkasmus, naštvání ani nadšení. Studie univerzity USC ukázala, že v tomhle zvukové modely zaostávají za textovými, i když se dají technikami výrazně zlepšit.