Liczba wyprostowanych palców ustawia poziom: akapit, zdanie albo słowo. Ruch dłoni przewija zaznaczenie w obrębie tego poziomu — nigdy nie celujesz w konkretne słowo, więc drganie trackingu nie ma znaczenia. Obraz z kamery zostaje w przeglądarce.