Do LLMs Exhibit Human-like Response Biases? A Case Study in Survey DesignLindia Tjuatja, Graham Neubig, Tongshuang Wu et al.|Transactions of the Association for Computational Linguistics|2024Cited by 61
Beyond Accuracy: Behavioral Testing of NLP Models with CheckListMarco Túlio Ribeiro, Sameer Singh, Tongshuang Wu et al.|Unknown|2020Cited by 51
Bridging the Gap: A Survey on Integrating (Human) Feedback for Natural Language GenerationPatrick Fernandes, André F. T. Martins, Tongshuang Wu et al.|Transactions of the Association for Computational Linguistics|2023Cited by 37
Beyond Accuracy: Behavioral Testing of NLP Models with Checklist (Extended Abstract)Marco Túlio Ribeiro, Sameer Singh, Tongshuang Wu et al.|Unknown|2021Cited by 31