Instruction Following

Instruction following is the basic task of the model. This task is dedicated to evaluating the ability of the large model to follow human instructions. It is hoped that the model can generate controllable and safe answers.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 976–1000 of 1135 papers

Title	Date	Tasks	Status
ThinkBot: Embodied Instruction Following with Thought Chain Reasoning	Dec 12, 2023	Instruction Following	—Unverified
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following	Dec 11, 2023	DecoderInstruction Following	CodeCode Available
Aligner: One Global Token is Worth Millions of Parameters When Aligning Large Language Models	Dec 9, 2023	Instruction Followingparameter-efficient fine-tuning	—Unverified
Localized Symbolic Knowledge Distillation for Visual Commonsense Models	Dec 8, 2023	Image DescriptionInstruction Following	CodeCode Available
Text as Image: Learning Transferable Adapter for Multi-Label Classification	Dec 7, 2023	image-classificationImage Classification	—Unverified
MUFFIN: Curating Multi-Faceted Instructions for Improving Instruction-Following	Dec 5, 2023	Instruction Following	—Unverified
InstructBooth: Instruction-following Personalized Text-to-Image Generation	Dec 4, 2023	Image GenerationInstruction Following	—Unverified
MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation	Dec 4, 2023	Instruction FollowingLanguage Modeling	—Unverified
FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity	Nov 30, 2023	FairnessInstruction Following	CodeCode Available
Towards Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs	Nov 27, 2023	Instruction Followingmultimodal generation	—Unverified
Releasing the CRaQAn (Coreference Resolution in Question-Answering): An open-source dataset and dataset creation methodology using instruction-following models	Nov 27, 2023	Chunkingcoreference-resolution	—Unverified
GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation	Nov 25, 2023	Instruction FollowingLanguage Modeling	—Unverified
LIMIT: Less Is More for Instruction Tuning Across Evaluation Paradigms	Nov 22, 2023	Instruction Following	—Unverified
Data Diversity Matters for Robust Instruction Tuning	Nov 21, 2023	DiversityInstruction Following	—Unverified
RecExplainer: Aligning Large Language Models for Explaining Recommendation Models	Nov 18, 2023	Explanation GenerationInstruction Following	—Unverified
Traffic Sign Interpretation in Real Road Scene	Nov 17, 2023	Instruction FollowingMulti-Task Learning	—Unverified
FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models	Nov 16, 2023	Instruction FollowingLogical Reasoning	—Unverified
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination	Nov 16, 2023	Instruction FollowingLanguage Modelling	—Unverified
WatME: Towards Lossless Watermarking Through Lexical Redundancy	Nov 16, 2023	Instruction FollowingLanguage Modelling	—Unverified
MAP's not dead yet: Uncovering true language model modes by conditioning away degeneracy	Nov 15, 2023	Instruction FollowingLanguage Modeling	—Unverified
Can Query Expansion Improve Generalization of Strong Cross-Encoder Rankers?	Nov 15, 2023	Instruction FollowingLanguage Modelling	—Unverified
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities	Nov 15, 2023	EthicsFairness	CodeCode Available
How You Prompt Matters! Even Task-Oriented Constraints in Instructions Affect LLM-Generated Text Detection	Nov 14, 2023	Instruction FollowingLarge Language Model	CodeCode Available
Generalization Analogies: A Testbed for Generalizing AI Oversight to Hard-To-Measure Domains	Nov 13, 2023	Instruction Following	CodeCode Available
MART: Improving LLM Safety with Multi-round Automatic Red-Teaming	Nov 13, 2023	Instruction FollowingRed Teaming	—Unverified

Show:10 25 50

← PrevPage 40 of 46Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	AutoIF (Llama3 70B)	Inst-level loose-accuracy	90.4	—	Unverified
2	AutoIF (Qwen2 72B)	Inst-level loose-accuracy	88	—	Unverified
3	GPT-4	Inst-level loose-accuracy	85.37	—	Unverified
4	PaLM 2 S	Inst-level loose-accuracy	59.11	—	Unverified